diff --git a/conversion/muse_glimmer.py b/conversion/muse_glimmer.py index 54a3adc36e..59ca6130bf 100644 --- a/conversion/muse_glimmer.py +++ b/conversion/muse_glimmer.py @@ -172,6 +172,8 @@ class MuseGlimmerAssistantModel(TextModel): self.gguf_writer.add_sliding_window_pattern([t == "sliding_attention" for t in h["layer_types"]]) def modify_tensors(self, data_torch: Tensor, name: str, bid: int | None) -> Iterable[tuple[str, Tensor]]: - # DFlash defaults to NEOX (rotate_half) rope, matching transformers HF layout for Q/K, QK-norms - # no permutation needed. + if name == "encoder.fc.weight": + name = "model.fc.weight" + elif name == "encoder.output_norm_enc.weight": + name = "model.hidden_norm.weight" yield (self.map_tensor_name(name), data_torch) diff --git a/gguf-py/gguf/tensor_mapping.py b/gguf-py/gguf/tensor_mapping.py index 50c9ac7abc..67ee4b54df 100644 --- a/gguf-py/gguf/tensor_mapping.py +++ b/gguf-py/gguf/tensor_mapping.py @@ -1298,12 +1298,10 @@ class TensorNameMap: "encoder.final_layer_norm", # t5 "layer_norm", # neobert "model.hidden_norm", # dflash - "encoder.output_norm_enc", # dflash (transformers MuseGlimmerAssistant) ), MODEL_TENSOR.FC: ( - "model.fc", # dflash - "encoder.fc", # dflash (transformers MuseGlimmerAssistant) + "model.fc", # dflash ), MODEL_TENSOR.DSPARK_MARKOV_W1: (