|
Download README.md from moe-dtoks/llama_onto_qwen_lambda-0: direct link, hf CLI and curl.
- Browser
- Download file 867 Bytes
-
https://huggingface.co/moe-dtoks/llama_onto_qwen_lambda-0/resolve/main/README.md
- Command line
-
hf download hf://moe-dtoks/llama_onto_qwen_lambda-0/README.md
-
curl -L -o README.md https://huggingface.co/moe-dtoks/llama_onto_qwen_lambda-0/resolve/main/README.md
867 Bytes
metadata
license: mit
host_model:
- toksuite/Qwen-Qwen3-8B
- toksuite/meta-llama-Llama-3.2-1B
tags:
- merge
- parameter-averaging
- flexitok
Merged Model: llama_onto_qwen_lambda-0
This model is a result of parameter averaging (Model Soup) across 2 models.
Merged Models
The following models were included in the merge:
- toksuite/Qwen-Qwen3-8B
- toksuite/meta-llama-Llama-3.2-1B
Merging Configuration
- Method: Weighted Parameter Averaging
- Weights: Simple average with merging lambda = 0.0.
- Excluded Layers: Embeddings and LM Head were kept from the host model (toksuite/Qwen-Qwen3-8B).
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("moe-dtoks/llama_onto_qwen_lambda-0")
tokenizer = AutoTokenizer.from_pretrained("moe-dtoks/llama_onto_qwen_lambda-0")