Qwen2.5-7B LogicReasoning (LoRA SFT)
Fine-tuned from Qwen/Qwen2.5-7B-Instruct on a DAG-based logical reasoning dataset (21,273 NLI samples).
Benchmark Results
| Benchmark |
This model |
Baseline |
| FOLIO |
57.35% |
~50% |
| LogiQA2 |
54.58% |
~42% |
| BBH |
57.20% |
~39% |
| AGIEval-LR |
62.35% |
~48% |
| Multi-LogiEval PL |
73.71% |
— |