RPTune: Learned Context Curation for LLM Catalog Search Paper • 2610.00964 • Published 10 days ago • 39
VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering Paper • 2609.19879 • Published 24 days ago • 33
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published Sep 9 • 29
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness Paper • 2609.08183 • Published Sep 8 • 321
Using Grounded Theory for Agent Behavior Analysis at Scale Paper • 2608.30391 • Published Aug 31 • 19