Mode-Conditioning Unlocks Superior Test-Time Scaling
arxiv.org · 7,295 words · saved by 1 readers
N/A
Preprint Mode-Conditioning Unlocks Superior Test-Time Scaling Chen Henry Wu, Sachin Goyal, Aditi Raghunathan Carnegie Mellon University # {chenwu2,sachingo,aditirag}@cs.cmu.edu Ð https://github.com/AR-FORUM/modc https://ar-forum.github.io/mod-c/ arXiv:2512.01127v1 [cs.LG] 30 Nov 2025…
saved by
related reading
- [2501.19393] s1: Simple test-time scalingarxiv.org
- Composer2.pdfcursor.com
- Weight Ensembling Improves Reasoning in Language Modelsarxiv.org
- MAI-Thinking-1: Building a Hill-Climbing Machinemicrosoft.ai
- On neural scaling and the quanta hypothesisericjmichaud.com
- IsoCompute Playbook: Optimally Scaling Sampling Compute for RL Training of LLMscompute-optimal-rl-llm-scaling.github.io
- frontier model training methodologies | Alex Wa's Blogdjdumpling.github.io
- Optimizing LLM Test-Time Compute Involves Solving a Meta-RL Problem – Machine Learning Blog | ML@CMU | Carnegie Mellon Universityblog.ml.cmu.edu
- The State of LLM Reasoning Model Inferencesebastianraschka.com
- MAI-Thinking-1: Building a Hill-Climbing Machinemicrosoft.ai
- The Extreme Inefficiency of RL for Frontier Models - Toby Ordtobyord.com
- o1 and Reasoning | AndoLogsblog.ando.ai