dim sum paper
arxiv.org · 6,202 words · saved by 1 readers
N/A
Impossible Distillation for Paraphrasing and Summarization: How to Make High-quality Lemonade out of Small, Low-quality Models Jaehun Jung† Peter West† Liwei Jiang† Faeze Brahman†‡ Ximing Lu† Jillian Fisher† Taylor Sorensen† Yejin Choi†‡ † Paul G. Allen School of Computer Science & Engineering, University of Washington…
saved by
related reading
- On-Policy Distillation - Thinking Machines Labthinkingmachines.ai
- LLM Optimization via Synthetic Distillationanarchyai.substack.com
- Patterns for Building LLM-based Systems & Productseugeneyan.com
- Fixing LLM Writing with Distribution Fine-Tuningdeftwriting.com
- GenAI Handbookgenai-handbook.github.io
- LLMs can invent their own compression - Rajan Agarwalrajan.sh
- Efficient LLM inferencefinbarrtimbers.substack.com
- Getting Caught Up to Modern LLM Research | Samarth Goeldev.samarthgoel.com
- [2005.14165] Language Models are Few-Shot Learnersarxiv.org
- Productizing Large Language Modelsblog.replit.com
- [2601.18734] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Modelsarxiv.org
- [2604.01193] Embarrassingly Simple Self-Distillation Improves Code Generationarxiv.org