arXiv cs.CL· Jakub Macina, Manu Kapur, Mrinmaya Sachan·· 3 天前AI 评分55
arXiv 论文:通过多轮强化学习解决 LLM 教学中的协助困境
The Assistance Dilemma: Learning to Teach via Multi-Turn Reinforcement Learning
AI 导读
研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。
来源:arXiv cs.CL · arxiv.org