跳到正文
arXiv cs.CL· Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang·· 1 天前精选AI 评分70

Sherpa:通过多轮强化学习训练LLM自适应教学

Sherpa: Teaching LLMs to Teach Adaptively

AI 导读

研究提出Sherpa框架,利用多轮强化学习训练LLM教师,使其能根据模拟学生的不同学习偏好自适应调整教学策略。实验显示,Sherpa训练的教师模型使所有类型模拟学生的平均成绩提升20.5个百分点,在MathTutorBench评估中教学法得分从52.5%提升至79.2%,且在人类偏好测试中79.6%的情况下优于基础模型。

推荐理由

提出Sherpa框架,通过多轮强化学习让LLM教师适应不同学习偏好的模拟学生,显著提升教学效果。

来源:arXiv cs.CL · arxiv.org