跳到正文
10月8日周四
  1. arXiv cs.CY70

    arXiv 论文审计 LLM 生成数学应用题跨语言文化翻译的一致性

    该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。

    推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。

  2. arXiv cs.CY50

    双建议与单建议 AI 辅助放射影像判读对住院医师的影响:随机多读者研究

    一项在中国三家医院进行的随机多读者研究显示,双建议 AI 支持能更有效地缓解错误 AI 建议的影响。放射科住院医师在双建议支持下的准确率提升显著高于单建议组,而非放射科住院医师无显著差异。当 GPT-5.4 建议错误时,双建议组(含 Kimi-K2.6 或 Gemini-3.6 Flash)的准确率显著高于单建议组。

10月7日周三
  1. Frontiers in Education52

    基于 AI 分析与专家评估同步的编程知识多因子评估模型研究

    该研究针对生成式 AI 普及带来的编程评估挑战,提出包含功能正确性、解释质量和 AI 使用水平的多因子评估模型。研究涉及哈萨克斯坦三所大学 187 名本科生,对比了 GPT-5.2、Claude Opus 4.5 和 Gemini 3 在基线(仅功能正确性)和多因子条件下的评估结果。

  2. arXiv cs.CL78

    K12-KGraph:面向教育大模型评测与训练的课标对齐知识图谱

    研究团队提出 K12-KGraph,一个从人教版数学、物理、化学、生物教材中提取的课程对齐知识图谱,涵盖 9 种节点和 14 种关系。基于该图谱构建了包含 23,640 道多选题的 K12-Bench 基准和 7,335 个样本的 K12-Train 微调数据集。

    推荐理由:该研究构建了基于人教版教材的知识图谱与评测基准,揭示了当前大模型在课程认知上的短板及微调改进路径。

  3. arXiv cs.CL55

    arXiv 论文:通过多轮强化学习解决 LLM 教学中的协助困境

    研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。

10月5日周一
  1. Frontiers in Education42

    教师教育中 AI 与 UDL 的结合:为学习者差异设计包容性学习

    一项针对 45 名摩洛哥英语作为外语(EFL)职前教师的准实验研究显示,接受 UDL 结合 AI 工具培训组的课后教案评分显著高于对照组及仅接受 UDL 培训组。该研究指出,AI 工具有助于教师设计更具包容性的教学,但现有证据无法单独隔离 AI 的贡献,且结果受限于单一机构及评分标准。

5月19日周二
11月24日周一
11月10日周一
  1. IJAIED · AI 在教育中的应用65

    LLM 作为协作学习伙伴:一项关于大学生论证写作能力的探索性研究

    该研究在卡内基梅隆大学的一门社会科学入门课程中,让 154 名大学生在学期内五次完成“写作-LLM 批判-修改”的协作任务。结果显示,学生的论证写作、提示词工程及回应反馈能力均显著提升,且对 LLM 协作持积极态度。

    推荐理由:研究展示了 LLM 协作写作对大学生论证能力的提升效果,为课堂设计提供了可参考的实证依据。