跳到正文
10月8日周四
  1. arXiv cs.CY70

    arXiv 论文审计 LLM 生成数学应用题跨语言文化翻译的一致性

    该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。

    推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。

10月7日周三
  1. Frontiers in Education52

    基于 AI 分析与专家评估同步的编程知识多因子评估模型研究

    该研究针对生成式 AI 普及带来的编程评估挑战,提出包含功能正确性、解释质量和 AI 使用水平的多因子评估模型。研究涉及哈萨克斯坦三所大学 187 名本科生,对比了 GPT-5.2、Claude Opus 4.5 和 Gemini 3 在基线(仅功能正确性)和多因子条件下的评估结果。

  2. arXiv cs.CL55

    arXiv 论文:通过多轮强化学习解决 LLM 教学中的协助困境

    研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。

  3. GitHub · AI in 教育23

    melanie-ldi/genai-irr-calculator:基于浏览器的 GenAI 证据库 IRR 计算器

    melanie-ldi/genai-irr-calculator 是一个基于浏览器的评分者间信度(IRR)计算器,专为 GenAI 证据库系统文献综述设计。该工具以单文件 HTML 形式运行,无需安装,所有计算均在客户端完成。它支持上传 .csv、.xlsx 等编码表,自动检测版本并计算 Krippendorff's α,结果可导出为 CSV 或 Excel。

10月5日周一
  1. Frontiers in Education42

    教师教育中 AI 与 UDL 的结合:为学习者差异设计包容性学习

    一项针对 45 名摩洛哥英语作为外语(EFL)职前教师的准实验研究显示,接受 UDL 结合 AI 工具培训组的课后教案评分显著高于对照组及仅接受 UDL 培训组。该研究指出,AI 工具有助于教师设计更具包容性的教学,但现有证据无法单独隔离 AI 的贡献,且结果受限于单一机构及评分标准。

11月10日周一
  1. IJAIED · AI 在教育中的应用65

    LLM 作为协作学习伙伴:一项关于大学生论证写作能力的探索性研究

    该研究在卡内基梅隆大学的一门社会科学入门课程中,让 154 名大学生在学期内五次完成“写作-LLM 批判-修改”的协作任务。结果显示,学生的论证写作、提示词工程及回应反馈能力均显著提升,且对 LLM 协作持积极态度。

    推荐理由:研究展示了 LLM 协作写作对大学生论证能力的提升效果,为课堂设计提供了可参考的实证依据。