跳到正文
10月8日周四
  1. arXiv cs.CY70

    arXiv 论文审计 LLM 生成数学应用题跨语言文化翻译的一致性

    该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。

    推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。

10月7日周三
  1. arXiv cs.CL78

    K12-KGraph:面向教育大模型评测与训练的课标对齐知识图谱

    研究团队提出 K12-KGraph,一个从人教版数学、物理、化学、生物教材中提取的课程对齐知识图谱,涵盖 9 种节点和 14 种关系。基于该图谱构建了包含 23,640 道多选题的 K12-Bench 基准和 7,335 个样本的 K12-Train 微调数据集。

    推荐理由:该研究构建了基于人教版教材的知识图谱与评测基准,揭示了当前大模型在课程认知上的短板及微调改进路径。

10月5日周一
  1. arXiv cs.CY68

    基于 LLM 的对话式 TTS 课程生成系统教育潜力探索性研究

    该研究提出一种结合 LLM 与 TTS 的半自动对话式课程生成系统,并通过 245 名高中生的准实验考察其教育潜力。结果显示,对话式 TTS 在理解(p=.006)和认知投入(p=.019)上显著优于单声 TTS,且 66.9% 的学员认为对话格式最有趣,但单声 TTS 在音频自然度上表现更好。

    推荐理由:研究通过准实验验证了对话式 TTS 在理解与认知投入上的优势,为 AI 辅助课件生成提供了实证依据。

9月26日周六