跳到正文
10月7日周三
  1. arXiv cs.CL78

    K12-KGraph:面向教育大模型评测与训练的课标对齐知识图谱

    研究团队提出 K12-KGraph,一个从人教版数学、物理、化学、生物教材中提取的课程对齐知识图谱,涵盖 9 种节点和 14 种关系。基于该图谱构建了包含 23,640 道多选题的 K12-Bench 基准和 7,335 个样本的 K12-Train 微调数据集。

    推荐理由:该研究构建了基于人教版教材的知识图谱与评测基准,揭示了当前大模型在课程认知上的短板及微调改进路径。

  2. arXiv cs.CL55

    arXiv 论文:通过多轮强化学习解决 LLM 教学中的协助困境

    研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。

  3. arXiv cs.CL40

    AI 赋能选择题质量保障:自动化缺陷检测与评估综述

    该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。

  4. GitHub · AI in 教育23

    melanie-ldi/genai-irr-calculator:基于浏览器的 GenAI 证据库 IRR 计算器

    melanie-ldi/genai-irr-calculator 是一个基于浏览器的评分者间信度(IRR)计算器,专为 GenAI 证据库系统文献综述设计。该工具以单文件 HTML 形式运行,无需安装,所有计算均在客户端完成。它支持上传 .csv、.xlsx 等编码表,自动检测版本并计算 Krippendorff's α,结果可导出为 CSV 或 Excel。

10月6日周二
  1. Frontiers in Education42

    AI 介入高校课堂中教师与 AI 智能体沟通的迷你综述:基于互补-替代轴

    基于 2023 年后 32 项同行评审研究的迷你综述指出,教师沟通行为仍显著预测学生结果,元分析显示中到大效应量(r = 0.443)。学生使用人类沟通类别评估 AI 智能体,但在善意维度存在系统性差距,需通过即时性和礼貌线索弥补。当 AI 替代人际互动时,会引发孤独感和归属感下降等负面结果。

  2. Frontiers in Education33

    麻醉教育中人工智能作为建构主义支架:迷你综述

    该迷你综述基于建构主义学习理论,将人工智能定位为麻醉教育中需随学习者表现调整并逐步撤除的临时支架,而非自主教师。现有麻醉特异性研究在区域麻醉训练、超声解读及虚拟患者等场景展示了可行性,但尚未证实能提升临床推理或胜任力。AI生成的反馈与评分应视为有缺陷的决策支持,不得独立用于总结性评估或授权。

10月5日周一
  1. arXiv cs.CY42

    LLMersion:面向教育公平的本地优先低成本家庭语言学习 AI 智能体框架

    论文提出 LLMersion 框架,一种完全在本地运行的 AI 智能体方案,旨在通过低成本家庭语言学习促进教育公平。该框架利用小型开源权重模型,使完整的听、说、读、写四项技能栈能运行在约 200 美元级别的笔记本电脑上,且每小时学习电费仅约 1 美分。作者已发布开源原型 LLMersion-1 及配套工具 LLMersion Narrator。

  2. arXiv cs.CY45

    数据标注作为教学提示:从主观标签到批判性思维

    荷兰 Fontys 和丹麦 IT University Copenhagen 的研究表明,手动数据标注任务能有效提升学生对标注主观性的理解。43 名参与者在标注皮肤病变图像后,对偏见和公平性的理解优于传统讲座。尽管存在情感不适,该活动仍被证实能帮助学生认识到人类判断对模型行为的影响。

  3. arXiv cs.CY68

    基于 LLM 的对话式 TTS 课程生成系统教育潜力探索性研究

    该研究提出一种结合 LLM 与 TTS 的半自动对话式课程生成系统,并通过 245 名高中生的准实验考察其教育潜力。结果显示,对话式 TTS 在理解(p=.006)和认知投入(p=.019)上显著优于单声 TTS,且 66.9% 的学员认为对话格式最有趣,但单声 TTS 在音频自然度上表现更好。

    推荐理由:研究通过准实验验证了对话式 TTS 在理解与认知投入上的优势,为 AI 辅助课件生成提供了实证依据。

  4. arXiv cs.CY28

    LearnAdapt Praxis:面向成人职场学习的受控 AI 辅助与证据追踪系统

    LearnAdapt Praxis 提出包含 Frame 至 Transfer 五阶段的学习工作区,通过项目级服务器控制限制辅助访问并存储版本化规范与验证观察。可复现的合成演练执行了 120 个串行项目集,3,990 项检查均符合预期,60 次注入故障未产生伪造提示。该报告验证了系统架构的工程属性,但未确立学习增益或模型输出质量。

  5. Frontiers in Education42

    教师教育中 AI 与 UDL 的结合:为学习者差异设计包容性学习

    一项针对 45 名摩洛哥英语作为外语(EFL)职前教师的准实验研究显示,接受 UDL 结合 AI 工具培训组的课后教案评分显著高于对照组及仅接受 UDL 培训组。该研究指出,AI 工具有助于教师设计更具包容性的教学,但现有证据无法单独隔离 AI 的贡献,且结果受限于单一机构及评分标准。

  6. Frontiers in Education42

    教师数字能力发展中自我调节学习的作用——系统文献综述

    一项涵盖2009至2023年间17项研究的系统文献综述表明,元认知是连接教师专业数字能力与自我调节学习的关键机制。个性化学习环境及元认知支架等技术支持系统有助于教师以自我调节方式发展数字能力。研究强调,自我调节学习需辅以协作学习和以学习者为中心的创新课堂形式,如启发式教学法,以提升教师教育效果。

  7. Frontiers in Education26

    拉脱维亚教育专业人员视角下的教育可持续数字化

    一项针对拉脱维亚教育专业人员的定性研究揭示了“数字可持续性”的认知现状。研究发现,教师普遍将数字技术视为外部强加的不可避免因素,而非基于专业信念的教学选择。此外,相关实践多聚焦于孤立项目,缺乏系统性的长期战略,且存在机构驱动数字化与可持续性考量之间的张力。

  8. ETR&D 教育技术研究与发展65

    学习分析个性化反馈对大型入门 STEM 课程学生行为影响的实验研究

    一项针对 700 多名学生的随机对照实验表明,基于学习分析的个性化反馈能显著促进大学生更早开始作业并增加尝试练习题的比例,但未带来考试成绩或最终成绩的提升。实验组学生在干预阶段开始作业的时间平均比对照组早半天,且 91% 的学生尝试了练习题,高于对照组的 82%。尽管实验组的 D/F 率(2.5%)低于对照组(4.7%),但该差异未达统计显著性,且两组学生对反馈有用性和激励性的感知无显著差异。

    推荐理由:研究通过随机对照实验量化了个性化反馈对行为启动与学业成绩的影响差异,为大规模课程中的反馈设计提供了实证依据。

  9. Frontiers in Education42

    马来西亚高校教师视角下 AI 时代学生评估重构的质性研究

    针对马来西亚 18 名高校教师的质性研究揭示了 AI 对学生评估的重构影响。研究发现 AI 使用导致教师工作量增加,迫使教师角色向“学术质量守门人”转变,并引发专业身份张力。教师普遍采取适应性教学、重新设计评估及寻求机构支持等策略,以应对学术诚信挑战并推动 AI 治理。

10月3日周六
  1. GitHub · AI in 教育35

    CLEAR-Mem v0.1.0 发布:LLM 辅导系统学习者状态记忆参考实现

    CLEAR-Mem v0.1.0 作为首个私有发布候选版本,提供了 LLM 辅导系统中学习者状态记忆的参考实现。该工具将学习者判断表示为独立可审查的声明,控制其进入持久记忆的权限及后续证据对声明的确认或修正。配套基准 LSS-Bench 用于测试记忆是否导致教育上不合理的变更,项目采用 Apache License 2.0 许可。

10月2日周五
9月30日周三
  1. EdSurge70

    EdReports 报告:10 家 K-12 教育科技供应商中仅 1 家提供 AI 功能有效性的第三方证据

    EdReports 发布新简报,审查了 10 家 K-12 课程及教育科技供应商。结果显示,仅有一家供应商包含证明其嵌入的 AI 功能能改善教育成果的第三方证据。

    推荐理由:EdReports 对 10 家 K-12 教育科技供应商的审查显示,仅一家提供了嵌入 AI 功能提升教育成果的第三方证据。

  2. 电化教育研究35

    数字化促进中国教育现代化:逻辑理路、模型构建及实践进路

    华南师范大学团队基于生态系统理论,构建了数字化促进中国教育现代化的生态模型。该模型以公平、优质、全面、和谐、开放为价值追求,由时间系统贯穿微、中、外、宏系统,分别形成“学习—教学—评价”融合、“学校—家庭—社会”协同及“供给—教研—标准”耦合机制。研究进而提出以动态评估、文化融合、标准建设、场景创新和人才发展为保障的实践进路,旨在提供系统化的学理框架与行动路径。

9月29日周二
  1. EdSurge · AI71

    EdReports 研究:教育科技厂商在证明 AI 有效前匆忙整合

    EdReports 发布简报指出,10 家 K-12 课程与教育科技供应商中仅 1 家提供了第三方证据,证明其嵌入的 AI 功能能改善教育成果。研究强调,后台 AI 更新使学校难以确保产品效力,且现有框架缺乏评估 AI 是否增强学习的一致方法。专家建议学校要求供应商提供具体数据,并关注 AI 更新的教学决策属性。

    推荐理由:报告揭示了K-12教育科技产品中AI功能缺乏实证支持的现状,为采购决策提供了关键的质量评估视角。

9月28日周一
  1. UNESCO IITE63

    UNESCO IITE 发布《教师 AI 能力框架》分析报告

    UNESCO IITE 发布《教师 AI 能力框架》分析报告,系统分析了 36 个来自国家教育主管部门、国际政策组织和学术界的教师 AI 能力框架。报告探讨了 AI 素养、实施场景及评估方法,并基于证据提出了设计国家级教师 AI 能力框架的建议,旨在促进高质量、课程对齐的教师 AI 能力发展。

    推荐理由:报告系统分析了 36 个教师 AI 能力框架,为各国设计高质量教师 AI 发展体系提供了实证依据。

  2. 欧盟委员会教育总司42

    欧盟委员会发布 PISA 2025 首批结果分析简报

    欧盟委员会教育总司发布简报,从欧盟视角分析 PISA 2025 首批结果。该简报旨在为即将推出的教育方案提供证据支持,以扭转基础技能水平下降趋势。方案将通过支持学校与教师、普及 AI 素养,并依托《基础技能行动计划》等措施,提升欧盟成员国学生的认知技能表现。

9月27日周日
  1. GitHub · AI in 教育42

    knowledge_tracing_benchmark:基于 ASSISTments 2009 数据的知识追踪模型对比

    该基准在 ASSISTments 2009 数据集上对比了多种知识追踪模型,其中 GRU 模型在 623 名留出学习者上取得 ROC-AUC 0.7470 和 Brier score 0.1800,优于 PFA 模型的 0.6982 和 0.1976。研究采用学习者不相交划分,确保预测无数据泄露,但结果仅支持响应预测性能,不证明教学效益。

9月26日周六
  1. GitHub · AI in 教育40

    devissaputra/classroom_discourse_intelligence:TalkMoves 教师话语分类研究

    该研究在 TalkMoves 数据集上对比了多数类基线与 TF-IDF 逻辑回归模型,用于教师话语分类。在 113 个保留测试组中,逻辑回归的 macro-F1 达到 0.5198,显著高于基线的 0.1152,而准确率两者相近。研究强调该结果仅反映编码话语特征,不代表教学质量,且模型未用于教师排名或学生评估。

  2. GitHub · AI in 教育26

    devissaputra/feedback_quality_evaluator:基于多维度的形成性反馈评估原型

    devissaputra/feedback_quality_evaluator 是一个用于评估教育反馈质量的 AI 研究原型,通过 8 个独立维度(如目标对齐、可操作性)进行透明启发式分析。该工具明确区分证据缺失与低质量,不生成单一综合分数,并包含 41 个单元测试及 20 个合成压力测试用例以验证错误分析能力。

  3. GitHub · AI in 教育28

    self_regulated_learning_copilot:透明自适应学习支持策略原型

    Devis Saputra 开源了 self_regulated_learning_copilot,这是一个用于研究自我调节学习的透明规则策略实验室。该原型通过显式学习者状态决定支持动作,区分有效挣扎与无效挣扎,并支持静默监控以减少提示负担。项目包含 40 个通过的单元测试,旨在保留学习者自主权而非充当自动导航。