K12-KGraph:面向教育大模型评测与训练的课标对齐知识图谱
研究团队提出 K12-KGraph,一个从人教版数学、物理、化学、生物教材中提取的课程对齐知识图谱,涵盖 9 种节点和 14 种关系。基于该图谱构建了包含 23,640 道多选题的 K12-Bench 基准和 7,335 个样本的 K12-Train 微调数据集。
推荐理由:该研究构建了基于人教版教材的知识图谱与评测基准,揭示了当前大模型在课程认知上的短板及微调改进路径。
研究团队提出 K12-KGraph,一个从人教版数学、物理、化学、生物教材中提取的课程对齐知识图谱,涵盖 9 种节点和 14 种关系。基于该图谱构建了包含 23,640 道多选题的 K12-Bench 基准和 7,335 个样本的 K12-Train 微调数据集。
推荐理由:该研究构建了基于人教版教材的知识图谱与评测基准,揭示了当前大模型在课程认知上的短板及微调改进路径。
针对自动作文评分系统对高熟练度 ESL 学习者的过度惩罚问题,研究提出双向对齐策略 CL-MEP。该方法将评分偏差降低 39.9% 并提升整体准确率,成功区分有效句法复杂度与表层语法错误。
研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。
研究提出 CLARA 框架及包含 1107 个中英双语儿童故事的基准资源,用于评估 AI 对儿童故事发育适宜性的判断能力。实验表明,基于认知、语言和社会情感维度的结构化标注方法,在匹配人类专家判断方面显著优于基于可读性的方法和直接提示基线。
该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。
melanie-ldi/genai-irr-calculator 是一个基于浏览器的评分者间信度(IRR)计算器,专为 GenAI 证据库系统文献综述设计。该工具以单文件 HTML 形式运行,无需安装,所有计算均在客户端完成。它支持上传 .csv、.xlsx 等编码表,自动检测版本并计算 Krippendorff's α,结果可导出为 CSV 或 Excel。
该研究探索了小学课堂中学生的 AI 素养,重点分析学生对生成式 AI、公平性及伦理使用的看法。
该研究采用 PLS-SEM 方法分析全球南方学生对生成式 AI 的感知与使用意图。研究聚焦高等教育场景,探讨技术接受度模型在特定区域背景下的适用性。
基于 2023 年后 32 项同行评审研究的迷你综述指出,教师沟通行为仍显著预测学生结果,元分析显示中到大效应量(r = 0.443)。学生使用人类沟通类别评估 AI 智能体,但在善意维度存在系统性差距,需通过即时性和礼貌线索弥补。当 AI 替代人际互动时,会引发孤独感和归属感下降等负面结果。
该迷你综述基于建构主义学习理论,将人工智能定位为麻醉教育中需随学习者表现调整并逐步撤除的临时支架,而非自主教师。现有麻醉特异性研究在区域麻醉训练、超声解读及虚拟患者等场景展示了可行性,但尚未证实能提升临床推理或胜任力。AI生成的反馈与评分应视为有缺陷的决策支持,不得独立用于总结性评估或授权。
论文提出 LLMersion 框架,一种完全在本地运行的 AI 智能体方案,旨在通过低成本家庭语言学习促进教育公平。该框架利用小型开源权重模型,使完整的听、说、读、写四项技能栈能运行在约 200 美元级别的笔记本电脑上,且每小时学习电费仅约 1 美分。作者已发布开源原型 LLMersion-1 及配套工具 LLMersion Narrator。
荷兰 Fontys 和丹麦 IT University Copenhagen 的研究表明,手动数据标注任务能有效提升学生对标注主观性的理解。43 名参与者在标注皮肤病变图像后,对偏见和公平性的理解优于传统讲座。尽管存在情感不适,该活动仍被证实能帮助学生认识到人类判断对模型行为的影响。
该研究提出一种结合 LLM 与 TTS 的半自动对话式课程生成系统,并通过 245 名高中生的准实验考察其教育潜力。结果显示,对话式 TTS 在理解(p=.006)和认知投入(p=.019)上显著优于单声 TTS,且 66.9% 的学员认为对话格式最有趣,但单声 TTS 在音频自然度上表现更好。
推荐理由:研究通过准实验验证了对话式 TTS 在理解与认知投入上的优势,为 AI 辅助课件生成提供了实证依据。
欧盟委员会教育总司发布 EU PISA 2025 首批结果事实清单,该文件汇总了欧洲教育政策简报中的关键洞察。
LearnAdapt Praxis 提出包含 Frame 至 Transfer 五阶段的学习工作区,通过项目级服务器控制限制辅助访问并存储版本化规范与验证观察。可复现的合成演练执行了 120 个串行项目集,3,990 项检查均符合预期,60 次注入故障未产生伪造提示。该报告验证了系统架构的工程属性,但未确立学习增益或模型输出质量。
研究分析了150组学生与AI的对话,发现相似的评估成绩可能对应截然不同的认知参与模式。基于认知所有权框架,作业分数仅反映评估结果,无法还原学生与AI之间认知工作的具体分配。该研究为评估体系纳入认知过程证据提供了实证基础。
一项针对 69 名本科生的混合方法研究显示,100% 的学生使用 AI 工具,86.9% 认为 AI 提升了创造力与学习独立性。研究提出 AI-Empowered STEAM Climate Action Model (AISC-AM) 框架,通过“AI-in-the-Loop”验证结构解决准确性与抄袭担忧,连接学生研究与区域气候政策。
一项针对 45 名摩洛哥英语作为外语(EFL)职前教师的准实验研究显示,接受 UDL 结合 AI 工具培训组的课后教案评分显著高于对照组及仅接受 UDL 培训组。该研究指出,AI 工具有助于教师设计更具包容性的教学,但现有证据无法单独隔离 AI 的贡献,且结果受限于单一机构及评分标准。
一项涵盖2009至2023年间17项研究的系统文献综述表明,元认知是连接教师专业数字能力与自我调节学习的关键机制。个性化学习环境及元认知支架等技术支持系统有助于教师以自我调节方式发展数字能力。研究强调,自我调节学习需辅以协作学习和以学习者为中心的创新课堂形式,如启发式教学法,以提升教师教育效果。
一项针对拉脱维亚教育专业人员的定性研究揭示了“数字可持续性”的认知现状。研究发现,教师普遍将数字技术视为外部强加的不可避免因素,而非基于专业信念的教学选择。此外,相关实践多聚焦于孤立项目,缺乏系统性的长期战略,且存在机构驱动数字化与可持续性考量之间的张力。
一项针对 700 多名学生的随机对照实验表明,基于学习分析的个性化反馈能显著促进大学生更早开始作业并增加尝试练习题的比例,但未带来考试成绩或最终成绩的提升。实验组学生在干预阶段开始作业的时间平均比对照组早半天,且 91% 的学生尝试了练习题,高于对照组的 82%。尽管实验组的 D/F 率(2.5%)低于对照组(4.7%),但该差异未达统计显著性,且两组学生对反馈有用性和激励性的感知无显著差异。
推荐理由:研究通过随机对照实验量化了个性化反馈对行为启动与学业成绩的影响差异,为大规模课程中的反馈设计提供了实证依据。
针对马来西亚 18 名高校教师的质性研究揭示了 AI 对学生评估的重构影响。研究发现 AI 使用导致教师工作量增加,迫使教师角色向“学术质量守门人”转变,并引发专业身份张力。教师普遍采取适应性教学、重新设计评估及寻求机构支持等策略,以应对学术诚信挑战并推动 AI 治理。
该研究提出一种融合人工智能、游戏化学习和增强现实的多模态电子学习平台,旨在提升中学语言学习中的阅读理解能力。
CLEAR-Mem v0.1.0 作为首个私有发布候选版本,提供了 LLM 辅导系统中学习者状态记忆的参考实现。该工具将学习者判断表示为独立可审查的声明,控制其进入持久记忆的权限及后续证据对声明的确认或修正。配套基准 LSS-Bench 用于测试记忆是否导致教育上不合理的变更,项目采用 Apache License 2.0 许可。
该研究采用混合方法评估 GenAI 零样本提示在中国 EFL 完形填空文本生成中的应用。研究聚焦于语言评估场景,旨在验证生成式 AI 在构建完形填空测试题时的可行性与效果。
EdReports 发布新简报,审查了 10 家 K-12 课程及教育科技供应商。结果显示,仅有一家供应商包含证明其嵌入的 AI 功能能改善教育成果的第三方证据。
推荐理由:EdReports 对 10 家 K-12 教育科技供应商的审查显示,仅一家提供了嵌入 AI 功能提升教育成果的第三方证据。
InferHaven 发布 socratic-pressure-v1 研究,测试 8 个模型在 12 个 Python 练习和 4 条压力消息下的表现。该研究旨在评估 AI 导师在压力下回复的代码能否通过练习自身的测试。代码采用 Apache License 2.0,数据与结果采用 CC BY 4.0 许可。
华南师范大学团队基于生态系统理论,构建了数字化促进中国教育现代化的生态模型。该模型以公平、优质、全面、和谐、开放为价值追求,由时间系统贯穿微、中、外、宏系统,分别形成“学习—教学—评价”融合、“学校—家庭—社会”协同及“供给—教研—标准”耦合机制。研究进而提出以动态评估、文化融合、标准建设、场景创新和人才发展为保障的实践进路,旨在提供系统化的学理框架与行动路径。
Coursera 发布第八版《全球技能报告 2026》,推出全球首个 AI-人类技能协同指数,基于 3 亿多学习者数据揭示 98 国技能发展现状。报告显示,GenAI 课程注册速度达每分钟 45 次,批判性思维课程注册量同比增长 107%,AI 微证书注册量增长 122%。
该研究探索了生成式 AI 支持协作学习中的协作模式,分析其对知识构建和学习表现的影响。研究发表于《教育技术研究与发展》(ETR&D),旨在揭示 AI 介入下学生协作互动的特征及其教育效果。
该研究从知识惯性视角探究 GenAI 依赖对大学生批判性思维倾向的影响。文章发表于《Education and Information Technologies》,旨在分析生成式人工智能使用与学生思维习惯之间的关联。
EdReports 发布简报指出,10 家 K-12 课程与教育科技供应商中仅 1 家提供了第三方证据,证明其嵌入的 AI 功能能改善教育成果。研究强调,后台 AI 更新使学校难以确保产品效力,且现有框架缺乏评估 AI 是否增强学习的一致方法。专家建议学校要求供应商提供具体数据,并关注 AI 更新的教学决策属性。
推荐理由:报告揭示了K-12教育科技产品中AI功能缺乏实证支持的现状,为采购决策提供了关键的质量评估视角。
UNESCO IITE 发布《教师 AI 能力框架》分析报告,系统分析了 36 个来自国家教育主管部门、国际政策组织和学术界的教师 AI 能力框架。报告探讨了 AI 素养、实施场景及评估方法,并基于证据提出了设计国家级教师 AI 能力框架的建议,旨在促进高质量、课程对齐的教师 AI 能力发展。
推荐理由:报告系统分析了 36 个教师 AI 能力框架,为各国设计高质量教师 AI 发展体系提供了实证依据。
欧盟委员会教育总司发布简报,从欧盟视角分析 PISA 2025 首批结果。该简报旨在为即将推出的教育方案提供证据支持,以扭转基础技能水平下降趋势。方案将通过支持学校与教师、普及 AI 素养,并依托《基础技能行动计划》等措施,提升欧盟成员国学生的认知技能表现。
学生到底希望老师了解关于 AI 的什么? 作者 Tony Frontier 采访了 250 名高中生,其中一个主题尤为突出:学生并不想作弊,他们希望获得关于如何负责任地使用 AI 的指导。 完整 EL 杂志文章链接在第一条回复中。
该基准在 ASSISTments 2009 数据集上对比了多种知识追踪模型,其中 GRU 模型在 623 名留出学习者上取得 ROC-AUC 0.7470 和 Brier score 0.1800,优于 PFA 模型的 0.6982 和 0.1976。研究采用学习者不相交划分,确保预测无数据泄露,但结果仅支持响应预测性能,不证明教学效益。
该研究在 TalkMoves 数据集上对比了多数类基线与 TF-IDF 逻辑回归模型,用于教师话语分类。在 113 个保留测试组中,逻辑回归的 macro-F1 达到 0.5198,显著高于基线的 0.1152,而准确率两者相近。研究强调该结果仅反映编码话语特征,不代表教学质量,且模型未用于教师排名或学生评估。
devissaputra/feedback_quality_evaluator 是一个用于评估教育反馈质量的 AI 研究原型,通过 8 个独立维度(如目标对齐、可操作性)进行透明启发式分析。该工具明确区分证据缺失与低质量,不生成单一综合分数,并包含 41 个单元测试及 20 个合成压力测试用例以验证错误分析能力。
Devis Saputra 开源了 self_regulated_learning_copilot,这是一个用于研究自我调节学习的透明规则策略实验室。该原型通过显式学习者状态决定支持动作,区分有效挣扎与无效挣扎,并支持静默监控以减少提示负担。项目包含 40 个通过的单元测试,旨在保留学习者自主权而非充当自动导航。
devissaputra/engagement_early_warning 是一个时间安全的学生参与度早期预警研究原型,通过强制预测截止点边界防止数据泄露。该原型使用合成风险系数评估受限审查队列,并包含校准与子群诊断功能,29 个单元测试检查均已通过。