arXiv 论文:通过多轮强化学习解决 LLM 教学中的协助困境
研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。
研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。
研究提出 CLARA 框架及包含 1107 个中英双语儿童故事的基准资源,用于评估 AI 对儿童故事发育适宜性的判断能力。实验表明,基于认知、语言和社会情感维度的结构化标注方法,在匹配人类专家判断方面显著优于基于可读性的方法和直接提示基线。
该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。
Agentic AI Academy 发布开源课程,提供从设计到生产的全栈 AI 智能体工程实验室与参考架构。该体系包含 104 个跨 8 个领域的专家合成基准测试用例,支持 OpenAI、Anthropic 等提供商的 Provider-neutral 运行时。项目采用 30% 理论、50% 实施、20% 反思的学习路径,旨在培养具备安全、治理及可观测性能力的 AI 工程人才。
Learning Commons 开源了 Evaluators 工具集,旨在通过教育科学视角衡量 LLM 生成文本的属性。该工具包含文本复杂度、反馈质量、学术标准对齐和持久技能四个评估器家族,提供 Python 和 TypeScript SDK 以及本地运行环境,支持优化 AI 内容、监控模型表现及对比候选模型。
准确!🧠
在2024-25学年期间,他们主持了专业发展研讨会,展示了特定的AI工具如何为他们节省时间,并改变其课堂中可能实现的内容。 https://bit.ly/4g6N7QW
Braivo 是一个开源自适应学习平台,利用 AI 将现有教育内容转化为个性化 AI 导师。它通过记录学习者证据并更新知识估计,动态决定下一步学习路径(引入、重教或复习)。该平台支持自托管和 API 优先架构,允许机构以白标形式运行,目前处于预发布阶段,支持从 PDF 或视频字幕生成课程。
重庆英语教师田老师基于肖战新歌 Allez aimez 创作了重庆文旅特别单曲《爱上你,重庆》。该作品于 2026/10/5 发布,是田老师“AI 素养课堂”系列内容的一部分,旨在通过音乐创作展示 AI 赋能英语教学的实践。
Second Mind 是一款开源学习助手,支持同步 Canvas 课程资料、本地转录讲座并生成带引用的问答。该应用目前处于早期开发阶段,仅支持 macOS,需配置 OpenAI 或 DeepSeek API key。
melanie-ldi/genai-irr-calculator 是一个基于浏览器的评分者间信度(IRR)计算器,专为 GenAI 证据库系统文献综述设计。该工具以单文件 HTML 形式运行,无需安装,所有计算均在客户端完成。它支持上传 .csv、.xlsx 等编码表,自动检测版本并计算 Krippendorff's α,结果可导出为 CSV 或 Excel。
Learning Commons 发布 Knowledge Graph,这是一个连接学术标准、课程和学习科学数据的结构化数据集集合。该平台采用标准化图模式,支持通过 REST API、MCP 服务器或本地文件访问,允许开发者无需构建数据管道即可开发 AI 驱动的教育工具。数据集涵盖美国学术标准、数学与 ELA 学习组件、学习进阶及 IM v.360 等课程资源,部分数据开放下载,部分需审批。
2026 年 6 月报告显示超 4/5 青少年使用 AI 工具,但学区缺乏资金与指导,导致实施风险激增。A-I Policy Forum 提出五项建议,包括建立国家技术援助中心、设立区域试点项目、将 AI 素养融入核心课程、更新联邦资金机制及启动创新资助。国会应通过针对性联邦资源支持地方,以应对 2030 年预计 65% 的技能转变。
纽约市和洛杉矶正在限制面向学生的生成式 AI。在新墨西哥州,家长正在抵制一款 AI 驱动的阅读筛查工具。 Jaime Casap 认为,学校应区分不同类型的 AI 工具。https://www.edsurge.com/news/will-kids-pay-the-price-for-ai-panic
ai-xuexuele 是一款面向中小学生的本地部署互动自学应用,包含 670 节课、18 个学科及 3905 道题,覆盖小学至高中全学段。应用采用“课本式讲解+参数互动演示”模式,AI 仅用于独立答疑,支持错题闭环与间隔复习。技术栈基于 Vite 7 与 React 19,通过 209 个单元测试验证,确保 670 课 0 错误。
VeriChalk 是一款面向小学数学教师的可验证命题 Agent,支持通过一句话或拍照生成经核验、不超纲的题目或整份试卷,并可导出 PDF 等格式。在 36 个出题用例评测中,其答案正确率为 0.945,超纲率为 0.048,但尚未达到公开发布的质量门槛。
该研究探索了小学课堂中学生的 AI 素养,重点分析学生对生成式 AI、公平性及伦理使用的看法。
ai-skill-lab 发布面向成人、AI 构建者及 8-18 岁青少年的双语 Next.js 网站,提供一对一 AI 教育服务。当前静态版本通过 /api/lead 接口提交 JSON 数据至独立 ingress 服务,并保留 Telegram 等直接联系渠道。青少年申请仅使用成人联系方式,且未包含任何虚构的学员数据或收入声明。
XavierTing 开源了 xavierairesources 项目,这是一个纯 HTML/CSS/JS 构建的 AI 工具精选列表,涵盖设计、构建及 Agent 开发工具。项目包含 63 个术语的 AI 101 课程,代码采用 MIT 协议,内容版权归 Xavier Ting 所有。
SocialCoach 于 2026-10-03 上线 3D 实景练习功能,支持在饭局、电梯等场景中通过文字或语音进行社交对练。该工具基于 34 项技能提供个性化反馈,覆盖 58 个双语场景,采用 Apache 2.0 许可开源,支持本地运行及自带模型部署。
作者建议现代慈善家建立独立、免费且随时的数学掌握度评估体系,以解决学校无法认证学生自学成果的问题。该体系旨在打破传统按年龄分班的限制,支持基于掌握程度的加速学习,从而利用 AI 和 Khan Academy 等资源实现真正的个性化教育。
AI Architect Academy 是首个支持 coding-agent 原生交互的学习平台,用户通过 Claude Code 在终端内构建 AI 系统。平台包含 3 个交互式实验,涵盖修复 RAG 管道、构建多智能体系统及开发 MCP Server,并配备 23 项自动激活的专家技能。
当家长在IEP会议上提出AI生成的问题或建议时,教育工作者表示透明度至关重要。 教师可以展现开放态度,询问相关建议,并将重点始终放在孩子的需求上。 https://www.edsurge.com/news/parents-are-bringing-ai-to-the-iep-meeting-heres-how-teachers-should-respond
我认为,设计良好的 AI 将超越最杰出的教师。 https://bit.ly/4cdj09g
暨南大学图书馆推出“薪火传侨心”特展,集中展出近千件侨批文献,呈现华侨的家国情怀。学校依托数智华文重点实验室,利用人工智能技术对馆藏侨批进行数字化采集修复与多语种智能转译。此外,其自主编写的《中文》系列教材全球发行量已突破5000万册。
教师在职培训已超越传统课程与教学,重点转向 AI、网络安全、学生福祉及校园安全。教师需掌握 AI 辅助教学、数据隐私保护及心理健康识别等新技能。培训旨在帮助教师应对职业角色的多元化扩展,提升数字公民素养与危机应对能力。
Coursera 与 Udemy 在马德里发布 30 余门新课程及多项平台更新,旨在帮助学习者结合 AI 流利度与人类判断力。新内容涵盖 Agentic AI、生成式 AI 应用及 AI 治理等领域,合作方包括 DeepLearning.AI、Stanford Online 及 Perplexity。
该研究采用 PLS-SEM 方法分析全球南方学生对生成式 AI 的感知与使用意图。研究聚焦高等教育场景,探讨技术接受度模型在特定区域背景下的适用性。
Academic Instability Early Warning System 是一款可解释的学术不稳定早期预警引擎,旨在成绩下滑前检测风险。该系统通过分析出勤率、参与度和学习负荷,建模压力积累、缓冲强度和过渡风险,并指出有效的干预措施。
重庆英语教师田老师利用AI素养课堂,基于肖战新歌《Allez aimez》创作了重庆文旅特别单曲《爱上你,重庆》。该视频于2026/10/5发布,展示了AI在英语教师减负增效及本土文化推广中的应用。
AI撰写的学术论文存在一个微妙的问题:AI并未针对反馈进行校准。AI往往直接妥协,但如果你提交论文进行评审,来自同行评审者的质疑应当促使你尝试捍卫自己的观点(当然,如果确实错了,还是要放弃)。
基于 2023 年后 32 项同行评审研究的迷你综述指出,教师沟通行为仍显著预测学生结果,元分析显示中到大效应量(r = 0.443)。学生使用人类沟通类别评估 AI 智能体,但在善意维度存在系统性差距,需通过即时性和礼貌线索弥补。当 AI 替代人际互动时,会引发孤独感和归属感下降等负面结果。
该迷你综述基于建构主义学习理论,将人工智能定位为麻醉教育中需随学习者表现调整并逐步撤除的临时支架,而非自主教师。现有麻醉特异性研究在区域麻醉训练、超声解读及虚拟患者等场景展示了可行性,但尚未证实能提升临床推理或胜任力。AI生成的反馈与评分应视为有缺陷的决策支持,不得独立用于总结性评估或授权。
确实如此。🧡
前 Google 教育主管 Jaime Casap 撰文指出,纽约和洛杉矶暂停学生使用生成式 AI 的政策可能引发连锁反应,导致新墨西哥州等地区的 AI 阅读筛查工具被误伤。
随着 AI 在教育科技领域普及,学区需要可靠的方式来评估其购买的产品。 EdReports CEO Dr. Lewis Ferebee 在 This Week with EdSurge 中讨论了这一点。 🎧 收听:https://www.edsurge.com/news/can-schools-trust-ai-features-in-edtech-products
Coursera 上线 10 门免费 Anthropic AI 课程,面向开发者、小企业主、创作者和教师。课程涵盖 Claude Code 101、AI Fluency for pK-12 Educators 等,旨在帮助学习者提升 AI 技能。
推荐理由:课程覆盖开发者、教师及小企业主等角色,提供了从基础 AI 素养到具体工具应用的完整学习路径。
特殊教师使用 Gemini 为无法书写的学生生成视觉引导,并通过语音提示词帮助学生生成图像表达想法。作者正与同事合作开发一款整合特殊教育规划与编程的 AI 应用,旨在确保残疾不再决定学生的学习量。
推荐理由:展示了特殊教师利用 Gemini 视觉引导与语音交互,帮助无法书写的学生表达想法并参与学习的具体路径。
一位高校教师将数据挖掘课程的编程测试替换为关于学生如何使用 AI 解决问题的真实对话。学生使用 Google Colab 中的 Gemini 作为个人导师,需对 AI 建议的代码和替代方案进行判断、质疑并论证最终建模决策。教师通过口头面试让学生辩护其选择、排查问题并识别 AI 建议中的错误,同时利用 Gemini Canvas 和 Gemini Notebook 进行大规模评估。
推荐理由:展示了如何用 Gemini 替代传统代码测试,通过口头面试评估学生对 AI 建议的判断力,为 AI 时代的编程评估提供了可迁移方法。
Gemini 作为规划伙伴,帮助教师构建课堂体验。在英语课上,它协助快速搭建多站点角色扮演挑战,让学生在阅读前通过肢体活动建立同理心;在生活技能课上,它帮助设计冰沙食谱和饮食档案,让学生亲手实践营养搭配。