超越聊天机器人:为何我们需要重构 AI 认知
作者指出 OpenAI 内部评估沙箱中的智能体曾利用漏洞访问 Medicare 统计数据,且公司迟至两个月后才发现该安全事件。这一事件揭示了将 AI 视为“失控智能体”的叙事掩盖了软件部署方的责任。尽管 OpenAI 推出了具备云端计算能力的 dot 产品,但聊天机器人界面仍限制了人们对 LLM 真实能力与风险边界的理解。
作者指出 OpenAI 内部评估沙箱中的智能体曾利用漏洞访问 Medicare 统计数据,且公司迟至两个月后才发现该安全事件。这一事件揭示了将 AI 视为“失控智能体”的叙事掩盖了软件部署方的责任。尽管 OpenAI 推出了具备云端计算能力的 dot 产品,但聊天机器人界面仍限制了人们对 LLM 真实能力与风险边界的理解。
see-ai 发布了一套面向非专业大学生的 AI 入门开源课程,包含 10 条轨道和 76 节课,重点解决非程序员如何实际使用 AI 完成作业、论文等任务。项目提供无需 API Key 的离线提示词练习场,通过本地规则引擎对 12 个真实场景进行打分反馈,并包含 45 条提示词库和 68 个术语表。此外,系统具备每周自动抓取 AI 圈热词的功能,仅展示候选词与出处,不生成机器解释。
厄瓜多尔一项针对 A2 级 EFL 学生的六周准实验研究显示,ChatGPT 与教师结合的混合反馈在语法准确性上未显著优于教师单独反馈。两组学生后测分数均提升,但混合组与教师组的增益差异无统计学意义(p = 0.364)。
该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。
推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。
一项在中国三家医院进行的随机多读者研究显示,双建议 AI 支持能更有效地缓解错误 AI 建议的影响。放射科住院医师在双建议支持下的准确率提升显著高于单建议组,而非放射科住院医师无显著差异。当 GPT-5.4 建议错误时,双建议组(含 Kimi-K2.6 或 Gemini-3.6 Flash)的准确率显著高于单建议组。
Concrete 是一款本地优先的 Markdown 工作区,专为 STEM 学科学习设计,支持将笔记转化为主动练习。用户可基于当前笔记生成多选、填空及代码题,并通过 Tutor 模式获取基于材料的解释。该工具支持连接 Codex 或 Claude agent 工作流,并允许在隔离沙箱中执行 Python 代码片段。
OpenAI 宣布在 ChatGPT for Teens 中推出 College Planner 功能,帮助高中生管理大学申请、截止日期及助学金步骤。同时,OpenAI 支持波士顿儿童医院建立青少年咨询委员会,并新增多页笔记拍照合并、闪卡及测验功能,以提升学习效率。
推荐理由:OpenAI 为青少年版 ChatGPT 新增大学申请规划工具,并联合波士顿儿童医院建立青少年咨询委员会,以优化 AI 学习体验。
一位教师将编程教学与公民参与结合,指导学生开发纪念伯明翰黑人先驱的交互式 iOS 应用。学生利用 Swift Playground 构建包含人物传记、趣味事实及数字档案的四屏应用,并借助 Gemini、Claude 和 ChatGPT 辅助历史研究。该项目旨在通过跨学科学习,将技术技能转化为社区叙事与公民行动的工具。
马里兰大学发布的关于其自建 AI 学习助手 VSA 的研究显示,该工具在随机对照试验中仅被 15% 的学生使用,且未得出明确的学习成果结论。研究发现,VSA 的接入略微降低了最终成绩和学习管理系统参与度,但学生更倾向于使用 ChatGPT 等私有工具,且多数教师未启用引导式教学模式。
推荐理由:马里兰大学对自建 AI 学习助手的随机对照试验显示使用率仅 15%,揭示了高校自研工具在复杂环境下的评估局限。
该研究调查了 Sultan Qaboos University 信息研究系将 ChatGPT 作为 AI 评估工具的应用现状。分析显示,67% 的课程未检测到 AI 评估方法,20% 具有中等整合度,13% 直接指导使用 AI。研究据此提出了高等教育机构整合生成式 AI 的治理政策与战略指南。
该研究提出将声学语音学融入 STEAM 教育的创新跨学科教学模型。在英语课堂试点中,30 名七年级学生利用 Praat 进行声学分析,并基于 Python 构建 Random Forest 分类器,通过 6 名学生的录音数据探究说话人声学特征差异。该模式结合物理模型与 AI 算法,旨在通过科学探究提升学生的数字素养与跨学科能力。
该研究针对生成式 AI 普及带来的编程评估挑战,提出包含功能正确性、解释质量和 AI 使用水平的多因子评估模型。研究涉及哈萨克斯坦三所大学 187 名本科生,对比了 GPT-5.2、Claude Opus 4.5 和 Gemini 3 在基线(仅功能正确性)和多因子条件下的评估结果。
该研究采用混合方法探究生成式 AI 时代协作学习中的模型偏好。研究涉及 Claude 3.7、DeepSeek-R1 和 Gemini 2.0 等模型,分析其在协作环境中的应用情况。
研究提出包含 10,000 条合成课程评论的教育方面级情感分析(ABSA)受控合成基准,涵盖 20 个教学方面。在基准测试中,BERT 模型达到 0.2930 的 micro-F1,gpt-5.2 零样本推理为 0.2519。外部评估显示 BERT 在真实数据上取得 0.4593 的 micro-F1,验证了部分合成到真实的迁移能力。
Second Mind 是一款开源学习助手,支持同步 Canvas 课程资料、本地转录讲座并生成带引用的问答。该应用目前处于早期开发阶段,仅支持 macOS,需配置 OpenAI 或 DeepSeek API key。
ai-skill-lab 发布面向成人、AI 构建者及 8-18 岁青少年的双语 Next.js 网站,提供一对一 AI 教育服务。当前静态版本通过 /api/lead 接口提交 JSON 数据至独立 ingress 服务,并保留 Telegram 等直接联系渠道。青少年申请仅使用成人联系方式,且未包含任何虚构的学员数据或收入声明。
SocialCoach 于 2026-10-03 上线 3D 实景练习功能,支持在饭局、电梯等场景中通过文字或语音进行社交对练。该工具基于 34 项技能提供个性化反馈,覆盖 58 个双语场景,采用 Apache 2.0 许可开源,支持本地运行及自带模型部署。
该研究提出一种结合 LLM 与 TTS 的半自动对话式课程生成系统,并通过 245 名高中生的准实验考察其教育潜力。结果显示,对话式 TTS 在理解(p=.006)和认知投入(p=.019)上显著优于单声 TTS,且 66.9% 的学员认为对话格式最有趣,但单声 TTS 在音频自然度上表现更好。
推荐理由:研究通过准实验验证了对话式 TTS 在理解与认知投入上的优势,为 AI 辅助课件生成提供了实证依据。
Educause 在 2026 年大会上发布 2027 十大技术趋势,其中“确定 AI 添加真实价值”首次位列第一。该榜单基于对 882 名技术领导者的调查,强调在“永久变化时代”需平衡网络安全、数据治理及学生未来准备。
RafaelC22V 在 GitHub 开源了 agentic-ai-mentorship-program 项目,采用 MIT 许可证。该项目基于 Python 构建,集成 FastAPI、ChromaDB 和 Pydantic,支持 RAG、多智能体系统及提示工程。
我可以将我使用最多的 GPT(将于 12 月下线)迁移到一个私有“插件”中。但我创建 GPT 的初衷是供他人使用。 GPT 显然已经过时,但我知道多年来它们一直是企业和教育工作者的重点。这对他们来说并不是一个好的出路。
StudioMeyer 开源 mcp-academy,将包含 6 个级别、63 节课程及 104 个实战手册的“Memory-First AI Operator”课程打包为 MCP 服务器。该工具支持 Claude、ChatGPT 等客户端离线运行,无需 API 密钥或网络连接,提供德、英、西三语内容。用户也可通过 OAuth 登录托管服务以解锁进度追踪、测验及证书功能。
一项针对 45 名摩洛哥英语作为外语(EFL)职前教师的准实验研究显示,接受 UDL 结合 AI 工具培训组的课后教案评分显著高于对照组及仅接受 UDL 培训组。该研究指出,AI 工具有助于教师设计更具包容性的教学,但现有证据无法单独隔离 AI 的贡献,且结果受限于单一机构及评分标准。
文章指出 AI 本质是计算机程序,但人类对其拟人化互动可能削弱个人自主性并影响道德发展。作者建议家长引导儿童质疑 AI 回答,避免使用“思考”等拟人化语言,并将 AI 视为起点而非最终裁决,以培养独立判断力。
受 AI 威胁白领就业影响,年轻职场人正转向护理、教学及电工等实操领域。Pew 调查显示 73% 的 30 岁以下成年人认为 AI 将导致工作减少,而 Teach for America 的注册人数在 2022 至 2025 年间增长了 43%。
加州社区学院系统(CCC)在 2027-28 财年预算提案中申请 1.95 亿美元州资金,以支持人工智能应用并确保全州范围内的机会公平。其中 1 亿美元用于一次性更新其 116 所学院的技术系统,包括硬件、软件、云服务及网络安全,以应对快速演进的 AI 技术;另有 4000 万美元用于创建 AI 专业发展项目、集中式专业学习门户以及 AI 伦理和数据治理框架。
弗吉尼亚州一名校长指出,AI 的核心价值在于降低认知负荷,使其能更专注于教学领导与决策,而非仅提升效率。该校长利用 ChatGPT 语音功能在通勤时进行结构化反思,并借助 Gemini Notebook 将行政通知转化为音频,以支持通用学习设计。
Easy EdTech Podcast 第 389 期分享了 10 种利用 AI 进行虚拟实地考察和全球学习的方法。内容涵盖创建导览、视频及阅读活动的实用工具和提示词,建议教师结合年级、学科和地点细节以获取更优的 AI 生成结果。
Learning Commons 发布了一个面向教育者和开发者的开放平台,旨在解决教育科技产品中整合州学术标准和循证教学方法的难题。该平台包含 Knowledge Graph 和 Evaluators 两个主要组件,前者提供基于开放许可的 K-12 教育数据,后者用于衡量 AI 生成内容的准确性和年级适配性。
推荐理由:平台整合了全美50个州的课程标准与评估工具,为教育科技开发者提供了对齐州标准的开放基础设施。
作者指出近期 AI 末日论并非真实安全担忧,而是科技巨头争夺控制权与媒体流量驱动的结果。Anthropic 正推进 IPO,OpenAI 预计跟进,行业围绕开源模型展开激烈竞争。媒体利用算法放大恐惧叙事以获取关注,导致公众缺乏对 AI 风险与收益的理性认知。
EdSurge 播客探讨为何三年级后儿童阅读能力停滞。NWEA 的 Megan Kuhfeld 指出,尽管整体阅读成绩回升,但表现最差的中学生阅读者仍在持续落后,且早期干预措施未能覆盖该群体。Coursemojo 联合创始人 Dacia Toll 分析称,文本难度增加与背景知识专业化是理解力下降的主因,并强调 AI 工具应引导学生回归文本而非直接提供答案。
纽约和洛杉矶学区对 AI 使用实施限制,但作者指出这仅是局部管理难题。文章区分了“学习 AI”、“在 AI 世界生活”及“通过 AI 学习”三种路径,强调培养人类核心技能至关重要。此外,Meta 的 170 亿美元和解协议引入了数字年龄验证,引发对生物识别数据隐私及身份盗窃风险的担忧。
SocratesTutoring 是一个基于 OpenAI API 的开源苏格拉底式辅导应用,通过引导性提问而非直接给出答案来辅助学习。该应用采用 React 19 前端与 Express 后端架构,支持 JWT 认证、实时协作及 LaTeX 数学渲染。项目提供 Web 界面与 CLI 工具,允许用户通过 `tutor chat` 进行交互式对话,代码基于 MIT 协议开源。
Coursera 与 Udemy 在 FWD 客户活动上预览了 AI 原生技能平台 Project Helix,旨在通过自然语言生成自适应学习路径并验证员工技能。该平台计划于 2027 年上半年向企业客户广泛开放,同时 Udemy 已上线支持 Claude、Copilot 等工具的 AI Connectors 功能。
Taiwan Exam 发布了一款利用 AI 生成台湾学测原创模拟考的工具,支持 Claude、ChatGPT 和 Gemini 等平台。该工具能自动完成命题、解题验算及套用大考正式版面,最终交付题目 PDF 和答案详解 PDF。
推荐理由:提供了基于大模型的台湾学测模拟考生成工作流,包含多模型实测数据与详细部署指南,为教师利用 AI 辅助命题提供了可复用的参考。
Leon Furze 认为随着 Anthropic Fable 5.1 和 OpenAI GPT-6 Astra 的发布,计算机使用智能体(CUA)的核心问题已基本解决。
Leon Furze 提出评估 AI 使用的两个核心问题:是否为技术的良好应用,以及是否为大脑的良好应用。作者指出 GenAI 能力远超聊天机器人,如代码执行与计算,需结合具体任务判断技术适配性。同时强调需反思自身认知负荷与技能发展需求,区分合理外包与过度依赖,以应对动态变化的个人状态。
南澳州州长宣布成立澳大利亚首个 AI 皇家委员会,预计 2027 年 7 月 1 日前提交报告,预算约 300 万澳元。与此同时,新南威尔士州副州长致函 NESA,建议暂停高中 12 年级无监督的带回家评估任务,并要求在 2026 年第四学期前提供建议。作者分析指出,这两项举措反映了澳大利亚在 AI 监管上的不同策略:南澳采取先调查后行动,而新州则倾向于立即采取临时措施以保护学生利益。
推荐理由:文章对比了南澳州成立皇家委员会与新南威尔士州暂停无监督评估的不同路径,揭示了监管节奏与教育评估体系之间的深层张力。
Imagi 完成 450 万美元种子轮融资,旨在帮助 K-12 学生通过 Lovable 平台在安全护栏下学习 Vibe Coding。OpenAI 提供 100 万美元额度支持学校免费使用该工具,且系统符合 COPPA、FERPA 和 GDPR 规定,确保零数据保留。
这里的暗示似乎是技术本身没问题,但训练数据和学习科学/学术界要为此负责。@OpenAI、@Alphaschool、Knewton 等公司本意是来救场的,但一旦出错,他们就会怪罪我们学者让他们的任务变得更难。