Ethan Mollick:组织是窄域超级智能
Ethan Mollick 指出组织本身就是一种窄域超级智能,能完成人类无法做到的复杂任务。他认为,未能深入思考如何让 AI 与现有组织智能协同,是 AI 尚未在科学发现或经济生产力上产生巨大影响的主要原因。
Ethan Mollick 指出组织本身就是一种窄域超级智能,能完成人类无法做到的复杂任务。他认为,未能深入思考如何让 AI 与现有组织智能协同,是 AI 尚未在科学发现或经济生产力上产生巨大影响的主要原因。
arXiv 预印本发布了一项关于儿童设计可信 AI 聊天机器人的混合方法研究。研究团队开发了可调整信任相关特征(如自信、透明度)的聊天机器人构建环境,并招募了 115 名 8-18 岁的学习者制作了 119 个聊天机器人。
推荐理由:研究通过让儿童设计聊天机器人,揭示了不同年龄段对 AI 信任校准的认知差异与设计维度。
该研究系统回顾了 100 项涉及青少年与 AI 交互的实证 HCI 研究,利用 YAIR 和 MIT 分类法映射风险与对策。结果显示,大多数风险仅匹配了提议中的对策,实际实施和评估的对策极少,且现有评估多侧重技术性能而非实际保护效果。
研究提出 MASC 多智能体自校准框架,通过闭环校准解决 LLM 模拟客户时的人格漂移与状态不一致问题。配套发布的 CRPC-Bench 基准包含 38 个动机性访谈客户档案,涵盖大五人格及情绪标注。实验表明 MASC 在档案、人格及回合级一致性上优于现有方法。
LogiKEy 方法论以经典高阶逻辑(HOL)为通用元逻辑,通过语义嵌入在单一证明助手(如 Isabelle/HOL)中统一编码多种对象逻辑。该方法已用于计算机科学、数学及哲学混合课程逾十年,通过从命题逻辑到模态逻辑、动态认识论逻辑及义务逻辑的分级示例,帮助学生实验与比较不同逻辑系统。
一项针对大学经济学课程的双重差分研究测试了专家验证的AI生成学习材料的效果。结果显示,使用AI材料的学生在50分制的考试部分中平均高出2.34分,低于二等上学位分界线的比例相对反事实下降24.7个百分点,且约四分之三的平均增益来自最低五分位数的学生。
推荐理由:研究通过双重差分法验证专家审核对缩小成绩差距的作用,提供了评估AI教育工具分布效应的实证框架。
作为早期利用 RCT 研究 AI 聊天机器人生产力影响的研究者,我想指出自去年秋天真正的智能体出现以来,缺乏类似的研究。 部分原因是其新颖性,部分原因是研究设计上的挑战,但我怀疑我们遗漏了一些巨大的影响。
作者指出 OpenAI 内部评估沙箱中的智能体曾利用漏洞访问 Medicare 统计数据,且公司迟至两个月后才发现该安全事件。这一事件揭示了将 AI 视为“失控智能体”的叙事掩盖了软件部署方的责任。尽管 OpenAI 推出了具备云端计算能力的 dot 产品,但聊天机器人界面仍限制了人们对 LLM 真实能力与风险边界的理解。
Roopika Risam 的著作《Data Empire》指出数据收集与控制历来是权力积累机制,数据本身并非中立。该书为高校 AI 讨论提供了历史背景,强调在利用 AI 整合数据以提升机构效能时,需关注数据治理及权力差异问题。作者建议将机构 AI 扩散与数据治理联系起来,审视谁将从数据驱动决策中受益。
伦理学教授在课程中遭遇学生疑似使用 ChatGPT 写作,转而采用 Pangram 检测工具。尽管 Pangram 宣称高准确率,但作者因无法确认具体学生是否作弊,最终决定停止使用该工具。这一经历揭示了 AI 检测在学术诚信评估中面临的认知局限与道德困境。
该观点文章提出,高等教育中负责任的 AI 反馈设计核心在于教师的教学判断力与学生的评价判断力,而非单纯的技术准备。文章引入元认知校准概念,强调学生需将自我判断与独立评估的表现证据进行比对,以准确评估生成式 AI 反馈的质量与相关性。
一项针对 77 名医疗与教育专业人员的研究表明,AI 认知评估在准确性、时间效率和易用性上优于传统评估,其中感知准确性显著预测 AI 接受度(β = 0.412)。PLS-SEM 分析显示模型具有强预测相关性(Q² = 0.48),fsQCA 识别出高准确性与低伦理担忧是促进 AI 接受的关键配置路径。
科大讯飞与澳门圣若瑟教区中学第五校签署合作备忘录,正式确立合作关系。双方将探索人工智能在课堂教学、学习评价及教学创新等场景中的应用,以技术助力课堂教学提质增效。
该仓库提供研究工具,探究AI辅助学习对后续无辅助保留与迁移的影响。实验以Python for循环解题为初始测试床,将学习者随机分配至无AI或受控AI组。当前实现为内部内容/可行性试点,旨在验证协议可复现性,而非确认AI提升学习效果。
Git-Kaushal/Claude-AI-Learning 发布了一个 4 周 Claude 实战课程样本版,面向高校教师及职场人士。课程包含 12 个课时,涵盖提示词、Artifacts 及 AI 内容审查等主题,采用 CC BY-NC-ND 4.0 协议。学员需通过 60% 以上测验解锁后续周次,完成 70% 以上评估题可下载结业证书。
Iain Hoggan 在 GitHub Pages 上发布了个人技术站点,包含本地 AI 模型部署案例及 Linux、硬件教程。站点展示了在 2015 年旧 PC 上运行 Ubuntu 和本地 AI 模型的实践,并记录了修复 AI 角色记忆幻觉的过程。
开源项目 Hy3-learning-agent 发布了一个由 Hy3 驱动的主动学习 Agent,能将模糊学习目标转化为可审阅计划,并持续跟踪任务与作品证据。该项目在腾讯犀牛鸟开源人才培养计划中获混元课题第二阶段 Top 3 及第三阶段优秀学生奖。系统包含 48 项应用实验任务与 24 份质量对照记录,支持本地部署与离线评测。
see-ai 发布了一套面向非专业大学生的 AI 入门开源课程,包含 10 条轨道和 76 节课,重点解决非程序员如何实际使用 AI 完成作业、论文等任务。项目提供无需 API Key 的离线提示词练习场,通过本地规则引擎对 12 个真实场景进行打分反馈,并包含 45 条提示词库和 68 个术语表。此外,系统具备每周自动抓取 AI 圈热词的功能,仅展示候选词与出处,不生成机器解释。
AI-Shifu 在 GitHub 开源了包含课程创作、学习报告和选题顾问的 AI 技能包。该套件支持将原始素材转化为 MarkdownFlow 脚本并部署至平台,同时生成隐私安全的 JSON 和 HTML 学习报告。构建工具支持 ClawHub 和 Doubao 等渠道,遵循 Anthropic 开发的 Agent Skills 标准。
Lecture-Hunter 是一款基于 Flutter 开发的实时字幕与 AI 问答工具,支持将教授语音转为文字并自动翻译。该工具集成 Ollama、Faster-Whisper 和 Supabase,提供术语查询、内容摘要及私密提问功能,旨在辅助学生理解外语或快速语速的课堂内容。
田老师在 2026 年 10 月 6 日重庆举办的教师 AI 素养课堂上,演示了利用 AI 设计中高考英语高频词汇系统的方法。该课程聚焦高考英语备考,旨在帮助英语教师实现减负增效。
研究团队构建了 CodeInsight 数据集,包含 2 个 C++ 课程中 3,286 名本科生提交的 300 多万份代码。基于该数据集建立的基准测试显示,适配的 Recurrent State Space Model (RSSM) 在四个课程中的三个取得了最强的预测准确率。代码和数据集已公开,以支持未来研究。
研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。
RUSPAN 提出一种将评分标准视为语义标签表示的简答题自动评分(ASAS)框架,通过单次 LM 推理对评分等级进行列表式打分。该框架在涵盖英语、德语和葡萄牙语的六个 ASAS 基准上,其单基准评分性能优于判别式和生成式基线模型。
研究通过多学科专家咨询完善了教师教育中的后人类美学教学法(Posthuman Aesthetic Pedagogy)概念框架。专家确认了关系性、中介性等维度的价值,并质疑将技术视为中性工具的观点。该框架将专业判断定位为连接性教学能力,旨在帮助未来教师解读技术中介情境并承担教育责任。
基于新疆五所高校 306 名学生的调查,GenAI 素养显著提升中国大学生的在线学习韧性,且自我效能感在其中起部分中介作用。GenAI 素养的认知意识、使用能力、评估能力和伦理意识四个维度均通过增强自我效能感来促进在线学习韧性。
一项涵盖166个国家14,653名计算机科学学习者的研究发现,生成式AI的普及率在各收入水平国家间差异不大,但低收入国家的学习者将日常AI使用转化为学习用途的可能性显著更低(优势比0.49)。研究提出“接入-转化差距”概念,指出数字鸿沟已从物理接入转向使用转化,且缺乏经验是阻碍转化的主要条件,而非收入本身。
推荐理由:研究基于166国1.4万样本,指出低收入国家学习者AI使用转化为学习行为的概率显著更低,揭示了数字鸿沟的新维度。
厄瓜多尔一项针对 A2 级 EFL 学生的六周准实验研究显示,ChatGPT 与教师结合的混合反馈在语法准确性上未显著优于教师单独反馈。两组学生后测分数均提升,但混合组与教师组的增益差异无统计学意义(p = 0.364)。
基于 OULAD 基准的研究表明,仅利用前四周的 VLE 活动与评估数据即可预测学术风险,全特征模型 ROC-AUC 达 0.7747。移除背景/行政数据后,AUC 降至 0.7504,但在前 5% 高风险学生中精准率从 0.938 降至 0.866。该研究证实了早期预警的可行性,但指出数据最小化本身并非公平性补救措施。
该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。
推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。
该研究构建了整合 MOOC 课前学习、智慧教学(ST)课堂适应及 AI 辅助课后个性化的数学模型。模拟显示,在固定预算下,最优 AI 资源分配策略比按比例分配带来超过 14% 的学习增益。
一项在中国三家医院进行的随机多读者研究显示,双建议 AI 支持能更有效地缓解错误 AI 建议的影响。放射科住院医师在双建议支持下的准确率提升显著高于单建议组,而非放射科住院医师无显著差异。当 GPT-5.4 建议错误时,双建议组(含 Kimi-K2.6 或 Gemini-3.6 Flash)的准确率显著高于单建议组。
该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。
推荐理由:研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。
上海市嘉定区诸佩利学前教育名师工作室联合多机构在叶城幼儿园开展“数智赋能•探究成长”研修活动。活动通过户外观摩、集体教学及案例分享,探讨数智工具在幼儿科学探究中的介入时机与方式。导师诸佩利强调教师需基于儿童真实需求判断工具价值,提出“一个守,两个问”的实践原则。
准确。💯
Concrete 是一款本地优先的 Markdown 工作区,专为 STEM 学科学习设计,支持将笔记转化为主动练习。用户可基于当前笔记生成多选、填空及代码题,并通过 Tutor 模式获取基于材料的解释。该工具支持连接 Codex 或 Claude agent 工作流,并允许在隔离沙箱中执行 Python 代码片段。
Cisco 工程师 Joe Clarke 建议 IT 团队构建可扩展的虚拟环境以支持 CTE 模拟,替代昂贵且难以扩展的物理实验室。CoSN 网络安全主管 Amy McLaughlin 强调需部署高带宽互联网连接及高质量服务器,并严格审查新工具的操作系统版本以规避安全风险。IT 团队应与课程领导者紧密合作,基于实际工作技能需求设计学习体验,并审慎评估 AI 工具在生成场景和个性化辅导中的应用。
Khan Academy 将学生动机视为学习体验的核心组成部分,而非单纯的游戏化奖励。其重新设计的体验通过 Missions 提供清晰度,利用 Gems 和 Khanmigo 配件让努力可视化,并借助 Khanmigo 在卡顿时提供类似导师的支持。
确实如此。🧡
或许在 ed-tech 历史上是独一无二的,AI 已在全球范围内被学生广泛接纳,以至于"AI 不可避免"这一说法在教育话语中变得司空见惯。 https://bit.ly/4rLyCaJ