跳到正文
arXiv cs.CY· Kazuki Nakajima, Takayuki Mizuno·· 3 小时前精选AI 评分78

arXiv 研究:LLM 版本更替削弱 AI 辅助科学写作检测的可靠性

Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing

AI 导读

arXiv 论文指出,LLM 版本频繁更替导致基于固定基准训练的 AI 写作检测器在模型代际边界处性能崩溃。研究使用 4,000 篇 PNAS 摘要和 23 个 LLM 版本重写文本进行实验,发现检测器在跨越模型代际边界时,误报率或漏报率会急剧上升,建议将检测器基准准确率视为临时状态并随每次 LLM 发布重新验证。

推荐理由

研究量化了 LLM 版本更替对学术写作检测可靠性的影响,为制定动态更新检测策略提供了实证依据。

来源:arXiv cs.CY · arxiv.org