arXiv cs.CY· Kazuki Nakajima, Takayuki Mizuno·· 3 小时前精选AI 评分78
arXiv 研究:LLM 版本更替削弱 AI 辅助科学写作检测的可靠性
Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
AI 导读
arXiv 论文指出,LLM 版本频繁更替导致基于固定基准训练的 AI 写作检测器在模型代际边界处性能崩溃。研究使用 4,000 篇 PNAS 摘要和 23 个 LLM 版本重写文本进行实验,发现检测器在跨越模型代际边界时,误报率或漏报率会急剧上升,建议将检测器基准准确率视为临时状态并随每次 LLM 发布重新验证。
推荐理由
研究量化了 LLM 版本更替对学术写作检测可靠性的影响,为制定动态更新检测策略提供了实证依据。
来源:arXiv cs.CY · arxiv.org