最新消息:关注人工智能 AI赋能新媒体运营

AI文本检测器实测:模仿人类文风后,近三成内容未能识别

科技资讯 admin 浏览

AI文本检测器遭遇"风格模仿"挑战:科学写作成最难识别场景

Epoch AI最新研究显示,主流AI文本检测器在识别普通AI生成内容时表现近乎完美,但当大语言模型刻意模仿特定作者写作风格时,检测准确率明显下降,其中科学写作成为最难识别的场景。

研究团队测试了Pangram(3.3.2)、GPTZero(2026-05-11-base)和Originality.ai(Turbo3.0.2)三款主流AI文本检测器,并构建包含495篇人类原创文本的测试集,覆盖博客、小说和科学写作三类内容。所有样本均创作于ChatGPT 2022年11月发布之前,以避免训练数据污染。

QQ20260720-092411.jpg

测试结果显示,对于普通AI生成文本,三款检测器漏检率最高仅0.7%。在人类文本识别方面,Pangram和GPTZero未出现误报,而Originality.ai误将19篇人类文本判定为AI生成,误报率为3.8%。

研究进一步让Claude Opus 4.8、GPT-5.5和Gemini 3.1 Pro学习作者提供的5篇真实作品,并按相同文风生成新内容。在297篇风格模仿文本中,平均约13%未被检测器识别,其中Pangram漏检率为10%,GPTZero为11%,Originality.ai达到18%。

科学写作成为检测器表现最弱的领域。Pangram、GPTZero和Originality.ai对学术风格AI文本的漏检率分别达到25%、24%和29%。个别模型组合表现更差,例如Pangram漏检了48%由Gemini生成的学术文本,Originality.ai则漏检了39%由GPT-5.5生成的学术内容。

尽管三款检测器采用神经网络、文本可预测性分析和统计模式识别等不同技术路线,但均暴露出相似短板。研究表明,随着大模型越来越擅长模拟人类写作风格,现有AI文本检测技术在教育、科研等依赖学术写作真实性的场景中,仍面临较大的识别挑战。