同一份大纲,两个检测器给出的答案差了十几倍。Google DeepMind 与多家顶尖实验室合作的一篇论文,提出了一个专门检测"AI生成创意"的工具 IdeaLens。它不读文字,只读大纲。
论文里有一组对比数据:当 AI 根据某人的完整大纲写作时,IdeaLens 只把 7% 标记为 AI,而 Pangram 4 标记了 92%。反过来,当 50 篇故事由人根据 AI 生成的大纲写成时,IdeaLens 标记了 68%,Pangram 4 只标记了 8%。
![]()
两个检测器,测的根本不是一回事
![]()
Pangram 这类工具判断的是"谁写了这些字"。所以它经常把经过 AI 润色的人类作品标成 AI,又漏掉那些由 AI 出点子、人自己动笔写出来的内容。
IdeaLens 判断的是另一件事:一份文档提出的那串要点,究竟来自人还是 AI。它读的是一份短清单,也就是文档到底讲了哪几个点,而不是这些点被写成了什么句子。
为了确保它不是在靠措辞作弊,训练时用的是改写过的要点列表,让文字风格帮不上忙。这样一来,它只能从"想法本身"里找线索。
为什么大纲能暴露创意的来源
论文的发现是:读一份文档的大纲,而不是读它的字句,就能让检测器判断出这些想法是人想出来的还是 AI 想出来的。
这个结论直接指向一个现实问题——关于原创思考的规则,不能依赖那些只判断措辞的检测器。因为只判断措辞的工具,既会误伤人类被 AI 润色的作品,也会放过那些 AI 出思路、人类执笔的内容。
![]()
换句话说,检测的对象从"文字"挪到了"结构"。一份文档的骨架,比它的皮肤更能说明问题。
创意归属的判定,正在换赛道
正方会认为,这是检测思路的一次必要转向。既然 AI 已经能写出流畅到无法分辨的句子,继续在措辞层面做检测,等于在一条越来越模糊的边界上找答案。把检测对象换成大纲,等于绕开了这个死结。
反方则会追问:大纲本身也是可以被 AI 生成的,那么当 AI 生成大纲、AI 再根据大纲写作时,这套检测还站得住吗?论文给出的数据只覆盖了"人写大纲 AI 写文"和"AI 写大纲 人写文"这两种交叉情形。
我的判断是,这篇论文真正的价值不在于 IdeaLens 这个工具本身,而在于它把问题重新定义了一遍。过去大家问的是"这段文字是不是 AI 写的",现在的问题变成了"这个想法是谁的"。前者是文本鉴定,后者是创意归属。
当规则需要判断原创思考时,检测器读什么,决定了它能判断什么。读字句的检测器,判断不了想法从哪来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.