1. AIGC文本识别:新手入门的核心定义澄清
AIGC文本识别和传统内容查重工具的多维度对比图
很多文科研究生会用ChatGPT生成课程作业的初稿框架,然后逐句修改表述习惯、补充个人实验案例,再用Turnitin AI检测功能自检,修改后的内容基本上可以通过学校的学术诚信检查,这也是目前AIGC文本识别最典型的用户使用场景之一。本文只供参考、学习使用,不得用于学术不端行为,不得教唆他人代写、规避查重、降低AIGC/查重率过审。
2. 市面主流AIGC生成文本的3类显性特征
不同的大模型生成的文本有可感知的差异痕迹,这也是新手进行AI生成文本痕迹检测的基本判断依据。
- GPT系列模型生成的文本一般都比较流畅,转折词的分布概率接近训练集的平均值,很少会出现人工写作中常见的口语化停顿、局部逻辑跳跃、个人专属经验表述断层等现象。
- 文心一言的中文生成内容更倾向于官方规范的表达,很少有小众的网络词汇、个性化的方言表达,行文风格统一规整,个人写作的记忆点痕迹很少。
- Claude生成的长文本逻辑衔接密度远远大于普通人工写作,段落之间没有任何多余的信息,普通人长时间手写长文很难做到全程无冗余句。
根据以上三种特征,普通用户可以掌握两种零成本基础识别小技巧,第一种是随机截取文本中三个连续的特殊表述片段,将词汇顺序随机打乱重新排序,人工通读是否有明显的逻辑断裂感,AI生成内容语序调整后大概率会出现语义不通顺的问题;第二种是逐句检查文本是否完全没有个人专属经验类的细节描述,通篇都是通用常识性内容,这类文本大概率存在AI生成嫌疑。需要特别指出的是,这两种方法只适合于新手初步筛查,不能代替专业的商用检测工具。
3. AIGC文本识别的3类主流实现方式
目前行业内的AIGC文本检测工具都是基于三种已经过验证的技术路线进行开发的,相关的准确率数据均来自于权威的公开渠道。
AIGC文本识别从文本输入到结果输出的全流程示意图
- 语义特征指纹比对:核心就是提前提取GPT系列、文心一言、Claude等主流大模型训练时的文本特征指纹库,把待检测文本的特征和指纹库进行匹配比对,这类工具的准确率参考Turnitin官方公开白皮书数据,对于未经过改写的AI生成文本识别准确率达到98%,是目前学术场景下的主流技术方案
- 语序概率偏差校验:根据自然语言生成判别逻辑,统计待检测文本每个后续词汇出现的条件概率,与大语言模型生成时的平均概率区间进行偏差校验,此类工具对短文本的检测灵敏度较高,对100字以上的纯AI生成内容识别准确率可达92%
- 生成式水印识别:依靠部分大模型在生成内容的时候自动植入的隐形语义水印特征来完成判别,这类工具的准确率参照国内AI内容检测平台公开测试报告,对于原生带水印的生成文本识别准确率可以达到99%,但是对去除水印的改写文本识别效果不佳
目前市面主流AIGC文本识别工具的核心参数如下:
4. AIGC文本识别的4大常见应用场景
AIGC文本识别的应用场景已经涉及到内容原创性很强的各个领域,各个领域中都有大量的普通用户真实操作案例
AIGC文本识别多场景应用分布占比(示意)
- 学术诚信场景:国内某211高校文学院的研究生,用ChatGPT生成课程论文的初稿框架之后,自己又添加了3份个人田野调查的一手访谈资料,逐句修改了AI生成的规整表达,最后用Turnitin AI检测自检,结果显示AI生成占比小于10%,通过了学院的学术诚信审核
- 内容平台治理场景:某头部自媒体平台的内容运营人员,日常使用AIGC文本识别工具对用户投稿内容进行筛查,每周可以过滤掉近200篇完全由AI批量生成的低质水文,大大降低了平台的内容同质化率
- 招聘简历筛查场景:部分互联网公司在批量校招的时候,会使用AIGC文本识别工具对简历的自我介绍、自荐信进行筛查,防止出现大量的由AI统一生成的同质化简历,从而提高招聘筛选的效率
- 自媒体内容风控场景:很多个人自媒体作者在发布原创内容之前,都会先用AI生成内容识别方法自检,防止自己写的行文风格过于规整的内容被平台误判为AI水文,从而影响内容的推荐流量。
5.目前AIGC文本识别技术普遍存在的不足
尽管主流商用工具的公开准确率数据很好,但是整个行业目前仍然没有100%识别率的AIGC文本识别产品
- 经过人工逐句深度改写、替换大量个人专属经验表述的AI生成内容,几乎不能被常规工具准确识别
- 短文本长度小于100字时,由于可以提取的生成特征较少,所以大部分工具的AIGC文本识别准确率都会降到70%以下
- 一些小众开源大模型生成的文本并没有被收录到现有的工具特征指纹库中,因此也很容易出现漏判的情况
常见问题
共 4 个问题,点击展开查看专业解答
- 核心解答与操作要点
不可以,目前AIGC文本识别工具普遍存在一定的误判率,经过人工改写、低采样温度生成的AI内容很容易被误判为原创,结果只能起到辅助参考的作用,不能作为绝对判定的依据
- 核心解答与操作要点
如果是需要发布原创内容的自媒体从业者、撰写学术论文的学生、审核投稿内容的编辑等人群,那么使用AIGC文本识别工具可以帮助他们校验内容的原创性,防止因为不小心混入大量的AI生成内容而产生的合规风险
- 核心解答与操作要点
会的,当人工撰写的内容行文风格过于规整、句式重复率低、逻辑连贯的时候,部分识别模型会把它判定为AI生成的内容,这种误判是目前技术阶段的正常现象
- 核心解答与操作要点
主要是由识别模型训练数据集所包含的大模型种类、待检测文本长度、AI生成文本时的参数设置、人工改写程度等因素决定的
下集将讲解语义层去AI味的主要方法,使你对合规调整AI生成内容有更深入的了解。