1. 知网AIGC检测的基本定义及推出背景
知网AIGC检测是中国知网为学术场景推出的AI生成内容识别功能,内嵌在官方学术不端检测系统最新版本里,不是独立于知网查重之外的第三方工具。该功能是知网面向高校、科研院所和学术出版机构推出的学术合规校验专属能力,主要定位为学术管理者提供过度依赖AI生成工具产出的非原创学术内容的甄别服务,以维护学术创作的诚信底线。
2023年以来,ChatGPT等通用大模型迅速普及,很多学生和科研人员开始把AI工具用在论文初稿的撰写、文献的整理、内容的润色等场合,甚至出现了全AI代写毕业论文、学术稿件的灰色产业链,传统的只用文字片段比对的知网查重系统不能识别出这些没有公开发表的AI生成文本,原有的学术不端审核体系存在明显的能力缺口。根据知网官方2023年发布的《学术不端检测系统版本升级公告》,平台在已有的知网查重框架内增加了AI生成内容识别模块,即用户现在所说的知网AIGC检测,专门弥补传统查重不能覆盖的AI生成内容筛查场景。
很多刚开始使用学术检测工具的学生很容易把知网AIGC检测和普通的知网查重混为一谈,两者之间的主要区别就是审核目的不同,普通的查重是比对文本与已发表的公开文献的文字重复度,而知网AIGC检测是判断文本是否为AI大模型直接生成的,是否符合学术场景下的自主创作规范。
国内多所双一流高校联合实测结果表明,知网AIGC检测对于通用大模型生成的连续学术文本检测准确率大于92%,但是对人工深度改写超过30%、加入大量个人原创表述的文本识别准确率只有65%左右,比市面上大多数第三方AIGC检测工具的平均70%左右的通用文本识别准确率要高得多。另外需要特别澄清的是,知网官方从未公布过所谓的AIGC检测30%合格阈值,所有的关于AI生成内容占比的判定要求都是由各个高校、科研期刊根据自身的学术规范细则自行制定的,并没有一个统一的行业标准,网传的各种固定阈值的说法都是不实信息,用户必须以自己所在单位发布的正式学术要求为准。
2. 知网AIGC检测的核心技术原理与判定逻辑
知网AIGC检测的底层运行逻辑和传统的查重字符匹配算法完全不一样,它主要是依靠提取AI生成文本和人类原创文本之间的差异特征,然后利用知网独有的全量学术语料库进行交叉验证,最后得出客观的AI生成特征占比结果。
从技术架构上来说,整个知网AIGC检测的运行流程可以分为四个独立的层次
- 数据接入层:对用户上传的文档进行格式解析,剔除掉非文本内容(图片、公式、参考文献标注等),只留下正文有效的文本片段送入后面的计算环节,防止非正文内容影响最终检测结果的准确性。
- 特征计算层:依靠知网已经训练好的AI生成文本典型特征库,从各个方面提取出文本的专属特征,即语句流畅度异常区间、上下文逻辑同质化程度、专业表述模式固化特征、语义跳转连贯性偏差、术语搭配高频共性等等,把每一段文本变成对应的特征向量。
- 语料核验层:利用知网独家收录的数千万篇学位论文、期刊论文、科研项目报告等正版学术语料创建的专属特征库进行交叉比对,剔除人类学者长期写作形成的固定专业表述习惯,防止将正常的人类原创学术文本当作AI生成内容,这也是知网AIGC检测相比第三方工具最大的场景适配优势,即市场上大部分第三方AIGC检测工具的训练数据集主要是网络公开内容,并没有涵盖学术场景的专属语料,很容易出现把正常的学术写作内容误判为AI生成的情况。
- 结果输出层:使用多维加权评分的方式,对每一段文本的AI生成特征得分进行汇总计算,得到整篇文本的AI生成占比量化结果,并且定位标注出高概率是由AI生成的具体文本片段,便于审核人员快速核验定位。
不同于网传的“AI文本只要调整语序、替换同义词就能绕过检测”的错误经验,知网AIGC检测的判定单元不是单个字符或者句子,而是连续的语义片段特征分布,只做表层的文字改写很难改变底层的语义特征结构,仍然会被系统识别出对应的AI生成特征。
3. 知网AIGC检测的核心功能与适用场景
知网AIGC检测是面向学术场景的专属识别工具,主要作用就是弥补传统学术不端检测体系对于AI生成内容的检测空白,目前主要覆盖四种学术审核场景,国内多所合作高校的实际使用数据显示,各个场景的使用占比情况如下所示。
知网AIGC检测核心适用场景分布饼图
为了便于用户快速对照自己的检测结果含义,我们整理了知网官方检测报告中标注的不同AI生成占比区间的参考说明。
目前知网AIGC检测的三大核心功能作用完全匹配学术全流程的合规需求:
1. 毕业论文与课程作业的AI生成内容筛查:这是知网AIGC检测最核心的使用场景,高校教务部门可以在答辩前批量导入学生提交的毕业论文,快速筛查全稿的AI生成内容占比,甄别出全AI代写的不合格论文;很多高校的图书馆也会给学生提供有限次数的预检权限,学生可以在终检之前自查内容的AI生成特征,提前调整内容以避免不符合要求。
2. 科研期刊投稿稿件的AI辅助撰写合规性校验:国内大部分核心期刊已经将AI生成内容的合规性纳入到投稿审核的过程中,使用知网AIGC检测可以快速地发现投稿稿件中过多使用AI生成的内容,保证稿件的作者原创性符合期刊的投稿要求,从源头上防止有争议的AI生成内容进入学术出版体系。
3. 科研机构项目申报与成果产出的诚信审核:各类科研院所可以使用知网AIGC检测功能,对项目申报书、阶段研究报告、结项成果等材料进行合规校验,保证科研产出的实际研发深度,防止出现完全依靠AI生成内容应付考核的注水成果。
这里也可以借鉴国内某双一流高校文科硕士研究生的真实使用场景案例,该生之前把多篇文献的核心观点用AI工具整合起来生成课程论文初稿,在学校图书馆授权的知网AIGC检测预检中,报告显示初稿中约有32%的片段是AI生成的,他没有直接对这些片段进行同义词替换,而是对照标注位置逐段补充了自己的田野调查获得的一手访谈细节、调整了个人独有的观点推导逻辑,把原本AI总结的共性结论替换成了自己的独立思考内容,二次检测后整段文本的AI生成特征占比降到了8%以下,最终顺利通过了学校课程论文的终检,拿到了课程的优秀评定。
4. 知网AIGC检测的正确使用流程
很多同学以为直接在知网首页就可以找到AIGC检测入口,其实根据知网查重平台的公开规则,该功能目前只对入驻的高校、科研院所等机构账号开放,个人用户暂时不能直接单独使用,大家可以通过本校图书馆提供的知网查重授权渠道同步使用该功能,完整的知网AIGC检测运行全流程如下所示。
1. 权限核验与入口登录:首先需要通过所属高校图书馆官方发布的知网学术不端检测平台入口登录,使用学校统一分配的机构账号进行身份核验,确认当前账号具有知网AIGC检测的调用权限,非官方入口的第三方平台不能提供正版知网AIGC检测服务。
2.提交待检测文档:按照页面提示上传符合格式要求的待检测文档(一般支持Word、PDF两种主流格式,不要插入多余的艺术字体、动态水印等会干扰文本解析的元素),同时准确填写论文作者姓名、论文题目等基础提交信息,确认信息和终稿提交的内容一致。
3.等待系统自动分析:文件上传完成之后系统就会自动完成文本提取、特征匹配、语料交叉核验全流程运算,与传统的知网查重需要数分钟到数十分钟的比对时间不同的是,知网AIGC检测的运算速度更快,普通万字以内的学术文本一般3-5分钟就可以完成分析。
4.获取并解读正式报告:检测结束后平台会生成一份知网AIGC检测专属报告,报告里会显示整篇文本的AI生成特征总占比,并用不同的颜色标出有AI生成特征的段落位置,便于用户对照修改。
不少同学都曾遇到过这样的情况,即随便找一个第三方平台声称可以提供知网AIGC检测服务,但最终得到的检测结果是不准确的,并且提交的未发表论文内容也被第三方平台非法倒卖,造成自己的论文在正式知网查重时出现大面积提前重复的情况,得不偿失。
5. 使用知网AIGC检测的关键注意事项
由于大部分学生都是第一次使用知网AIGC检测这样的新型学术合规工具,在实际使用过程中很容易出现各种各样的合规风险和操作误区,根据知网官方平台的使用规则以及众多高校用户的实践经验,需要特别注意以下三个方面:
5.1 坚决规避非官方第三方检测渠道,保证内容安全
所有没有获得知网官方机构授权资质的第三方平台,都不能调用正版的知网AIGC检测服务,这些平台要么使用自研的小体量AI识别工具输出完全不准确的结果来误导用户,要么打着知网AIGC检测的幌子收集大量未发表的论文内容,之后用于各种论文代写、代降重的灰色交易,很容易造成用户还没有提交学校终检,自己的论文内容就已经在网络上泄露。如果大家找不到正规的入口,就先向自己学校的图书馆文献服务部咨询,确认本校官方提供的知网AIGC检测服务渠道。
5.2 提前确认所属单位的AI生成内容管理规范,不要盲目修改
由于知网官方没有公布统一的合格阈值,不同的高校、不同的学科对于AI辅助写作的包容度存在着较大的差别,理工科类的论文中包含大量的自主实验数据以及推导过程,因此很多院系要求AI生成的比例不能超过10%,而文科类综述性论文中,有些院系允许学生利用AI进行文献梳理、格式排版等辅助性工作,因此对应的AI生成占比要求也会相应放宽。大家拿到检测报告之后,不要盲目地把所有的标注AI特征的片段都删除掉,首先要对照本单位发布的学术规范细则来调整内容,对确实使用过AI润色的非核心段落,只要补充足够的个人原创思考就可以了。
5.3 不要过度依赖AI生成内容完成学术创作,从根源降低识别风险
很多同学的误区是想方设法绕过知网AIGC检测,但是学术写作的核心要求是自主原创,即使通过表层的文字改写暂时降低了AI生成特征占比,在后续的答辩环节中,面对导师关于论文核心观点的提问,如果对自己写的内容没有足够的理解,仍然会出现答不上来的情况。正确的使用AI辅助学术写作的方式应该是,用AI工具完成文献整理、格式调整、语言润色等辅助性工作,而核心的研究思路、实验推导、观点论证等内容全部由自己独立完成,这样最终产出的内容本身就具有了人类原创文本的所有特征,完全不用担心会被知网AIGC检测误判。
常见问题
共 4 个问题,点击展开查看答案
-
普通知网查重主要比对已发表的文献重复片段,而知网AIGC检测专门针对AI大模型生成的文本特征进行识别,两者检测的核心判定维度完全不同,不能互相替代。即使你的论文满足了知网查重的重复率要求,也会在知网AIGC检测中发现有较高比例的AI生成内容,两者都要符合各自单位的审核标准。
-
知网AIGC检测只对合作的高校、科研机构等单位开放权限,个人用户不能直接在知网官网使用该功能,必须通过所属单位的指定渠道提交检测申请。目前大部分高校都已经将图书馆的学生查重服务体系与知网AIGC检测功能同步接入,学生可以凭借自己的校园账号登录图书馆服务系统申请使用。
-
按照规范流程提交的检测文本只是临时的分析样本,不会直接被知网的公开文献对比数据库收录,保证用户提交的内容是安全的。用户完全不用担心自己的未发表毕业论文、期刊投稿内容在预检之后被知网收录,造成以后正式查重时出现重复率异常升高的情况。
-
如果只是对AI生成的内容做少量的同义词替换、语序调整,那么很可能还是会被识别出来是AI生成的,需要进行深层次的内容重构,并且要加入大量的个人原创实验数据、独特的观点和表述逻辑,才能降低被识别的概率。最稳妥的办法就是只把AI生成的初稿当作内容框架的参考,完全用自己的写作习惯、表述逻辑来重写全部内容,补充AI无法生成的个人专属研究细节,这样得到的最终文本自然就没有明显的AI生成特征。