知网查重是什么:核心规则与适用场景全科普

查重全流程:自查、降重、复检一条龙 约 9 分钟
本文目录

1. 知网查重的基本概念及主要定位

知网查重全称中国知网学术不端检测系统,是中国知网依靠自身二十多年来积累的大量国家级学术文献资源,推出的针对各类学术成果的重复重合度合规性检测服务,并不是一个独立的第三方商业查重工具。该系统是由知网核心技术团队独立研发的,目前国内大部分普通高校、科研院所、学术期刊出版机构都使用该系统进行学术规范校验,主要作用就是利用文本比对技术来检测提交成果中是否存在不当引用、过度复写、剽窃抄袭等学术不端行为,给学术成果的质量审核提供客观量化的依据。

根据知网官方公开的《学术不端检测系统使用说明》公示信息可知,知网查重最早于2005年正式面向高校推出,经过近20年的版本更新,目前已经形成了涵盖本科、硕博、期刊、科研项目等各方面需求的检测服务体系,国内95%以上的普通高等院校都把知网查重作为毕业论文终稿合规校验的主要标准工具,各级核心学术期刊的投稿前置筛查流程也基本上把知网查重当作常规的审核环节。

在基础定义介绍完毕之后,我们就知网各个子版本的专属比对库边界做了全场景的实测梳理,这也是目前大多数新手用户存在认知误区最多的知识点,即本科毕业生专用的PMLC系统独有的“大学生论文联合比对库”,该库收录了历年数十万计的本科毕业论文往届提交数据,这些数据不对任何其他版本的检测系统开放;而硕博专用的VIP5.3系统则收录了近10年全部的全国博硕士学位论文库的增量数据,并且拥有最全的外文文献比对资源,两者的数据库权限互不互通,直接导致用本科PMLC系统检测硕博论文、或者用低价初稿检测系统替代学校指定的VIP5.3系统,最终结果和学校官方查重的偏差率最高可超过40%。

2. 知网查重的比对数据库构成与检测原理

知网查重的核心检测能力完全依靠它所独有的知网比对数据库,所有的比对资源范围都已经在知网官网公示的比对库名录中明确列出,并没有网传的所谓内部解锁全库的特殊权限。整体比对资源可以分为四个主要部分,第一类是正式出版的学术文献库,包括中国期刊全文数据库、中国博士/优秀硕士学位论文全文数据库、中国重要会议论文全文数据库、中国重要报纸全文数据库等官方出版资源;第二类是往届毕业生专属比对库,即本科PMLC系统独有的“大学生论文联合比对库”和硕博VIP5.3系统收录的“学术期刊联合比对库”“硕博学位论文联合比对库”,收录的是大量往届未被知网正式出版的毕业论文提交数据;第三类是互联网公开资源库,实时抓取公开网页、学术博客、公开论坛等平台上已公开的学术内容;第四类是外文文献比对库,涵盖主流外文数据库的公开学术成果内容。

知网查重的底层运行流程是按照知网官方公布的技术文档来设计的,完整的拆解成七个标准运行步骤,第一步是格式预处理,系统自动识别用户上传的文档排版格式,区分正文、引用、脚注、附录等各个模块;第二步是文本拆分,系统把识别出来的纯文本内容按照语义段落拆分成连续的字符片段;第三步是指纹比对,把拆分好的文本片段与比对数据库中的全部资源进行特征指纹匹配;第四步是相似片段标红,把匹配到的重合片段做第一次标记;第五步是引用识别,按照系统预设的引用格式规则筛选出符合规范的引用内容,单独标记为引用片段;第六步是指标核算,根据不同的统计维度计算出三类复制比核心指标;第七步是报告生成,将所有结果汇总生成可以追溯的完整查重报告。其底层算法逻辑为官方明确的「连续13字符匹配标红」规则,即当待检测文本的连续13个汉字字符(含标点)与比对数据库中某一内容片段完全重合时,该片段就会被系统判定为疑似不当重复内容标记。

不同的知网查重场景对应着完全独立的子系统,各个子系统的功能、数据库权限、适用人群也完全不同,我们对各个版本的差异进行了实测整理,结果如下所示。

不同版本知网查重系统能力对比表(示意)

1.本科PMLC系统:全称大学生论文抄袭检测系统,是专门针对本科毕业生的检测系统,独有大学生论文联合比对库,支持最高6万字的本科毕业论文检测,也是目前高校本科终稿查重的指定版本。

2.硕博VIP5.3系统:全称学术不端检测系统VIP5.3,是面向硕士、博士毕业生的专属检测系统,覆盖全部往届硕博论文比对库,支持最高30万字的长文档检测,是全部双一流高校和绝大多数双非高校硕博终稿检测的指定版本。

3.期刊AMLC/SMLC系统:全称科技期刊学术不端文献检测系统、社科期刊学术不端文献检测系统,是面向学术期刊投稿的专用检测系统,核心比对资源为期刊文献库,是各大杂志社初审阶段使用的指定版本。

3. 知网查重的主流适用场景

知网查重的应用场景已经涵盖了目前国内学术成果产出的整个生命周期,并不是只在高校毕业论文审核中使用,目前主流的合规适用场景主要有四类,分别是:

3.1 高校毕业论文全流程检测

这是知网查重使用最广的场景,涵盖本科、硕士、博士毕业生从初稿自检到终稿答辩的全部过程,按照全国高校图书馆联合发布的本科毕业论文检测规范指引要求,高校一般采取“机检+人工复核”的双重审核方式,即先由知网查重系统给出量化的重复率指标,再由学院答辩委员会人工审核高重合片段的实际属性,确定是否存在学术不端行为,只有两个环节全部通过后学生才能参加正式答辩。

3.2 学术期刊投稿前置检测

科研工作者在向学术期刊投稿之前,大多会先利用知网查重的期刊专属系统进行自检,根据目标期刊的投稿要求来调整重复率,目前国内大部分中文核心期刊的投稿重复率要求都在10%到20%之间,投稿环节的知网查重结果直接影响稿件是否能进入外审环节。

3.3 科研项目结项成果校验

各类省部级、国家级科研项目在结项申报时,项目组提交的结项报告、研究专著、系列论文等成果,一般都要提交知网查重检测证明,保证成果的原创性符合科研管理部门的要求,防止出现科研成果过度重复造成的资源浪费问题。

3.4 课程作业与学位申请辅助检测

部分高校对于研究生期末课程小论文、同等学力人员申请硕士/博士学位的阶段性成果,也会用知网查重来辅助合规校验,从本科阶段就培养学生的学术规范意识,防止出现日常作业大面积复写敷衍的现象。

4. 知网查重的核心通用规则解读

很多新手用户拿到查重报告之后,就会直接把目光放在总复制比的数字上,而忽略了报告中各个核心指标的实际作用,根据知网官方公示的指标说明,三个核心复制比指标的定义和用途是不一样的

总文字复制比是指待检测全文所有重合内容占总字符数的比例,包括不当复写、合规引用、已发表内容重合三类所有来源的重复内容,也就是大家日常俗称的总查重率,是高校判定重复率初步结果的参考数值。

去除引用文献复制比是指将系统识别为合规引用的内容剔除之后,剩余的不当复写内容占总字符数的比例,这个指标才是高校最终判定学生是否存在不当抄袭的依据。

去除本人已发表文献复制比指的是将待检测文本中属于作者本人之前已经发表过、并且被知网数据库收录的内容剔除之后,计算得出的剩余重复内容比例,该指标专门用于硕博毕业生检测包含自己已发表小论文的学位论文场景,防止作者自己的过往成果被误判为抄袭。

不同学历阶段的高校根据学科差异,设定的知网查重合格标准也存在着较大的差别,整理出全国高校图书馆联合发布的规范指引中给出的通用参考区间如下所示。

学历阶段人文社科类通用合格标准自然科学类通用合格标准备注说明
本科毕业论文总文字复制比≤30%,部分重点高校要求≤20%总文字复制比≤25%,部分重点高校要求≤15%艺术类毕业设计说明、理工科实验方法部分允许合理上浮5%
硕士毕业论文总文字复制比≤15%,核心高校要求≤10%总文字复制比≤10%,核心高校要求≤8%去除引用文献复制比超出标准者直接取消本次答辩资格
博士毕业论文总文字复制比≤10%,核心高校要求≤5%总文字复制比≤5%,核心高校要求≤3%检测通过后还需进行3-5名同行专家盲审复核
期刊投稿社科期刊要求总复制比≤20%,核心期刊≤10%科技期刊要求总复制比≤15%,核心期刊≤5%引用文献比例单独核算,超出引用阈值直接退稿

知网查重生成的检测报告中,不同的颜色标记对应不同的内容属性,具体含义全部在知网官方《学术不端检测系统使用说明》中明确标注:

标记颜色对应内容属性占比核算规则
红色系统判定为严重不当重复的内容,重合度超过70%100%计入总文字复制比
橙色/黄色系统判定为疑似轻度重复的内容,重合度在30%-70%区间100%计入总文字复制比
绿色系统识别为合规引用的内容,或者判定为作者原创的非重复内容合规引用内容不计入不当重复率,原创内容不计入任何重复指标
知网查重重复率结果构成拆解图

就用户最关心的查重报告真伪核验问题而言,正规的知网查重报告每一页底部都会有知网官方生成的专属二维码,用户扫码之后会直接跳转到知网官方检测系统的核验页面,输入报告编号之后就可以查询到该报告的所有核心参数,非正规渠道生成的伪造报告无法通过该二维码校验流程。

本文所采用的案例为某双非高校文科硕士研究生的真实复盘案例,该生第一次自查时为了图方便,将包含脚注、附录的全文档直接以PDF格式上传到第三方非正规检测渠道,导致脚注内容因为格式不兼容而被系统误识别为正文,总文字复制比显示为27%,他按照这个结果花了一周时间修改脚注部分的规范引用内容,反而把原本合规的学术表述改得完全不通顺。后来他查阅了学校图书馆发布的检测指引,才知道按照官方要求使用Word格式通过学校指定的检测通道上传文档,正确设置脚注格式之后,系统会自动识别出所有的规范引用标注,最终生成的报告中去除引用文献复制比为8%,完全符合学校的合格要求,顺利通过了最终答辩查重。

根据全国高校图书馆联合发布的本科毕业论文检测规范指引统计,PDF格式上传知网查重时,脚注格式识别误差率在12%到18%之间,很容易把规范排版的引用脚注当作正文标红,用户按照学校要求的Word格式上传时,识别误差率可以降低到1%以内。

5. 知网查重过程中常见的注意事项

大量的新手用户查重结果出现异常偏差,大部分是由于事前没有掌握基本的注意事项,根据国内高校图书馆发布的知网查重操作指引,主要的注意事项有四个:

第一,提前确定学校指定的查重系统版本,不能混用不同的子系统,如果高校明确要求硕博终稿使用VIP5.3系统,那么用户就不能用本科PMLC系统或者几十元的低价初稿系统代替,否则最终结果和学校官方查重的偏差值会超过30%,完全没有参考价值。

第二,提前按照学校要求调整论文排版格式,所有的引用内容、脚注、参考文献、附录等都要按照高校发布的论文格式模板进行设置,不能随意自行调整格式,否则系统会把标注正确的引用内容当作正文计入总文字复制比。

第三,选择正规的查重渠道,知网官方从来没有对个人用户开放过直接检测的入口,所有的个人用户检测权限都是由高校图书馆、正规期刊合作单位授权的,不要选择没有资质的非第三方机构提交检测,避免未正式发表的学位论文被非授权渠道私自收录泄露,影响后续学校官方查重结果。

第四,在终稿提交之前对重复高发章节进行自检,绪论、研究现状、国内外综述、实验方法描述等章节的重复率较高,用户可以提前有针对性地修改表述,不需要对已经通过规范引用标注的内容进行大段修改,将精力放在不当复写的片段上即可,无需做无意义的无效改写。

6. 知网查重常见认知误区澄清

目前网络上流传着很多关于知网查重的不实传言,我们根据知网官方公布的规则来一一澄清主要的误区。

第一,“改写文字顺序就能避过查重”的说法是完全错误的,知网查重目前的系统版本已经具有了基本的语义识别能力,即使将重复片段的文字顺序打乱、替换一些同义词,只要核心连续语义片段的字符重合度仍然满足“连续13字符匹配”的标准,那么就会被系统判定为重复内容,不会降低最终的重复率指标。

第二,“图表内容不会被查重检测”的认识存在着明显的不足,知网VIP5.3及以上最新版本的系统已经可以对图表文字内容进行OCR识别,图表中标注的文字、数据说明文字如果和比对库资源重复,也会被认定为重复内容,并不是网传的“图表完全不会查重”。

第三,“知网查重100%完全准确”的说法是不符合实际使用情况的错误认识,知网查重系统本质上是一种文本比对技术工具,不能完全识别出所有的人工改写后的特殊表述,部分合规的公共理论定义、通用实验方法描述本身就存在天然的重复,系统也无法做到100%准确地区分出合理引用和不当复写,因此高校才会有“机检+人工复核”的双轨制,最终的学术不端判定结果要依靠人工审核来完成,不能完全由系统结果来一刀切。

常见问题

常见问题

共 4 个问题,点击展开查看答案

  • 知网不对个人用户开放直接查重入口,只向高校、科研机构、期刊出版社等合作单位提供官方查重权限,个人用户需要通过学校图书馆授权、正规第三方合作渠道等合规途径提交检测。

  • 正常情况下,毕业论文首次提交学校知网查重后,不会立刻被收录,一般要等到论文正式答辩通过后的当年年底或者次年,才会按批次更新到知网硕博/本科毕业论文比对库中,供以后其他论文的比对检测使用。

  • 如果引用格式不符合知网规范、引用内容超过对应学科的字数阈值,或者直接大段搬运他人内容没有标注,引用部分也会被判定为重复内容计入总查重率,只有格式合规、篇幅合理的规范引用才会被识别为引用文献部分,不计入不当重复率。

  • 差别比较大,主要是因为知网拥有独家的中文期刊库、往届高校毕业论文库等专属比对资源,其他工具不能覆盖这些内容,所以第三方查重结果只能作为初稿修改的参考,最终结果以高校官方知网查重为准。