近期,澳大利亚昆士兰科技大学联合国际团队在2026年《英国医学杂志》(BMJ)发表研究,借助基于BERT的AI模型筛查1999至2024年全球260万篇癌症相关论文,识别出超25万篇高度疑似出自“论文工厂”的造假论文,其中与中国机构相关的涉假论文达17万篇,占国内癌症研究总量的36%。涉假论文数量呈指数级增长,2022年占比升至16%,甚至高影响因子期刊的涉假比例也超10%,这一发现直指科研诚信深层问题,更关乎癌症诊疗的安全性与有效性。
AI揪出假论文靠啥?揭秘“论文工厂指纹”识别术
研究团队打造的AI模型,以2202篇已撤稿的造假论文为阳性样本,同等数量的高质量论文为阴性样本,构建起“论文工厂指纹库”。模型通过多维度特征识别造假痕迹:一是文本结构异常,比如过度使用被动语态、模板化固定句式、生硬翻译导致的逻辑断裂;二是数据呈现问题,包括重复实验图像、虚构文献引用;三是作者署名模式可疑,比如批量署名、虚构所属机构。 该模型依托BERT的自然语言处理优势,能精准捕捉非人类写作的特征,但无法直接验证实验数据真实性,需结合图像分析、实验重复性测试等手段进一步确认。内部验证显示模型准确率达91%,外部验证提升至93%,特异度高达99%,仅约1%的误判率,需人工复核关键论文。此外,研究发现胃癌、肝癌、骨癌和肺癌领域的涉假论文占比最高,与这些癌症的高发性及基础研究热度密切相关。
假论文坑惨癌症患者?这些危害你必须知道
涉假论文对癌症研究与临床实践的危害是系统性的:
- 基础研究误导: 虚假数据可能扭曲对癌症分子机制的认知,比如错误标注基因突变与癌症的关联性,导致靶向药物研发方向彻底偏离。
- 临床试验风险: 基于假论文设计的临床试验,可能选用无效靶点,让患者暴露于无效治疗中,甚至面临错误化疗方案带来的伤害。
- 诊疗指南污染: 若假论文被纳入循证医学体系,可能误导癌症筛查标准或治疗路径的制定,比如错误推荐某类免疫治疗方案。
- 公众信任崩塌: 系统性造假会动摇患者对医学科学的信任,部分人群可能拒绝规范治疗,转而选择未经验证的“替代疗法”。 研究估算,每年因涉假论文浪费的科研经费超5亿美元,每延误1年有效疗法的研发,可能增加数万癌症患者的死亡风险。
为啥中国涉假论文占比高?背后的深层原因和风险
中国癌症研究涉假比例较高,与多重因素相关:
- 科研评价压力: 部分学者面临“唯论文”导向的职称晋升、经费申请压力,少数机构为提升论文产出数量,默许甚至纵容论文工厂操作。
- 国际污名化风险: 大规模涉假论文可能引发国际期刊对中国学者成果的系统性怀疑,阻碍真实研究的发表与传播,形成“劣币驱逐良币”的效应。
- 黑色产业链运作: 部分论文工厂提供“全包服务”,涵盖实验设计、数据伪造、图像生成甚至动物实验模拟,形成从写作到发表的完整造假链条。 从区域分布看,中国涉假论文集中于中西部地区院校及附属医院,或与当地科研资源不足、监管能力薄弱有关。
如何堵住论文造假漏洞?这三大层面要发力
重建科研诚信需从技术、制度、文化多维度协同干预:
- 技术层面: 推广AI筛查工具作为期刊预审标准,建立全球论文指纹数据库,实现跨期刊、跨机构的重复发表检测;开发图像真实性验证系统,强制要求论文提交原始实验数据及代码。
- 制度层面: 改革科研评价体系,降低论文数量权重,强化同行评议质量、实验可重复性、临床转化价值等指标;建立科研失信“黑名单”制度,对涉假作者及机构实施学术禁入、经费冻结等惩罚。
- 文化层面: 将科研伦理教育纳入高校必修课程,要求导师签署“学术监护”责任书,对团队成员论文质量负责;鼓励期刊设立“纠错专栏”,公开撤稿原因并追溯学术影响,提升学术共同体透明度。 此外,还需推动建立跨国科研诚信联盟,共享涉假论文线索与调查技术,避免“论文工厂”跨境转移。 根治论文造假需技术、制度、文化协同,守护癌症研究的科学本质与患者权益。

