低估贡献,高估影响:用数据库评估早期研究者时的两个盲区
文中案例均已匿名化:不出现姓名、拼音、机构和 DOI,论文以 A/B/C 指代。
0. 一个被推翻的判断
前不久,我需要了解一位刚硕士毕业的研究者:他做过什么,做到什么程度,适不适合继续读博。招生、招聘和合作前的背调里,这类判断很常见。最省事的做法,是去 OpenAlex 这类开放文献数据库查他的作者记录。
第一轮结论来得很快。数据库列出了他近两年的几篇论文,其中不乏高影响力期刊,但每一篇的作者位置字段都写着 middle。结论似乎很清楚:他是课题组里的参与者,没有做过一作。
第二轮我换了个办法,直接读论文的开放获取全文,结果在其中一篇 Science 子刊论文的首页脚注里看到一行小字:
† These authors contributed equally to this work.
† 标在前三位作者身上,他是其中之一。他是这篇论文的共同第一作者。
同时我还注意到另一组对不上的数字:数据库里,这个作者 ID 的累计引用有数千次;而在学术网站自动生成的作者与机构页面上,他的引用只有数十次。两者相差约 40 倍。
两个数字都出自看似权威的数据源,一个把他的贡献算小了,一个把他的影响力算大了。这篇文章讲这两个盲区是怎么产生的、有多普遍,以及怎么绕开它们。
1. 盲区一:共同一作在索引里会”消失”
1.1 数据是怎么一路传下来的
一篇论文的作者信息,从出版商到你的查询结果,大致要经过三站:
1 | 出版商排版系统(JATS XML,含脚注) |
问题出在第一站到第二站之间。Crossref 的作者元数据里,表示顺序的只有一个 sequence 字段,取值只有 first 和 additional 两种,**没有任何字段能表达”并列”**。出版商 XML 里的 † 脚注,在登记元数据这一步就丢掉了。
下游的 OpenAlex 同样只按署名顺序给出 first、middle、last 三种位置。对一篇有三位共同一作的论文,数据库只会告诉你:第一位是 first,另外两位是 middle,和排在第十位的作者没有区别。
1.2 这个缺口有多大
如果共同一作很少见,这个缺口无关紧要。事实正好相反。
一项基于 PubMed 与 PMC 的大规模文献计量研究(arXiv:2603.23569)统计了 2010–2024 年间约 48 万条带等同贡献标注的记录,发现:
- 共同一作的比例在 2017 年后明显加速上升;
- 在期刊层面,带标注论文所占比例的中位数从 2015 年的约 19% 升到 2024 年的 30% 以上,部分期刊超过 50%;
- 按分数计数,**中国的贡献占 40.8%**,远高于其他国家。
另一篇发表在 PLoS Biology 上的观点文章(Shou, 2026)直接指出:等同贡献信息在索引过程中常规性地丢失,造成了学术认可上的不公平。
两件事放在一起,推论很直接:对中国生物医学领域的研究生来说,”数据库看不到共同一作”很可能是常态,不是个例。 上述研究还发现,等同贡献标注集中在靠前的署名位置,而这正是研究生最常出现的位置。最需要被准确评估的早期研究者,很可能也是受影响最大的群体。
1.3 实测:三篇论文,三种结果
回到开头的案例。在他的论文里,有三篇能拿到开放获取全文,我逐一核对了脚注:
| 论文 | 类型 | 数据库给出的位置 | 全文脚注 | 实际身份 |
|---|---|---|---|---|
| A | Science 子刊,原创研究 | middle |
† 标注前三位作者,含本人 | 共同一作 |
| B | 材料/生医类一区期刊,原创研究 | middle |
无等同贡献脚注 | 中间作者 |
| C | 综述 | middle |
# 仅标注另外两位作者 | 中间作者 |
同样写着 middle,背后是两种完全不同的贡献。只看数据库字段,论文 A 和论文 B 无法区分。
1.4 顺带发现:通讯作者字段也不可靠
OpenAlex 其实提供了一个 is_corresponding 字段。按理说,它能帮我们找到论文的通讯作者,也就是通常意义上的课题负责人。我顺手用这三篇论文检验了它:
| 论文 | 全文中的实际通讯作者 | OpenAlex is_corresponding 标记 |
结果 |
|---|---|---|---|
| A | 仅末位作者(1 人) | 第 1、2、3 位 + 末位(4 人) | 把 † 共同一作误标为通讯作者 |
| B | 倒数两位作者 | 倒数两位作者 | 正确 |
| C | 倒数两位作者 | 无人被标记 | 完全缺失 |
论文 A 最值得注意:被错误标记的三个人,正好是 † 标注的三位共同一作。一个合理的推测是,元数据解析时 † 这类脚注符号被笼统地当成了”特殊作者”标记。这个推测我没有进一步验证。
也就是说,等同贡献信息不一定只是”丢失”,有时还会被误读成另一种身份。 一个依赖 is_corresponding 识别导师的评估工具,会在论文 A 上得出”这名学生是通讯作者之一”的结论。这比信息丢失更糟。
1.5 技术细节:JATS 里至少有三种写法
既然元数据靠不住,就只能回到全文。Europe PMC 为开放获取论文提供 JATS 格式的全文 XML(/{pmcid}/fullTextXML)。但读脚注比想象中麻烦,因为各家出版商的写法不统一。这次实测我遇到了三种。
写法一:作者节点上的属性。 这是 JATS 标准里最规范的形式。
1 | <contrib contrib-type="author" equal-contrib="yes"> |
写法二:独立的脚注,通过 id 回指。 脚注写在 <author-notes> 里,作者节点只放一个引用。
1 | <author-notes> |
写法三:只有符号,而且 <contrib> 连类型属性都没有。
1 | <contrib> |
第三种最容易漏。我的第一版解析逻辑只匹配带 contrib-type="author" 的节点,在论文 C 上一个作者都没解析出来。
稳妥的做法是反向映射,分三步:
- 找出所有正文含 “contributed equally””equal contribution” 一类表述的脚注,记下它们的 id;
- 遍历所有作者节点,不预设它们带什么属性;
- 节点只要满足以下任一条件,就判定为等同贡献作者:
- 带
equal-contrib="yes"; - 引用了第 1 步中的某个 id;
- 引用文本本身就是 †、#、‡ 之类的符号。
- 带
1 | eq_ids = {fid for fid, body in footnotes if re.search(r"contributed equally|equal contribution", body, re.I)} |
还有一个反例要排除:论文 B 的全文里也出现了 “contributed equally” 这个短语,但它不在作者脚注里,而在全文其他位置。只用关键词匹配全文会误判,必须把脚注和作者节点对应起来。
1.6 读不到的部分,就老实写”不知道”
这个方法有明确的边界:只对开放获取、且被 Europe PMC 收录全文的论文有效。这次核查的五篇论文里,有两篇拿不到全文 XML,共同一作情况无法确认。
这时最糟的做法,是退回去相信数据库的位置字段,写上”中间作者”。正确的输出是 unknown,同时把”查看出版商原文首页”列为待办。**”不知道”是一个合法的结论;把”不知道”写成”不是”,才是错误。**
2. 盲区二:同名作者被合并进同一个 ID
2.1 一个 ID,几个人
开头提到的”数千次引用”是怎么来的?打开这个作者 ID 下的完整作品列表,就一目了然:
- 二十余篇论文,跨越医学、农学、植物学等至少五个互不相干的领域;
- 作品时间跨度十余年,远长于一个刚毕业硕士生的学术生涯;
- 同一个 ID 的”最近机构”里,同时出现了一所医学院和一个农业研究所。
真正属于这位研究者的,只有其中 2025–2026 年的一小簇。其余作品至少来自另外四位同名或近似同名的研究者,被数据库的消歧算法合并到了一起。
需要说明,”数千对数十”并不是严格的同口径比较,各平台统计引用的方法本来就有差异。但几十倍的差距远超口径差异能解释的范围,主要来源就是这些混入的作品。
有意思的是,这个问题在我第一次检索时就出现了:用他的名字做网络搜索,排在最前面的是另一位同名的农业环境领域研究者。
2.2 为什么会发生
作者消歧本质上是一个聚类问题:把署名字符串相同或相似的作品,按合作者、机构、主题、ORCID 等特征归到同一个人名下。下面几个因素会让它失效:
- 拼音重名率高。 中文名转成拼音会丢失大量信息,不同的汉字和声调会落到同一个拼写上。像”张伟”这样的常见名,在英文文献里对应成百上千个不同的人。
- 缩写放大冲突。 双字名常被写成首字母缩写,或拆成两个音节。同一个人可能有好几种署名形式,而不同的人又可能共享同一种。
- ORCID 覆盖不全或关联错误。 某个 ORCID 一旦被错误挂到一个聚类上,就会成为”锚点”,把更多作品吸进来。
2.3 识别信号
在引用任何基于作者 ID 的数字之前,至少检查以下几点:
- 机构列表是否混杂:是否同时出现毫无关联的机构类型,比如医院和农业研究所。
- 主题跨度是否合理:一个研究生两三年内不太可能横跨五个领域。
- 时间线与学术年龄是否吻合:硕士生名下出现十几年前的论文,基本可以断定是合并错误。
- 与独立来源交叉比对:本人认领或维护的主页、ORCID,以及各学术平台的作者页面,都可以作为参照,逐篇核对并剔除不属于他的作品。注意,自动生成的作者页面本身也是消歧算法的产物。本案中它恰好是对的,但不能默认如此;多个来源互相印证才可靠。
- 用主题关键词过滤:在工具层面,可以只保留标题含其研究方向关键词的作品,作为一道粗筛。
2.4 后果:所有基于 ID 的指标都被污染
一旦 ID 合并出错,受影响的不只是引用数:
- h-index 与总引用:被他人的高被引论文抬高;
- 合作网络:混入完全不认识的合作者,”最常合作者”的判断可能失真;
- 研究方向演化:会画出一条根本不存在的”从消化内科转向植物学”的研究轨迹;
- 机构履历:凭空多出几段从未有过的任职经历。
对只有几篇论文的早期研究者来说,混入的作品很容易比他本人的还多。这时数据库里的”他”,在统计意义上已经是另一个人了。
3. 两个盲区叠加:方向相反,都不报错
把两个盲区放在一起看,会发现一个令人不安的结构:
| 盲区一:共同一作丢失 | 盲区二:同名合并 | |
|---|---|---|
| 影响对象 | 个人贡献 | 影响力指标 |
| 偏差方向 | 低估 | 高估 |
| 是否报错 | 否 | 否 |
| 数据看起来 | 完整、规范 | 完整、规范 |
同一个人可以同时被低估和高估。在这个案例里,他真实的共同一作身份被抹去,同时又被记上了数十倍于自己的引用。两种偏差甚至可能在某个综合评分里部分抵消,让最终分数显得合理,从而更难被发现。
更要紧的是,两种错误都不会触发任何警告。数据库返回的是格式规范、字段齐全的 JSON,没有任何标记提示”这个字段可能不准”。依赖这些数据自动生成评估报告的系统,无论是传统的人才评估工具,还是如今越来越常见的 AI agent,都会原样继承这两个盲区,并用非常自信的语气输出结论。
这也是开头”第一轮结论”犯错的原因:它没有算错,只是太相信字段的字面意思。
4. 一份可操作的核查清单
基于公开记录对一位早期研究者下结论之前,建议至少完成以下五步:
先确认身份,再谈指标。 用多个独立来源确认数据库中哪些作品真正属于他,用机构、主题、时间线三个信号排查合并错误。所有指标只在清洗后的作品集上计算。
共同一作只看全文脚注。 不要用
author_position判断是否一作,也不要用is_corresponding判断是否通讯作者。开放获取论文读 JATS 全文;拿不到全文的标记为unknown,不要退回位置字段。识别课题负责人,区分平台与个人。 在清洗后的作品集中,出现最频繁、且反复位于通讯作者或末位的合作者,通常就是导师或课题负责人。据此可以追问一个关键问题:这位研究者有没有不以该导师为通讯作者的工作?这一步是推断,需要用课题组主页或学位论文致谢核实。
诚信信号只作参考。 PubPeer 评论和撤稿、更正记录(可通过 Crossref 的
update-to字段查询)值得查,但”没有记录”只说明当前没有公开质疑。PubPeer 主要捕捉图像和数据重复问题,覆盖不了方法学上的争议。区分”已核实”和”推断”。 学位状态、毕业时间、去向这类信息,不在任何文献数据库里。报告中凡是推断得出的结论都应明确标注,并写清楚没能核实什么。
5. 一个小工具
我把上述流程中能自动化的部分整理成了一个命令行脚本和一份 agent skill 说明,开源在 GitHub:gsioeo/early-career-researcher-record-skill。
它依次调用 OpenAlex、Crossref、PubPeer 和 Europe PMC 四个免密接口,完成三件事:
- 列出候选作者 ID,并提示同名合并风险;
- 逐篇检查 PubPeer 评论和撤稿、更正记录;
- 从开放获取全文的脚注中识别共同一作。
1 | python researcher_audit.py --dois 10.xxxx/aaaa --surname Lastname |
它刻意不做几件事:不自动判定谁是导师,因为通讯作者字段不可靠,而且这本身是推断;不给研究者打分;也不猜测学位状态。这些判断应该留给人,至少也应以”推断”的身份出现。
6. 局限与伦理
方法的局限。 全文脚注核查只覆盖被 Europe PMC 收录的开放获取论文,付费论文仍需人工查看出版商页面。PubPeer 查询用的是其浏览器插件的公开接口,没有正式文档,随时可能变化。本文的实测样本很小:一位研究者,三篇可读全文的论文。它只能说明问题存在,不能说明问题有多普遍;普遍程度请以文中引用的大规模研究为准。
伦理。 这类核查的对象是可识别的具体个人,应当只用于正当目的,例如招生、招聘、合作前的尽职调查,或核查自己的记录;生成的报告应当私下保存。还要记住:数据库里的错误,从来不是被评估者的错误。一个学生不应因为出版商的元数据格式丢掉了他的 †,就被认为”没做过一作”;也不应因为算法把别人的引用算到他头上,而背负不属于他的期待。
结语
数据库给出的是线索,不是结论。
对成熟的研究者来说,几百篇论文和几十年的履历足以冲淡这些误差。可对只有几篇论文的早期研究者,一个丢失的 †、一次错误的合并,就可能完全改写他的画像。而他们恰恰最常被这样评估。
在按下”生成报告”之前,花十分钟读一读论文首页的脚注。
参考文献
- Trends in Equal-Contribution Authorship: A Large-Scale Bibliometric Analysis of Biomedical Literature. arXiv:2603.23569, 2026.
- Shou W. We need to correct the wide-spread omission of equal contribution in article indexing. PLoS Biology, 2026, 24(4): e3003746. https://doi.org/10.1371/journal.pbio.3003746
- OpenAlex API 文档:authorships 对象(
author_position、is_corresponding)。 - Crossref REST API 文档:作者
sequence字段与update-to关系。 - JATS 标签集:
<contrib>的equal-contrib属性与<author-notes>。