投稿系统的最后一步,往往是一个容易被忽视的下拉框:数据可用性声明(Data Availability Statement)。随着期刊与资助机构对研究数据透明度的要求不断提高,这段几十字的声明已经成为审稿与发表流程的正式组成部分。写得不合规,轻则返修,重则被质疑数据完整性。本文说明常见声明类型、数据准备与合规边界。
为什么期刊越来越重视数据可用性
推动这一趋势的有三方力量:一是期刊出版商,多数主流期刊已把数据声明列为投稿必填项,部分期刊还要求在投稿时直接提交数据;二是资助机构,国内外科研资助体系普遍要求成果附带数据管理计划与共享安排,我国 2018 年印发的《科学数据管理办法》也明确了高等学校、科研院所等法人单位对科学数据的汇交与管理责任;三是学界共识,FAIR 原则(可发现、可访问、可互操作、可复用)逐渐成为研究数据组织的基本框架。对作者而言,数据可用性声明正是这三方要求在论文中的具体落点。
常见声明类型与适用场景
| 声明类型 | 典型表述 | 适用场景 |
| 数据已在文中 | 支持结论的所有数据均包含在文章及补充材料中 | 数据量小、无外部存储需求 |
| 存入公共库 | 数据已存于某存储库并附编号或 DOI | 测序、结构生物学等有领域惯用库的数据 |
| 合理请求获取 | 数据可在合理请求下从通讯作者处获取 | 涉及第三方合作、尚无公共库适用 |
| 受控访问 | 含个人信息或受管理的数据经申请与审批后访问 | 人类遗传资源、临床研究数据 |
| 第三方限制 | 数据归属第三方,使用需直接联系数据持有方 | 企业合作、商业采购的数据 |
注意两点:声明类型必须与实际情况一致,"合理请求获取"不能作为拒绝共享的挡箭牌,部分期刊会跟踪声明执行情况;选择"存入公共库"时,编号与 DOI 要在投稿前真实取得,避免写"将上传"却始终未上传。
数据准备:投稿前把原始数据整理成资产
无论最终选择哪种声明,发表前整理一次原始数据都是值得的。建议按"论文图表—处理数据—原始数据"三层组织:每个图表能追溯到生成它的处理脚本或计算表,原始数据保留仪器导出的最初版本。存储库选择上,通用库(如 Zenodo、figshare、Dryad)适合数据集与补充材料,领域库(如基因序列、表达谱、结构数据对应的专业数据库)适合特定数据类型,以目标期刊推荐列表为准。上传时确认许可协议(如 CC 系列许可)的授权范围,并保持数据集命名与论文编号一致。
用平台化管理降低整理成本
如果实验数据从一开始就记录在统一的电子实验记录平台中,投稿前的数据整理会轻松很多。例如衍因智研云支持实验记录与数据文件的版本化管理,原始数据与处理过程的关联关系天然留存,导出整理成数据集时有据可查,也便于在声明中准确描述数据的生成边界。
合规边界:不是所有数据都能公开
- 人类遗传资源与临床数据:公开共享前需确认伦理批件、知情同意范围与相关法规对数据出境和访问的控制要求,优先采用受控访问模式;
- 商业合作数据:核对合作协议中的保密条款与数据归属,必要时只共享派生数据并注明限制原因;
- 专利相关数据:在专利申请前公开原始数据可能影响新颖性,投稿时间与知识产权策略需要统筹;
- 濒危物种与敏感地理信息:部分期刊对此类数据有专门政策,投稿前查阅期刊数据政策页。
常见问题
数据可用性声明和补充材料是一回事吗?
不是。补充材料随论文发布,声明是关于数据存放位置与获取方式的正式说明;数据可以同时在补充材料和公共库中。
审稿人要求提供原始数据怎么办?
按期刊流程通过编辑部提供,或存入受控存储库后提供访问方式;直接私下发送时也应保留提供记录。
没有外部数据只有图表,声明怎么写?
选择"所有相关数据均包含在文中及补充材料内"即可,不必为了声明而上传无意义的数据集。
数据集上传后还能修改吗?
多数存储库支持版本更新并生成新 DOI,旧版本仍可追溯;论文引用建议指向最终版本。
小结
数据可用性声明的背后,是研究数据从"论文附属品"走向"可核查研究资产"的趋势。投稿前完成一次数据分层整理、选对声明类型、核清合规边界,既满足期刊要求,也让自己在学术交流中处于主动位置。希望从源头减少数据整理负担的团队,可以从统一实验记录平台开始,了解衍因智研云的科研数据管理方案。