什么不该上传,以及输出能拿来做什么

梳理上传材料的隐私与版权边界、引用与转述的分寸,并说明模型输出为何不因流畅而自动取得可信来源的地位。

  • 隐私
  • 版权
  • 学术规范
  • 披露

Reading Guide

先问一个问题

把材料交给 AI 处理,在隐私、版权与学术规范上各有哪些不能越过的线?

适合读者
在个人项目中处理他人作品、来信与未刊稿件的读者

Key Points

先记住这些

  1. 先分清材料的性质:他人个人信息、受版权保护的作品、他人未刊稿件、自己的未刊稿件,四类的处理原则不同。
  2. 默认假设是输入内容会离开本机;凡不能接受这一点的材料,就不要用联网服务处理。
  3. 服务条款中的数据保留与训练使用条款变动频繁,应在每次采用前核对当时的条文而非记忆。
  4. 研究已证实训练数据中的片段可能被模型逐字复现,这是把敏感材料交给第三方训练的现实风险。
  5. 版权的核心分际在于是否再现原作的表达;转述与提要通常空间较大,成段复制则相反。
  6. 模型输出不是来源。可以作为线索、初稿或对照,但引用时必须回到原始文献,且使用情况应当披露。

Terms

几个必要概念

数据保留

服务方保存你输入内容的时长与用途。

它决定了同一份材料能否交给某项服务处理,通常写在条款而非产品介绍里。
训练数据提取

从模型输出中还原出训练材料中原样片段的现象。

它说明「材料进了训练集」不只是抽象风险,可能导致内容被他人取回。
披露义务

在成果中说明何处使用了 AI 工具、如何使用。

多个学术出版组织已明确要求披露,且一致认为 AI 不能列为作者。

先把材料分类

  • 他人的个人信息:来信、通讯录、访谈记录、含身份信息的档案。这类材料受个人信息保护类法规约束,未获同意不应交给第三方服务处理。
  • 受版权保护的作品:整本今人专著、点校本、译本、尚在保护期内的论文。可以处理自己合法持有的副本,但不应把整本上传到会保留内容的服务,也不应据以生成可替代原作的产物。
  • 他人的未刊稿件:来稿、审读意见、私下交流的译稿。此处的约束主要来自约定与信义,而非法条。
  • 自己的未刊稿件:风险在于保密与优先权,取决于你能否接受它被保留。
S1S2

版权保护有期限,且各地规定不同;古籍原文本身通常已进入公有领域,但今人的点校、校勘记、注释、导读与排版设计往往另有独立的著作权。把一部点校本整册上传,与把一段先秦原文贴进去,性质完全不同。判断时应看你使用的是哪一层。S2

材料去了哪里

默认假设应当是:输入内容会离开本机,可能被保留一段时间,可能被人工查看以改进服务,是否用于训练取决于条款与设置。这些条款各家不同且时有修订,唯一稳妥的做法是在采用某项服务处理某类材料之前,去读当时的条文并把结论记下来,而不是凭印象。S1

材料一旦进入训练,风险不止于抽象。已有研究从公开模型中还原出训练材料里的原样片段,包括个人可识别信息。这说明「被用于训练」与「可能被他人取回」之间并没有一道可靠的墙。S3

  • 涉他人隐私的材料:先脱敏,把姓名、地址、联系方式替换为代号,处理完再映射回来。
  • 确实不能外传的材料:使用可本地运行的模型,接受能力上的损失。
  • 大部头受版权保护的书:只提交当下需要处理的章节,不整册上传。
  • 任何情况下:把「这份材料交给了哪项服务、依据哪一版条款」记入运行记录。
S1S3

引用、转述与输出的地位

版权保护的是表达而非思想,因此把一段论证的要旨用自己的话说清楚,与整段照抄,处境很不相同。用 AI 生成提要或转述并不改变这一分际:判断依据仍是成品中再现了多少原作的表达。需要注意的是,模型的「转述」有时会大段贴近原文,成稿前应当自己核一遍。S2

更要紧的是输出的地位。模型给出的文献条目、年份、页码、引文,都必须回到原始出处确认之后才能使用;确认之后所引用的是原始文献,而不是模型。多个学术出版组织已就此形成一致意见:AI 工具不能列为作者,因为它无法为内容负责,同时使用者应当在成果中披露使用方式。这两条对个人网站同样适用,甚至更重要,因为个人站点没有编辑与审稿这道外部关口。S4S5

公开之前的自检

个人站点没有编辑与审稿这道外部关口,自检便成了唯一的把关。把它固定成一份清单,比每次凭印象判断可靠得多。清单的次序有讲究:先问材料的来路,再问内容的分寸,最后问表述的责任。前两项若不过关,第三项写得再谨慎也没有用。S4

  • 这页里有没有他人的个人信息,若有,是否已获同意或已作脱敏。
  • 所引原文是否在合理引用的范围内,有没有成段复制可替代原作的部分。
  • 所用的点校、注释、导读是否属他人独立成果,是否已注明。
  • 所有文献条目是否已回到原始出处核实存在且内容相符。
  • 凡属推测的部分,是否已在文字中标为推测,而不是与考实混在一处。
  • 是否已说明本页哪些环节使用了 AI 工具、如何使用。
  • 是否已注明最后修订日期,以及哪些条目仍待考。
S2S4

披露的写法不必冗长,也不宜过谦。一句「本页书目由 AI 辅助初步归并,所有条目已回到原书逐条核实,尚有若干条待考已在文末列出」,比一整段免责声明有用得多,因为它说明的是做法而非态度。读者据此就能判断该以什么眼光看待这份材料,这正是披露的目的。S4S5

最后要提醒一件容易被忽略的事:撤回比发布难得多。网页一经索引、被他人引用、被存入档案站点,即使原页删除,错误内容仍会继续流传。因此在拿不准的时候,宁可先不发布,或先以待考的形式发布并明确标注。把不确定写出来不会削弱一份材料的价值,掩盖不确定才会。

这份清单还应当随着站点的变化而修订。新增一类材料,就要问它属于四类中的哪一类;接入一项新服务,就要重读一遍它的条款并记下结论;某一条法规有了明确变化,就在清单相应处注明。把自检清单当作与体例文件同级的东西来维护,比每次临时判断可靠得多,也使日后回答「当初为什么这样处理」成为可能。

Conclusion

结语

边界问题上没有一劳永逸的规则,只有一个可以反复使用的次序:先问这是谁的材料,再问它会去哪里,最后问成果里能不能说清楚它是怎么来的。三问都能答,才谈得上公开。

仍可追问

  • 中国大陆关于生成式人工智能服务与个人信息保护的具体条款,本文未逐条引用,读者应自行核对现行官方条文原文。
  • 以受版权保护材料训练模型的合法性,各法域仍在诉讼与立法之中,本文不作预判。
  • 服务条款的数据保留与训练使用规定变动频繁,本文未引用任何具体条款文本。

参考资料

  1. S1

    欧洲议会与欧盟理事会.Regulation (EU) 2016/679 (General Data Protection Regulation).2016

    查看来源
  2. S2

    世界知识产权组织.Berne Convention for the Protection of Literary and Artistic Works.1979

    查看来源
  3. S3

    Nicholas Carlini, Florian Tramèr, Eric Wallace, Matthew Jagielski, Ariel Herbert-Voss, Katherine Lee, 等.Extracting Training Data from Large Language Models.2021

    DOI / ISBN:arXiv:2012.07805查看来源
  4. S4

    Committee on Publication Ethics.Authorship and AI Tools: COPE Position Statement.2023

    查看来源
  5. S5

    International Committee of Medical Journal Editors.Recommendations for the Conduct, Reporting, Editing, and Publication of Scholarly Work in Medical Journals.2025

    查看来源