Reading Guide
先问一个问题
把材料交给 AI 处理,在隐私、版权与学术规范上各有哪些不能越过的线?
- 适合读者
- 在个人项目中处理他人作品、来信与未刊稿件的读者
Key Points
先记住这些
- 先分清材料的性质:他人个人信息、受版权保护的作品、他人未刊稿件、自己的未刊稿件,四类的处理原则不同。
- 默认假设是输入内容会离开本机;凡不能接受这一点的材料,就不要用联网服务处理。
- 服务条款中的数据保留与训练使用条款变动频繁,应在每次采用前核对当时的条文而非记忆。
- 研究已证实训练数据中的片段可能被模型逐字复现,这是把敏感材料交给第三方训练的现实风险。
- 版权的核心分际在于是否再现原作的表达;转述与提要通常空间较大,成段复制则相反。
- 模型输出不是来源。可以作为线索、初稿或对照,但引用时必须回到原始文献,且使用情况应当披露。
Terms
几个必要概念
- 数据保留
服务方保存你输入内容的时长与用途。
它决定了同一份材料能否交给某项服务处理,通常写在条款而非产品介绍里。- 训练数据提取
从模型输出中还原出训练材料中原样片段的现象。
它说明「材料进了训练集」不只是抽象风险,可能导致内容被他人取回。- 披露义务
在成果中说明何处使用了 AI 工具、如何使用。
多个学术出版组织已明确要求披露,且一致认为 AI 不能列为作者。
先把材料分类
- 他人的个人信息:来信、通讯录、访谈记录、含身份信息的档案。这类材料受个人信息保护类法规约束,未获同意不应交给第三方服务处理。
- 受版权保护的作品:整本今人专著、点校本、译本、尚在保护期内的论文。可以处理自己合法持有的副本,但不应把整本上传到会保留内容的服务,也不应据以生成可替代原作的产物。
- 他人的未刊稿件:来稿、审读意见、私下交流的译稿。此处的约束主要来自约定与信义,而非法条。
- 自己的未刊稿件:风险在于保密与优先权,取决于你能否接受它被保留。
版权保护有期限,且各地规定不同;古籍原文本身通常已进入公有领域,但今人的点校、校勘记、注释、导读与排版设计往往另有独立的著作权。把一部点校本整册上传,与把一段先秦原文贴进去,性质完全不同。判断时应看你使用的是哪一层。S2
材料去了哪里
默认假设应当是:输入内容会离开本机,可能被保留一段时间,可能被人工查看以改进服务,是否用于训练取决于条款与设置。这些条款各家不同且时有修订,唯一稳妥的做法是在采用某项服务处理某类材料之前,去读当时的条文并把结论记下来,而不是凭印象。S1
材料一旦进入训练,风险不止于抽象。已有研究从公开模型中还原出训练材料里的原样片段,包括个人可识别信息。这说明「被用于训练」与「可能被他人取回」之间并没有一道可靠的墙。S3
引用、转述与输出的地位
版权保护的是表达而非思想,因此把一段论证的要旨用自己的话说清楚,与整段照抄,处境很不相同。用 AI 生成提要或转述并不改变这一分际:判断依据仍是成品中再现了多少原作的表达。需要注意的是,模型的「转述」有时会大段贴近原文,成稿前应当自己核一遍。S2
更要紧的是输出的地位。模型给出的文献条目、年份、页码、引文,都必须回到原始出处确认之后才能使用;确认之后所引用的是原始文献,而不是模型。多个学术出版组织已就此形成一致意见:AI 工具不能列为作者,因为它无法为内容负责,同时使用者应当在成果中披露使用方式。这两条对个人网站同样适用,甚至更重要,因为个人站点没有编辑与审稿这道外部关口。S4S5
公开之前的自检
个人站点没有编辑与审稿这道外部关口,自检便成了唯一的把关。把它固定成一份清单,比每次凭印象判断可靠得多。清单的次序有讲究:先问材料的来路,再问内容的分寸,最后问表述的责任。前两项若不过关,第三项写得再谨慎也没有用。S4
- 这页里有没有他人的个人信息,若有,是否已获同意或已作脱敏。
- 所引原文是否在合理引用的范围内,有没有成段复制可替代原作的部分。
- 所用的点校、注释、导读是否属他人独立成果,是否已注明。
- 所有文献条目是否已回到原始出处核实存在且内容相符。
- 凡属推测的部分,是否已在文字中标为推测,而不是与考实混在一处。
- 是否已说明本页哪些环节使用了 AI 工具、如何使用。
- 是否已注明最后修订日期,以及哪些条目仍待考。
披露的写法不必冗长,也不宜过谦。一句「本页书目由 AI 辅助初步归并,所有条目已回到原书逐条核实,尚有若干条待考已在文末列出」,比一整段免责声明有用得多,因为它说明的是做法而非态度。读者据此就能判断该以什么眼光看待这份材料,这正是披露的目的。S4S5
最后要提醒一件容易被忽略的事:撤回比发布难得多。网页一经索引、被他人引用、被存入档案站点,即使原页删除,错误内容仍会继续流传。因此在拿不准的时候,宁可先不发布,或先以待考的形式发布并明确标注。把不确定写出来不会削弱一份材料的价值,掩盖不确定才会。
这份清单还应当随着站点的变化而修订。新增一类材料,就要问它属于四类中的哪一类;接入一项新服务,就要重读一遍它的条款并记下结论;某一条法规有了明确变化,就在清单相应处注明。把自检清单当作与体例文件同级的东西来维护,比每次临时判断可靠得多,也使日后回答「当初为什么这样处理」成为可能。
Conclusion
结语
边界问题上没有一劳永逸的规则,只有一个可以反复使用的次序:先问这是谁的材料,再问它会去哪里,最后问成果里能不能说清楚它是怎么来的。三问都能答,才谈得上公开。
仍可追问
- 中国大陆关于生成式人工智能服务与个人信息保护的具体条款,本文未逐条引用,读者应自行核对现行官方条文原文。
- 以受版权保护材料训练模型的合法性,各法域仍在诉讼与立法之中,本文不作预判。
- 服务条款的数据保留与训练使用规定变动频繁,本文未引用任何具体条款文本。
参考资料
- S1
欧洲议会与欧盟理事会.Regulation (EU) 2016/679 (General Data Protection Regulation).2016
查看来源 - S2
世界知识产权组织.Berne Convention for the Protection of Literary and Artistic Works.1979
查看来源 - S3
Nicholas Carlini, Florian Tramèr, Eric Wallace, Matthew Jagielski, Ariel Herbert-Voss, Katherine Lee, 等.Extracting Training Data from Large Language Models.2021
DOI / ISBN:arXiv:2012.07805查看来源 - S4
Committee on Publication Ethics.Authorship and AI Tools: COPE Position Statement.2023
查看来源 - S5
International Committee of Medical Journal Editors.Recommendations for the Conduct, Reporting, Editing, and Publication of Scholarly Work in Medical Journals.2025
查看来源