AI训练数据合规指南-含数据来源和授权_第1页
AI训练数据合规指南-含数据来源和授权_第2页
AI训练数据合规指南-含数据来源和授权_第3页
AI训练数据合规指南-含数据来源和授权_第4页
AI训练数据合规指南-含数据来源和授权_第5页
已阅读5页,还剩12页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

AI训练数据合规指南——含数据来源和授权

标签:AI训练数据合规|数据来源合法性|版权授权|个人信息保护|数据出境|合规管理体系|2026最新

日期:2026年9月22日

一句话简介:系统梳理AI训练数据合规的完整框架——从数据来源合法性审查、版权授权路径、个人信息保护到数据

出境和技术脱敏,逐一拆解每个环节的操作规范和可复制模板,每一步都有法规依据和落地指引。

关键词/标签:训练数据合规、数据来源合法性、版权授权、合理使用、个人信息保护、数据出境、去标识化、合规管

理体系

适用人群:AI企业法务合规人员、数据工程师、AI产品经理、算法团队负责人、企业管理者、数据标注团队管理者

文档类型:教程攻略类

目录

第一章:法规框架与核心义务

第二章:数据来源合法性审查

第三章:版权合规与授权路径

第四章:个人信息保护合规

第五章:数据出境合规

第六章:技术措施——去标识化与合成数据

第七章:数据标注安全规范

第八章:合规管理体系建设

第九章:合规自查清单

第十章:常见问题解答

附录:速查表

第一章:法规框架与核心义务

1.1核心法规体系

AI训练数据合规的法规体系由四个层次构成:

第一层:基础法律

法律核心条款对训练数据的约束

《网络安全法》网络运营者安全保护义务训练数据存储、传输安全

《数据安全法》数据分类分级、来源合法性训练数据分级管理、合法获取

《个人信息保护第十三条、第十四条、第二十个人信息处理合法性基础、单独同意、已公开个人信

法》七条息限制

《著作权法》第二十四条合理使用训练数据版权使用边界

第二层:专项监管规则

《生成式人工智能服务管理暂行办法》第七条明确规定,生成式人工智能服务提供者应当依法开展预训练、优化训练

等训练数据处理活动,遵守以下规定:使用具有合法来源的数据和基础模型;涉及知识产权的,不得侵害他人依法享

有的知识产权;涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形;采取有效措施提高训

练数据质量,增强训练数据的真实性、准确性、客观性、多样性。

第三层:国家标准

标准实施时间核心内容

GB/T45652-2025《生成式人工智能预训练和优化训练2025年11月

训练数据及其处理活动的安全要求

数据安全规范》1日

GB/T45654-2025《生成式人工智能服务安全基本要2025年11月

语料安全、模型安全、安全措施

求》1日

GB/T45674-2025《生成式人工智能数据标注安全规2025年11月标注平台、标注规则、标注人员、

范》1日标注核验

2025年9月1

GB45438-2025《人工智能生成合成内容标识方法》显式标识+隐式标识

第四层:司法裁判规则

最高人民法院2026年9月发布的《关于依法审理涉人工智能纠纷案件的意见》明确,为人工智能模型训练,在合理范

围内处理已合法公开的个人信息,且个人未明确拒绝的,一般不认定为侵权。但处理活动对个人权益有重大影响的,

仍应依法取得个人同意。

1.2训练数据合规的核心原则

原则一:来源合法。“来源合法”不是一句原则性表述,而是须逐项对照、具体落实的法定义务。公开不等于可以自由

训练,能够访问也不意味着可以用于商业化模型训练。

原则二:全链条合规。数据取得、导入复制、清洗切片、模型训练或知识库入库、检索输出和长期留存,是一条链上

的不同环节。不能因为其中一步具有合法依据,就推定整条链条都没有问题。

原则三:可追溯可证明。AI训练数据合规的核心问题,不是“数据是否已经公开”,而是企业能否证明其取得、处理和

使用该等数据具有合法来源、正当目的、合理边界和可追溯的治理措施。

1.3合规义务的主体

主体角色核心义务法规依据

AI服务提供者训练数据合法来源、内容安全、标识义务《暂行办法》第七条

数据标注组织方标注平台安全、标注规则合规、标注人员管理GB/T45674-2025

数据供应商提供完整授权链条证明《数据安全法》

企业用户(使用第三方模型)自建知识库合规、输入数据合规最高法《意见》

第二章:数据来源合法性审查

2.1四类数据来源及其合规要求

训练数据的来源一般包括自采数据、自有数据、商业授权数据和开源数据集。不同来源的数据,合规审查重点不同。

来源一:企业自有数据

企业自有数据并不当然可以自由用于训练。自有数据中可能包含个人信息、敏感个人信息、商业秘密、重要数据甚至

核心数据。

审查项操作要求

个人信息识别识别是否包含个人信息,判断是否具备合法处理基础

告知同意结合训练目的履行告知同意义务

最小必要仅采集与训练目的直接相关的数据

影响评估开展个人信息保护影响评估

商业秘密评估是否包含商业秘密,建立分级管理制度

删除响应建立数据删除和更正机制

来源二:第三方采购或合作数据

企业就第三方采购或合作数据应重点审查授权链条。企业通过数据交易、许可、合作开发或委托处理取得数据时,应

确认数据提供方是否有权提供该数据,数据是否可以用于AI训练、微调、模型迭代和商业化部署。

第三方数据尽职调查清单:

审查项具体要求

供应商资质审查经营范围、业务资质、数据来源

授权链条要求提供完整授权链条证明(原始采集授权书、转授权许可)

使用范围合同中明确数据可用于AI训练、微调、商业化

个人信息合规核实供应商是否就个人信息收集使用取得授权同意

转授权权利明确转授权权利和授权期限

知识产权瑕疵约定知识产权瑕疵责任

授权期限届满约定数据处理方式

数据安全明确数据传输、存储安全标准

来源三:用户输入上传数据

用户输入数据包括prompt、上传文档、聊天记录、语音图像、客服录音、评分反馈、纠错反馈、使用日志等。用户向

平台提交内容,通常只能说明其为当前服务目的提供数据,并不当然表示同意平台将其用于通用模型训练或后续产品

优化。

操作要求:根据《个人信息保护法》第十四条的规定,以及《生成式人工智能服务管理暂行办法》相关规定,用户输

入或上传内容用于训练,应作为独立处理目的管理。企业不能仅以用户已经提交给平台为由推定训练授权,需将该处

理目的披露清楚并依据情况获取同意。

来源四:公开数据

公开互联网数据通常包括新闻报道、社交媒体内容、论坛评论、公开网页、图片、音视频、论文摘要、商品评价、招

聘信息、企业官网信息等。其共同特点是可以被公众访问,但法律属性并不相同。

审查维度操作要求

来源评估审查数据获取方式是否合法

使用范围评估判断使用目的是否偏离原公开场景

权利状态评估识别是否受著作权、邻接权保护

个人信息评估判断是否包含个人信息,个人是否明确拒绝

平台规则确认是否违反目标平台的使用协议

技术合规不非法侵入他人网络、不干扰网络服务、不破坏有效技术措施

2.2数据来源合法性审查台账模板

以下模板可直接复制使用:

##AI训练数据来源合法性审查台账

###项目信息

-项目名称:【项目名称】

-数据批次编号:【批次编号】

-审查日期:【日期】

-审查人:【姓名脱敏】

###数据来源分类

-[]自有数据

-[]第三方采购/合作数据

-[]用户输入/上传数据

-[]公开数据

-[]开源数据集

###审查记录

|审查项|审查内容|审查结果|证据文件|备注|

|--------|----------|----------|----------|------|

|来源合法性|数据获取方式是否合法|通过/不通过/需补充|【文件名】||

|授权链条|是否有完整授权证明|通过/不通过/需补充|【文件名】||

|版权状态|是否受著作权保护|是/否/需补充|【文件名】||

|个人信息|是否包含个人信息|是/否/需补充|【文件名】||

|个人信息同意|是否取得同意或具备法定事由|是/否/需补充|【文件名】||

|平台规则|是否违反平台使用协议|是/否/需补充|【文件名】||

|重要数据|是否涉及重要数据|是/否/需补充|【文件名】||

###审查结论

-[]通过,可纳入训练数据集

-[]有条件通过,需完成以下整改:【列出】

-[]不通过,不得纳入训练数据集

第三章:版权合规与授权路径

3.1训练数据版权风险

在知识产权维度,公开网页上的文章、图片、音乐、视频、代码、摄影作品等,往往仍受著作权或其他权益保护。公

开传播并不等于权利人放弃权利,也不等于第三方可以将其批量复制、下载、缓存并用于商业训练。

训练数据版权风险发生的环节:

风险环

具体风险典型案例

数据获

通过盗版渠道获取作品索尼、华纳起诉Anthropic指控其通过非法种子下载受版权作品

数据复慕尼黑法院认定Suno通过流媒体抓取技术获取训练数据系非法手

未经许可大规模复制作品

制段

数据存将侵权内容永久存入资料

Anthropic案中法院拒绝将盗版下载和长期保存视为合理使用

储库

模型训

训练过程使用未授权作品爱奇艺起诉“海螺AI”未经授权使用版权素材训练模型

模型输输出与原作实质性相似内

上海“美杜莎案”被告截取动漫角色形象训练AI模型对外销售

出容

3.2合理使用的适用边界

我国法律框架下的“合理使用”可指向肖像权的合理使用、其他人格利益的合理使用、著作权的合理使用等。《著作权

法》第二十四条就“合理使用”进行了明确界定,要求该等使用不得影响该作品的正常使用,也不得不合理地损害著作

权人的合法权益。

从当前司法实践来看,“AI训练”一非个人学习、研究、欣赏之用,二非为介绍、评论某一作品或者说明某一问题的适

当引用。若权利人已有限制声明,模型开发者还故意绕开相关要求使用数据进行训练,不排除被认为“不合理”地损害

著作权人的合法权益。

3.3版权合规授权路径

路径一:获取著作权人许可

在当前《著作权法》框架下,使用处于著作权保护期内的作品进行数据训练,应当取得著作权人的许可并支付报酬。

操作步骤具体要求

识别权利人确定作品的著作权人

操作步骤具体要求

协商许可与权利人协商使用范围和许可费用

签订协议明确使用范围(训练/微调/商业化)、授权期限、地域范围

支付报酬按约定支付许可费用

留存记录保存许可协议和支付凭证

路径二:使用开放授权数据

维基百科等平台通过CC协议的开放授权,宣示仅保留大量作品著作权的使用权,其他权利暂时放弃,可允许他人免费

复制、发行、网络传播等。

授权类型可用范围注意事项

CC0无限制使用确认确为CC0授权

CCBY署名即可使用需标注来源

CCBY-SA署名+相同方式共享衍生作品需同协议

CCBY-NC署名+非商业使用商业训练需单独授权

路径三:优先使用合法公开数据或授权数据

尽可能使用公共领域或权利人许可的数据来训练模型。企业应建立训练数据的审核流程,对数据来源、著作权状态进

行标注分类。

路径四:建立数据台账和授权证据

搭建数据集权属台账,对自有平台抽取的训练数据分类留存用户授权记录、发布时间与内容类型,完整记录数据清

洗、去重、脱敏操作日志,作为诉讼中主张合理使用与合法授权的证据。

3.4版权合规审查操作清单

已识别训练数据中受著作权保护的作品

已确认每项作品的权利人

已获取著作权人许可或使用开放授权数据

已签订书面许可协议,明确使用范围和期限

已建立数据集权属台账

已留存用户授权记录、数据清洗操作日志

已建立争议数据快速销毁机制

已对模型输出进行版权相似性检测

第四章:个人信息保护合规

4.1个人信息处理的合法性基础

《生成式人工智能服务管理暂行办法》第七条第(三)项规定,涉及个人信息的,应当取得个人同意或者符合法律、

行政法规规定的其他情形。

合法性基础路径:

路径适用条件操作要求

取得个人同意一般情形显著告知处理目的、方式和影响范围,取得同意

单独同意敏感个人信息、对个人权益有重大影响取得个人的单独同意

已公开个人信息在合理范围内处理个人未明确拒绝;对权益有重大影响的仍需同意

其他法定情形法律法规规定依据具体规定执行

4.2告知同意的操作规范

使用个人信息开展预训练或优化训练的,须向个人信息主体显著告知处理目的、方式和影响范围,并取得个人信息主

体同意;用户拒绝不应影响产品或服务基本功能的正常使用。组织须事先并定期开展个人信息保护影响评估,建立便

捷反馈渠道,接受个人信息主体提出的删除或限制系统输出相关信息的请求,并在收到请求后15个工作日内完成核验

及删除。

告知同意操作清单:

操作项具体要求

告知内容处理目的、处理方式、影响范围、存储期限

告知方式显著、清晰、易懂,不使用冗长条款掩盖

同意方式明确、自愿,不默认勾选

单独同意敏感个人信息、对权益有重大影响的,取得单独同意

撤回途径提供撤回同意的途径或方式

影响评估事先并定期开展个人信息保护影响评估

删除请求收到请求后15个工作日内完成核验及删除

4.3已公开个人信息的处理边界

《个人信息保护法》第十三条和第十四条明确,处理个人信息应当具备法定事由。第二十七条虽允许在合理范围内处

理个人自行公开或者其他已经合法公开的个人信息,但同时规定,个人明确拒绝的不得处理;处理活动对个人权益有

重大影响的,仍应依法取得个人同意。

在AI训练场景中,“合理范围”的判断尤其重要。企业不能只看信息是否公开,还应审查使用目的是否偏离原公开场

景,处理方式是否超出个人合理预期。例如,求职者在招聘平台公开简历是为了求职匹配;如果相关信息被批量抓取

后用于训练情感分析、消费能力评估或员工稳定性预测模型,就可能超出原始公开目的和合理预期。

4.4个人信息保护影响评估

评估要点:

评估维度评估内容

信息属性识别人脸等生物识别信息、不满十四周岁未成年人信息、敏感属性数据

处理目的判断是否偏离原公开场景

处理方式评估是否超出个人合理预期

影响程度评估对个人权益的影响程度

风险等级判定高、中、低风险等级

缓解措施制定相应的风险缓解措施

4.5个人信息合规操作清单

已识别训练数据中是否包含个人信息

已判断是否具备合法处理基础

已向个人信息主体显著告知处理目的、方式和影响范围

已取得同意(涉及敏感个人信息的取得单独同意)

已提供撤回同意的途径

已开展个人信息保护影响评估

已建立删除请求响应机制(15个工作日内完成)

已对不满十四周岁未成年人信息采取特殊保护措施

已对生物识别信息等敏感个人信息采取严格保护

第五章:数据出境合规

5.1数据出境的合规路径

根据《数据安全法》《个人信息保护法》以及《数据出境安全评估办法》等相关规定,我国明确了数据出境的三条主

要路径:

路径适用场景操作要求

安全评估重要数据出境、达到规定规模的个人信息出境向国家网信部门申报安全评估

标准合同未达到安全评估门槛的个人信息出境签订标准合同并备案

保护认证未达到安全评估门槛的个人信息出境通过专业机构个人信息保护认证

5.2训练数据出境的特殊规则

北京自贸试验区数据出境负面清单明确,人工智能训练数据领域的数据出境需要进行安全评估、订立个人信息出境标

准合同或通过个人信息保护认证。广西自贸试验区可适用北京自贸试验区数据出境负面清单中的人工智能训练数据领

域。

5.3模型权重出境的合规风险

模型权重内化了训练数据的敏感信息,即便原始训练数据并未出境,权重跨境传输也可能构成事实上的数据出境。企

业在进行模型部署、开源发布或跨境传输时,应评估模型权重是否可能构成数据出境。

5.4数据出境合规操作清单

已完成数据盘点,识别涉及出境的训练数据类型

已判断是否涉及重要数据

已判断个人信息出境的规模

已选择合适的数据出境合规路径(安全评估/标准合同/认证)

已对出境数据进行匿名化或去标识化处理

已建立数据本地化策略(如适用)

已评估模型权重出境是否构成数据出境

已建立跨境数据传输安全保护措施

第六章:技术措施——去标识化与合成数据

6.1去标识化与匿名化的区别

去标识化是删除或替换直接标识符,使数据在不借助额外信息时不指向特定个人;匿名化则要求无法识别且不能复

原。前者仍属个人信息、受个保法约束,后者通常脱离个人信息框架,二者的合规分量并不相同。

对比维度去标识化匿名化

定义删除或替换直接标识符无法识别且不能复原

法律属性仍属个人信息脱离个人信息框架

合规要求受个保法约束通常不受个保法约束

技术难度较低较高

6.2去标识化技术路径

技术路径常见三类:替换,把姓名、账号映射为代号;泛化,将精确值转为区间,例如把具体年龄归入年龄段;合

成,用生成数据替代真实样本。实践常组合使用,并对不同字段选不同强度,避免“一刀切”损害数据效用。

技术路径操作方式适用字段

替换将姓名、账号映射为代号直接标识符

泛化将精确值转为区间年龄、收入、地理位置

技术路径操作方式适用字段

合成用生成数据替代真实样本敏感数据、稀缺数据

删除直接移除敏感字段非必要字段

6.3重标识风险评估

大模型让重标识风险升高。模型能从间接标识符的关联中推断身份,例如“某城市、某科室、某疾病”的组合可能唯一

锁定个人。因此去标识化不能只看单字段是否脱敏,还要评估多字段联合后的可识别性。

操作要求:在入库前模拟攻击者视角,检验经去标识化的语料能否被还原,记录风险等级与缓解措施。对高风险组合

做进一步泛化或剔除,并把评估结论留痕,作为履行合理保护义务的证据。

6.4合成数据替代方案

加大合成数据的研发投入,利用自研模型生成训练数据,从根本上规避第三方版权风险。同时,充分利用企业自有数

据资产(如用户授权数据、内部文档、产品数据等),通过数据增强、迁移学习等技术降低对第三方公开数据的依

赖。

6.5去标识化操作清单

已识别训练语料中的所有直接标识符

已对直接标识符进行替换或删除处理

已对间接标识符进行泛化处理

已评估多字段联合后的可识别性

已开展重标识风险评估并留痕

已对高风险组合做进一步泛化或剔除

已将去标识化前置到清洗流水线

已对特殊字段限定访问、加密存储并设最短保存期

第七章:数据标注安全规范

7.1标注平台与工具安全要求

根据GB/T45674-2025,标注平台、标注工具需具备访问权限管控、全流程操作审计、数据加密存储、风险预警等安全

功能,从硬件与系统层面防范安全风险。

7.2标注规则安全要求

《生成式人工智能服务管理暂行办法》第八条规定,在生成式人工智能技术研发过程中进行数据标注的,提供者应当

制定符合本办法要求的清晰、具体、可操作的标注规则;开展数据标注质量评估,抽样核验标注内容的准确性;对标

注人员进行必要培训,提升尊法守法意识,监督指导标注人员规范开展标注工作。

7.3标注人员管理要求

管理项具体要求

安全培训对标注人员进行必要培训

任务分配标注任务通过系统随机分配

敏感样本限制单个标注员连续处理同一类敏感样本不得超过50条

人员管理建立标注人员合规档案

7.4标注核验要求

安全性标注需覆盖主要风险场景,比例不低于3%,采用人工或混合核验方式。功能性标注需核验无安全风险、信息准

确有效;安全性标注要求响应信息安全合理,每条需经审核人员审核,未通过核验数据超5%则批次作废,同时需完整

记录核验及整改过程。

7.5标注安全操作清单

已制定清晰、具体、可操作的标注规则

标注平台具备访问权限管控、全流程操作审计功能

标注平台具备数据加密存储、风险预警功能

已对标注人员进行安全培训

标注任务已通过系统随机分配

已建立标注质量评估和抽样核验机制

安全性标注比例不低于3%

未通过核验数据超5%则批次作废

已完整记录核验及整改过程

已建立标注合规审计机制(每年至少一次,审计报告留存至少3年)

第八章:合规管理体系建设

8.1AI训练数据处理的四个主要环节

从企业实务看,AI训练数据合规通常可拆分为数据采集、数据加工、数据入库以及数据存储四个主要环节。四个环节

分别对应数据来源合法性、数据质量与权利处理、数据准入与可追溯管理,以及存储安全、留存期限和删除机制等核

心合规问题。

环节核心合规义务

数据采集确保来源合法性

数据加工去标识化、清洗、标注合规

数据入库数据准入与可追溯管理

数据存储存储安全、留存期限、删除机制

8.2数据台账管理制度

企业应搭建数据集权属台账,对自有平台抽取的训练数据分类留存用户授权记录、发布时间与内容类型,完整记录数

据清洗、去重、脱敏操作日志。

数据台账模板(可直接复制):

##AI训练数据台账

|字段|说明|

|------|------|

|数据批次编号|唯一标识|

|数据来源类型|自有/第三方/用户输入/公开/开源|

|供应商名称|第三方供应商名称(脱敏)|

|采集日期|数据获取时间|

|数据规模|数据量(条数/大小)|

|权利状态|已授权/开放授权/合理使用/待确认|

|个人信息|包含/不包含/已脱敏|

|授权文件|授权文件编号|

|清洗记录|清洗操作日志编号|

|脱敏记录|去标识化操作日志编号|

|入库日期|纳入训练集时间|

|状态|使用中/已停用/已删除|

|责任人|数据管理责任人|

8.3供应商管理制度

企业应建立供应商评估机制,重点核实供应商的数据处理资质和安全保护机制,要求提供数据来源的完整授权链条证

明。

供应商合规审查清单:

已审查供应商的经营范围和业务资质

已审查供应商的数据来源合法性

已要求供应商提供完整授权链条证明

已签订数据处理协议,明确各方权利义务

已明确数据可用于AI训练、微调、商业化

已约定知识产权瑕疵责任

已约定授权期限届满后的数据处理方式

已要求供应商对敏感数据进行脱敏处理

已约定数据传输和存储的安全标准

已建立数据安全事件应急处理机制

8.4数据保留与销毁机制

根据处理目的和法律要求为不同类别数据设定严格的保留期限,在期限届满或目的达成后安全、彻底地删除或匿名化

相关数据。特别对于可能触发版权争议的数据,建立争议数据快速销毁机制,一旦收到权利人投诉或监管调查通知,

立即启动数据隔离和销毁程序。

8.5大模型备案与安全评估

面向公众提供生成式人工智能服务,通常需完成算法备案与安全评估。企业需向主管部门提交算法基本原理、训练数

据来源、安全评估报告和风险防范措施等材料。截至2026年4月,全国已有868款生成式人工智能服务完成备案。

备案材料清单:

材料名称内容要求

算法备案表算法基本原理、技术架构、训练过程、预期用途

训练数据来源说明语料来源合法性证明、授权文件

安全评估报告覆盖语料安全、模型安全、生成内容安全、数据安全与隐私保护、风险防控机制

风险防范措施内容过滤机制、应急处置方案

标注规则说明标注规则、质量评估方法

第九章:合规自查清单

9.1数据来源自查

已建立训练数据来源分类管理制度

已对每批训练数据进行来源合法性审查

已建立数据来源合法性审查台账

第三方数据已审查完整授权链条

公开数据已进行来源评估、使用范围评估和权利状态评估

用户输入数据用于训练已作为独立处理目的管理

9.2版权合规自查

已识别训练数据中受著作权保护的作品

已获取著作权人许可或使用开放授权数据

已建立数据集权属台账

已留存用户授权记录和数据清洗操作日志

已建立争议数据快速销毁机制

已对模型输出进行版权相似性检测

9.3个人信息保护自查

已识别训练数据中是否包含个人信息

已判断是否具备合法处理基础

已向个人信息主体显著告知处理目的、方式和影响范围

已取得同意(涉及敏感个人信息的取得单独同意)

已提供撤回同意的途径

已开展个人信息保护影响评估

已建立删除请求响应机制(15个工作日内完成)

已对敏感个人信息采取严格保护措施

9.4技术措施自查

已对训练语料进行去标识化处理

已评估多字段联合后的可识别性

已开展重标识风险评估并留痕

已将去标识化前置到清洗流水线

已探索合成数据替代方案

9.5标注安全自查

已制定清晰、具体、可操作的标注规则

标注平台具备访问权限管控和操作审计功能

已对标注人员进行安全培训

已建立标注质量评估和抽样核验机制

安全性标注比例不低于3%

已建立标注合规审计机制

9.6出境合规自查

已完成数据盘点,识别涉及出境的训练数据

已判断是否涉及重要数据

已选择合适的数据出境合规路径

已评估模型权重出境是否构成数据出境

已建立跨境数据传输安全保护措施

第十章:常见问题解答

Q1:公开互联网数据能否直接用于AI训练?

不能直接使用。公开并不当然等于无权利负担,能够访问也不当然意味着可以用于商业化模型训练。公开数据可以成

为训练数据来源之一,但必须经过合法来源、个人信息、知识产权、平台规则和数据安全等多重审查。

Q2:企业使用自有数据训练模型需要注意什么?

自有数据并不当然可以自由用于训练。自有数据中可能包含个人信息、敏感个人信息、商业秘密、重要数据甚至核心

数据。涉及个人信息的,应判断是否具备合法处理基础,并结合训练目的履行告知同意、最小必要、个人信息保护影

响评估和删除响应等义务。

Q3:用户输入的数据能否直接用于模型训练?

不能。用户向平台提交内容,通常只能说明其为当前服务目的提供数据,并不当然表示同意平台将其用于通用模型训

练或后续产品优化。用户输入或上传内容用于训练,应作为独立处理目的管理,需将该处理目的披露清楚并依据情况

获取同意。

Q4:AI训练中使用他人作品是否构成合理使用?

当前司法实践尚存争议。从《著作权法》第二十四条列明的合理使用行为来看,“AI训练”尚无法归入其中任意一项。

若权利人已有限制声明,模型开发者还故意绕开相关要求使用数据进行训练,不排除被认为“不合理”地损害著作权人

的合法权益。

Q5:去标识化后数据是否就不受个人信息保护法约束?

不是。去标识化后仍可借额外信息复原、属个人信息;匿名化要求无法识别且不可复原、通常脱离个保法。两者合规

义务差别明显。仅做去标识化处理的数据,一旦搭配其他外部信息能够锁定具体个人,就仍属于个人信息。

Q6:训练数据涉及数据出境需要走什么程序?

我国明确了数据出境的三条主要路径:通过国家网信部门组织的安全评估、经专业机构进行个人信息保护认证、或者

按照国家网信部门制定的标准合同与境外接收方订立合同。北京自贸试验区数据出境负面清单已将人工智能训练数据

纳入管理。

Q7:大模型备案需要提交哪些材料?

企业需向主管部门提交算法基本原理、训练数据来源、安全评估报告和风险防范措施等材料。安全评估报告需覆盖语

料安全、模型安全、生成内容安全、数据安全与隐私保护、风险防控机制等关键模块。

Q8:数据标注有哪些安全要求?

根据GB/T45674-2025,标注平台需具备访问权限管控、全流程操作审计、数据加密存储、风险预警等安全功能。安全

性标注需覆盖主要风险场景,比例不低于3%。未通过核验数据超5%则批次作废。标注方应每年度进行内部合规审

计,审计报告至少留存3年。

附录:速查表

附录A:数据来源合规速查表

来源类型核心风险关键合规要求审查重点

自有数据个人信息、商业秘密告知同意、影响评估、分类分级是否包含个人信息/商业秘密

第三方采购授权链条不完整

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论