文章作者:张 微 北京源镜律师事务所 实习律师
指导律师:骆慧超 北京源镜律师事务所主任合伙人 数字经济和人工智能专委会委员 刑事研究委员会委员
声音克隆属于深度合成技术的一种,其通过对特定自然人的语音数据进行深度学习,训练出相应的人工智能模型,进而生成与该特定自然人声音高度相似的语音内容。这项技术的核心在于对人的声音特征进行建模与再现。数字人配音、个性化语音助手、名人或逝者声音复刻等广泛的应用场景,随着生成式人工智能的快速发展,仅需一段数秒的语音样本,即可通过深度学习模型生成高度逼真的AI声音。
然而,技术自由止于他人权利。如果未经自然人同意或授权,便很可能滑向侵权的深渊。今年上半年,多名配音演员公开抵制利用AI技术擅自克隆其声音,引发社会广泛关注。 在普通公众感叹技术神奇的同时,一个严肃的法律命题浮出水面:我们的声音,是否正在成为AI时代最unprotected的数字资产?
早在2024年4月,北京互联网法院已审结全国首例”AI生成声音人格权侵权案”( 殷某桢诉北京某智能科技公司等人格权纠纷案),判决认定未经许可AI化使用他人声音构成侵权。本文将结合该案裁判规则、《民法典》及《个人信息保护法》相关规定,系统解析AI声音克隆的法律边界与维权路径。

图片由AI生成
一、法律定性:AI生成声音是否受法律保护?
我国法律并未将”声音权”规定为一项独立的具体人格权。但《民法典》第1023条第2款明确规定:”对自然人声音的保护,参照适用肖像权保护的有关规定。” 这一条款为声音权益保护提供了基本法律依据。
每个自然人在音色特征、发音习惯、语速节奏、声音质感等方面均具有独特性。声音作为个人的生理标识,与肖像一样,可用于识别特定自然人。特别是对于配音演员、知名主播、演艺人士等公众人物,其声音已具有显著的识别性和商业价值。
AI生成声音是否受保护,核心在于”可识别性”。 北京互联网法院在殷某桢案中确立了裁判标准:利用人工智能合成的声音,如果能使一般社会公众根据其音色、语调和发音风格关联到该特定自然人,则应当认定为具有可识别性,落入声音权益的保护范围。换言之,只要AI声音能让人”一听就知道是谁”,就受法律保护——无论该声音是由真人录制还是AI生成。该案于2025年入选人民法院案例库(入库编号:2025-07-2-474-001),其裁判规则对全国法院审理同类案件具有重要的参考与示范意义。
二、裁判规则精解:殷某桢案的三大争议焦点
北京互联网法院在该案审理中,围绕三个核心问题展开了详尽论证,其裁判逻辑对同类案件具有直接指导意义。
(一)AI合成声音是否属于声音权益的保护范围?
被告曾抗辩称,案涉声音系经人工智能技术处理后的合成声音,并非原告本人的原始声音,不应纳入声音权益保护范围。
法院经审理认为,民法典对声音权益的保护以”可识别性”为前提条件。经当庭勘验,使用案涉文本转语音产品生成的AI声音,与殷某桢的音色、语调、发音风格具有高度一致性,能够引起一般人产生与殷某桢有关的思想或感情活动,能够将该声音联系到殷某桢本人,进而识别出其主体身份。据此,法院认定案涉AI声音属于殷某桢声音权益的保护范围。
因此,侵权的判断标准不在于”声音是如何生成的”,而在于”生成后的声音能否让人联想到特定自然人”。 只要AI声音保留了足以识别特定自然人身份的特征,就构成对该自然人声音权益的规制对象。
(二)录音制品授权是否等同于声音AI化使用授权?
案中另一关键事实是:殷某桢曾接受某文化传媒公司的委托录制录音制品,该公司为录音制品的著作权人。后该公司与某软件公司签订《数据授权使用协议》,将包括殷某桢录音制品在内的录音数据提供给某软件公司用于开发AI语音产品。但关键问题在于,殷某桢本人并未签署《数据授权书》。
法院认定,某文化传媒公司对录音制品享有著作权等权利,但不包括授权他人对殷某桢声音进行AI化使用的权利。未经殷某桢本人知情同意,授权第三方AI化使用其声音的行为无合法权利来源。 声音权益属于人格权范畴,具有人身专属性,非经本人单独同意,不得转让或许可使用。
这一观点可概括为“双重许可”原则,即对声音数据的使用,不仅需要数据权益人(如录音制品的著作权人)的授权,更需要声音主体(即自然人本人)的许可。数据提供方与模型训练方如需将包含自然人声音的数据投入AI模型训练,需在利用数据进行训练前,获得自然人对其声音权益的授权许可,不得以录音制品的许可使用替代声音权益的授权。
(三)侵权责任如何分配?
法院最终判决:某文化传媒公司与某软件公司承担连带赔偿责任,赔偿殷某桢经济损失25万元;北京某智能科技公司、上海某网络科技公司、北京某科技发展公司因主观上不存在过错,不承担损害赔偿责任,但仍需停止侵权。
这一责任划分体现了侵权法中的过错责任原则。在声音克隆产业链中,数据源头提供方和AI产品开发者承担主要责任,而仅为产品使用方的下游平台,若能证明已尽到合理注意义务,可免于承担赔偿责任。但需注意,”停止侵权”义务对下游平台而言同样是强制性的,即收到权利人通知后,平台有义务及时下架侵权产品。
三、实践中的双重保护路径
实践中,声音被AI克隆后,权利人可通过两种路径维权。两者在认定标准和归责原则上存在关键区别。
路径一:参照肖像权保护
原告可依据《民法典》第1023条第2款,参照肖像权保护的规定提起诉讼,适用过错责任原则。原告需举证证明被告存在主观过错。此路径的核心在于:以”社会一般人”的听觉识别为标准。若社会公众听到AI声音后能识别出特定自然人,则满足可识别性要求。
路径二:个人信息权益保护
自然人的声音属于个人信息。通过技术手段从声音中提取的声学特征模式,即声纹,属于生物识别信息,依据《个人信息保护法》被归类为敏感个人信息。
依据该法,个人对其个人信息的处理享有知情权和决定权。任何人利用自然人的声音训练AI语音产品,必须取得该自然人的单独同意或具备法定事由。此路径下,可采取技术判断标准。即便社会公众通过听觉无法识别,只要通过声纹比对等技术手段能够确定系原告的声音,即构成侵权。同时,适用过错推定责任,由被告证明自己没有过错,大幅降低了权利人的举证难度。
策略建议: 对于社会知名度较高的权利人,”参照肖像权保护”路径更为直接;对于普通公众,通过”个人信息权益保护”路径维权,举证负担更轻、可识别性认定标准更宽,是更有利的选择。
四、延伸保护:著作权法与反不正当竞争法的补充适用
除上述两条主要路径外,权利人在特定场景下还可依据《著作权法》及《反不正当竞争法》寻求保护。
(一)著作权法保护路径
当行为人未经许可,擅自使用他人享有著作权的影视原声音频进行声音克隆或语音合成时,其行为不仅侵害了演员或配音演员的声音权益,还可能因其未经许可使用、改编他人享有著作权的影视作品片段,而构成对著作权的侵害。此时,权利人可同时主张声音权益侵权与著作权侵权,获得更全面的救济。
(二)反不正当竞争法保护路径
当经营者通过声音克隆技术,实施足以引人误认为是他人商品或与他人存在特定联系的混淆行为时,可能构成不正当竞争。例如,利用AI克隆知名主播的声音进行商业推广,导致消费者误认为该主播与产品或服务存在特定关联,被侵权人可依据《反不正当竞争法》主张权益。
五、行业合规:AI声音服务的特别监管
除民事侵权责任外,AI声音克隆服务提供者还需履行《互联网信息服务深度合成管理规定》项下的特别义务,且该等义务与民事责任并行不悖,可能同时触发行政处罚。
(一)训练数据授权须单独取得
该规定第十四条明确要求:提供人脸、人声等生物识别信息编辑功能的,应当提示使用者依法告知被编辑的个人,并取得其单独同意。 殷某桢案已充分说明,仅凭录音制品的著作权授权不足以支撑AI化使用。声音作为人格要素,其商业化利用须取得人格权主体的单独授权。
(二)安全评估与算法备案
依据第十五条,提供生成或编辑人声等生物识别信息功能的模型、模板等工具的,应当依法自行或者委托专业机构开展安全评估。这意味着,AI声音克隆产品在推向市场前,须完成专门的安全评估,而非仅靠一般的算法备案即可过关。
(三)深度合成内容标识义务
第十七条要求,合成人声、仿声等语音生成或显著改变个人身份特征的编辑服务,应当在生成内容的合理位置进行显著标识,向公众提示深度合成情况。未按规定标识的,可能面临行政处罚。
六、实务建议
(一)对自然人的维权指引
1、及时固定证据:发现声音被AI克隆后,建议尽快通过公证取证等方式固定侵权链接、AI生成物样本等电子证据。重点保存侵权主体、声音样本、使用场景等信息。如条件允许,应对疑似侵权的AI声音进行声纹比对的初步技术分析,以增强证据链条。
2、优先考虑以个人信息权益侵权起诉:对于非公众人物,此路径可降低举证难度、适用过错推定责任,更有利于维权。案由可考虑”个人信息保护纠纷”或”人格权纠纷”。
3、发送停止侵权通知:在诉讼前,可先向侵权方发送书面停止侵权通知,要求下架AI声音产品。若对方拒不处理,可依据《民法典》第1195条请求网络服务提供者采取必要措施。
4、关于损害赔偿的举证策略:殷某桢案中,法院综合考虑了侵权行为的性质、影响范围(案涉声音播放量超32亿次)、AI产品的市场价值等因素,酌情确定了25万元的赔偿数额。权利人可参照此思路,从AI产品下载量、使用频率、侵权持续时间等维度组织证据,以增强损害赔偿主张的说服力。
5、事前预防与授权审查:自然人在使用AI模型或平台服务时,应充分了解声音权益授权的范围、期间,明确双方的权利义务。在对录音制品或其他包含声音的作品进行许可授权时,应明确该授权是否包含对于声音数据的AI训练使用及数据产品生成许可,避免因条款含义模糊而陷入被动。
(二)对AI企业的合规建议
1、取得被模仿者的”单独同意” :仅凭《数据授权书》或格式条款笼统授权远远不够。依据《个人信息保护法》第二十九条,处理敏感个人信息应当取得个人的单独同意。建议采用弹窗、独立勾选框等方式,确保用户明确知悉并同意其声音被用于AI训练和商业化使用,并留存完整的授权记录以备核查。
2、强化训练数据合规管理:对用于AI声音克隆的训练数据,须逐条核查数据来源及授权链条是否完整、授权范围是否涵盖AI化处理。殷某桢案已明确,录音制品著作权不等于声音AI化使用权。建议建立”数据来源合规台账”,记录每一份训练数据的授权路径。牢记”双重许可”原则:既需数据权益人的授权,也需声音主体(自然人)的许可。
3、履行标识与安全评估义务:AI声音合成服务应当进行显著标识(”此内容由AI生成”),并在产品上线前依法开展安全评估。依据《互联网信息服务深度合成管理规定》第十五条,生成人脸、人声等生物识别信息编辑功能的模型,应委托专业机构进行安全评估。
4、建立侵权投诉响应机制:依据《民法典》第1195条,设立便捷的投诉渠道,在收到权利人合格通知后及时采取删除、屏蔽、断开链接等措施,以避免承担扩大部分的赔偿责任。建议明确内部处理流程,设定7日内响应的最低时限。
5、面向AI产品使用与传播方的特别提示:对于使用AI数据产品进行特定自然人声音模拟的经营主体(如网红、博主、平台),在利用数据产品使用可识别到具体自然人的AI生成声音并进行传播时,同样可能构成对自然人声音权益的侵犯,也需要事先取得相关自然人的授权。平台应建立高效的侵权投诉响应机制,核实后及时采取断开链接、下架产品等必要措施。
结语
AI声音克隆技术在为创意产业带来新机遇的同时,也对人格权保护提出了前所未有的挑战。全国首例AI声音侵权案已明确宣告:AI生成声音并非法外之地,未经许可的AI声音克隆,无论技术多么先进,都将面临法律的审视。 从殷某桢案中我们至少可以提炼出三条清晰的法律边界:AI声音若保持可识别性即受保护、录音制品授权不等于声音AI化使用授权、深度合成服务须履行严格的合规义务。
在技术日新月异的今天,平衡技术创新与人格权保护,既需要立法的持续完善,也需要企业和公众的共同理性与法律自觉。
参考文献:
[1] 北京互联网法院(2023)京0491民初12142号民事判决书。
[2] 参见《中华人民共和国民法典》、《中华人民共和国个人信息保护法》、《互联网信息服务深度合成管理规定》相关法律规定。

本文仅供学术交流与实务参考,不构成具体法律意见。如需就特定事项获取法律建议,请与本所专业律师联系。



京公网安备11010102007574号