ARTICLE

从声音到文风,AI如何一步步“成为”你?

来源:原创作者:代书婷

忽然收到一条朋友发来的语音:“我出了点急事,先借我五千,明早就还”。


你点开听——声音、语调、甚至常用的口头禅,全对。你正准备转账,朋友本人却打来电话:“啥情况?我啥也没发啊。”


图片

图片来源:pexels


更让人不安的是,屏幕里甚至可能出现一张熟悉的脸。嘴形对得上,表情也自然,还会用一贯的说话方式解释来龙去脉。


此时,我们才意识到,照片、语音和聊天记录不只是生活痕迹,也可能成为伪装身份的原材料。


而这,就是今天要说的:数字克隆。


一起来看。





一、什么是数字克隆?


别想成科幻片里那种“意识上传”。所谓数字克隆,更像一场高精度的模仿训练。


人脸模型从照片和视频中学习五官比例、表情变化与口型运动;语音模型提取音色、音高、节奏和停顿,再把新文字读成从你嘴里说出来的;语言模型则从聊天记录里揣摩常用词、句式、标点和表达习惯。模型掌握的是外在规律,而不是你的记忆、经历和责任。它可以模仿如何说,却不知道为何这么说。


图片

图片来源:AI生成


另外,文风复刻也不容小觑。几百条聊天记录就可能暴露一个人爱用的称呼、回复速度、句子长短,甚至情绪变化时的表达方式。单看某一句或许并不惊人,组合起来却足以让熟人产生“这是他”的错觉。





二、技术是好是坏,在于使用者


某种程度上,科学技术作为工具本身不具备道德属性,但其应用方向、社会影响乃至最终价值,始终由使用它的人(或群体、组织、社会)的主观意图、价值取向和实践方式所决定。


AI复刻技术并非只有坏处,这需要一分为二来看待。对可能逐渐失去语言能力的人来说,“声音库”可以提前保存语音素材,制作接近本人音色的合成声音,让辅助沟通设备不再只有千篇一律的机器声。影视制作、无障碍阅读、方言保护和虚拟讲解,也可能因此获得更自然的表达方式。问题不在于“能不能复刻”,而在于谁来决定、用于什么目的、是否向听众说明。


同样一项技术,一旦越过同意与告知的边界,就会从工具变成冒名者。骗子不需要真正理解你的朋友,只要复制足够逼真的声音,再配上“转账”“不勿声张”等的催促,就可能绕过人的警惕。偷拍视频被换脸,公开演讲被重新配音,聊天记录被用来生成本人声明,都可能伤害名誉、财产和人际信任。最难防的并不是某个破绽,而是我们对熟悉面孔和熟悉声音的天然信任。





三、边界模糊,但责任不能模糊


怎样判断一次复刻是在帮助人,还是在偷走一个人的身份?可根据以下三点。


① 素材是否经过本人同意?


② 生成内容是否有清楚标识?


③ 使用范围能否被本人知情、限制和撤回?


我国关于深度合成和人工智能生成合成内容的管理规则,也强调对合成人声、人脸生成等内容进行标识,并重视个人信息和生物识别信息的保护。技术越逼真,来源说明越不能含糊。


图片

图片来源:AI生成


普通人也不必把自己训练成鉴伪专家,遇到熟人突然借钱、索要验证码或要求保密,先暂停并冷静思考,用自己保存的号码回拨,或通过另一位亲友交叉核实。


家人之间可以约定一个不在社交平台公开的确认口令,对突如其来的紧迫感保持警惕,不仅听声音,还要核对事情本身是否合理。此外,日常发布照片和语音时,也应留意公开范围,避免长期暴露大量清晰、连续的个人素材。


AI可以复刻一张脸、一段声音,甚至一套文风,却不能替一个人承担承诺、情感和责任。


真正需要守住的,不是拒绝所有数字技术,而是让每一次“像你”的生成,都有同意、有标识、有边界。只有这样,数字分身才是人的延伸,而不是躲在屏幕后面的替身。


参考文献

[1] Mirsky, Y., & Lee, W. (2021). The Creation and Detection of Deepfakes: A Survey. ACM Computing Surveys, 54(1), Article 7, 1–41. DOI: 10.1145/3425780.

[2] 国家互联网信息办公室等:《互联网信息服务深度合成管理规定》(2022);《人工智能生成合成内容标识办法》(2025);NIST:Reducing Risks Posed by Synthetic Content(2024);FTC:Fighting Back Against Harmful Voice Cloning(2024);American Speech-Language-Hearing Association:Augmentative and Alternative Communication(AAC)。


作者:代书婷  中国科学院心理研究所、博士研究生

审核: 刘颖  李培元  张超  杨柳

审核专家:张凤娇  中国科学院大学 化学科学学院教授、博士生导师


返回栏目列表