综述

人工智能生成内容模型的数字水印技术研究进展

  • 郭钊均 1, 2 ,
  • 李美玲 1, 2 ,
  • 周杨铭 1, 2 ,
  • 彭万里 1, 2 ,
  • 李晟 1, 2 ,
  • 钱振兴 1, 2, * ,
  • 张新鹏 1, 2, *
展开
  • 1. 复旦大学计算机科学技术学院,上海 200433
  • 2. 复旦大学数字文化保护与旅游数据智能计算文化和旅游部重点实验室,上海 200433
钱振兴
张新鹏

网络出版日期: 2024-05-18

基金资助

国家自然科学基金(U20B2051,U22B2047,U1936214)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Survey on digital watermarking technology for artificial intelligence generated content models

  • GUO Zhaojun 1, 2 ,
  • LI Meiling 1, 2 ,
  • ZHOU Yangming 1, 2 ,
  • PENG Wanli 1, 2 ,
  • LI Sheng 1, 2 ,
  • QIAN Zhenxing 1, 2, * ,
  • ZHANG Xinpeng 1, 2, *
Expand
  • 1. School of Computer Science, Fudan University, Shanghai 200433, China
  • 2. Key Laboratory of Culture & Tourism Intelligent Computing of Ministry of Culture & Tourism, Fudan University, Shanghai 200433, China

Online published: 2024-05-18

Copyright

Copyright ©2024 Journal of Cybersecurity. All rights reserved.

摘要

人工智能(AI)正在改变世界,人工智能生成内容(AIGC)是当前最前沿的技术之一。探讨人工智能生成内容的演变历程,介绍从AI到AIGC的技术变迁,讨论AIGC引发的相关问题和挑战以及应对策略。同时,关注全球范围内的法律法规和国际动向,分析不同国家和组织在人工智能监管方面采取的举措,尤其是中国在全球AI治理中的贡献。着重介绍的是AIGC模型的数字水印(Digital Watermarking)技术。数字水印已有多年发展的历史,在多媒体确权、防伪、认证等方面发挥了重要作用,随着AIGC的兴起,数字水印在模型保护、内容溯源、样本保护等方面又开始发挥新的作用。关于AIGC模型的数字水印技术研究进展的介绍,将为理解AIGC安全领域的发展提供新的视角维度,为研究AIGC领域的应用实践提供参考。

本文引用格式

郭钊均 , 李美玲 , 周杨铭 , 彭万里 , 李晟 , 钱振兴 , 张新鹏 . 人工智能生成内容模型的数字水印技术研究进展[J]. 网络空间安全科学学报, 2024 , 2(1) : 13 -39 . DOI: 10.20172/j.issn.2097-3136.240102

Abstract

Artificial intelligence (AI) is changing the world, and artificial intelligence generated content (AI Generated Content, AIGC) is currently one of the most cutting-edge technology. The evolution of AIGC, introduce the technological changes from AI to AIGC, and discuss the related problems and challenges caused by AIGC as well as coping strategies. At the same time, this study will also focus on the laws and regulations and international trends on a global scale, analyze the initiatives taken by different countries and organizations in AI regulation, especially China's contribution in global AI governance. The Digital Watermarking (DW) technology of the AIGC model is introduced. Digital Watermarking has been developed for many years and has played an important role in multimedia rights confirmation, anti-counterfeiting, authentication, etc. With the rise of AIGC, Digital Watermarking has begun to play a new role in model protection, content traceability and sample protection. The introduction on the research progress of digital watermarking technology for AIGC model will provide a new perspective dimension for understanding the development of AIGC security field, and provide a reference for researching the application practice in the field of AIGC.

0 引言

人工智能(Artificial Intelligence,AI)的快速发展正在深刻地改变人们的社会和生活方式。在这个过程中,人工智能生成内容(Artificial Intelligence Generated Content,AIGC)作为AI技术的前沿,引发了广泛的关注和讨论。AIGC的出现不仅为创作提供了全新的可能性,也带来了一系列的挑战和问题。面对这些新兴技术的迅速发展,需要深入探讨AIGC的演变历程、技术变迁,以及相关的法律、道德和安全问题,从而为这一领域的发展提供指导和参考。
在过去几年里,AIGC技术不断取得突破,从文本、图像到音频等多个领域都有了显著的进展。这种技术的广泛应用已经渗透到日常生活中,例如自动化写作、图像合成和音乐创作等。然而,随着AIGC技术的普及和应用,也出现了一系列新的问题,包括内容的真实性、知识产权的保护以及潜在的滥用风险等。因此,需要对AIGC技术进行深入研究,以解决这些问题并推动其健康发展。
鉴于此,本文将重点探讨AIGC技术的发展历程和技术特点,以及相关的法律法规和国际动态。特别地,将聚焦于AIGC模型的数字水印技术,探讨其在内容保护和安全领域的应用前景。通过对AIGC技术及其衍生问题的深入研究,可以更好地理解其潜在影响,并为其可持续发展提供有益的建议和方向。
1)从AI到AIGC
AI是采用机器模拟、延伸并扩展人类智力的技术,使用计算机系统模拟和执行各种人类智能的任务。经过近一个世纪的不断创新和突破,尤其是过去10年深度学习的飞速发展,AI在大规模数据集上实现了卓越的识别和预测性能。当前,计算机已能够处理和理解大量不同模态的数据,为自然语言处理、计算机视觉、内容生成等应用提供了强大的支持,在多个领域实现了机器自主决策和任务执行。
AI关键技术的发展推动了AIGC的大发展。AIGC是AI的重要分支,使用前沿AI技术来合成文本、图像、音频、视频等内容。通过使用大量数据进行训练得到的AIGC模型,实现了对人类语言和视觉行为的深度理解与创造。在语言方面,基于Transformer架构[1]的大型语言模型(如ChatGPT[2]系列)极大地改变了人类对机器理解和自然语言合成能力的认识,这些模型不仅能回答问题,还具备强大的逻辑推理能力,体现了语言处理领域的前沿性成就。在视觉方面,扩散模型(如Stable Diffusion系列[3])不仅能识别和分类图像,还能创造高价值的逼真艺术作品,展现了AI在视觉艺术领域的革命性进步。
与传统的AI不同,AIGC不仅能够分析和处理信息,还具备生成创造性内容的能力。从学术研究的角度来看,它反映了AI在高质量数据和算力支持下的涌现能力,彰显了从基础理论研究领域向应用领域的转变。从社会发展角度来看,它提供了更高效的生产工具,为人类在创造性领域的发展提供了革命性的工具。这场由AI向AIGC的演变和革新,为各种应用领域带来了前所未有的机会,更是AI技术向更高层次发展的标志。
2)AIGC 法律法规与国际动向
AIGC技术的迅速发展和广泛应用也带来了安全隐患[4],恶意使用者可能通过AIGC危害社会,比如伪造领导人讲话视频、制造虚假新闻等。许多国际组织越来越重视相关法律法规的制定,国际组织如联合国(United Nations,UN)、世界贸易组织(World Trade Organization, WTO)和国际电信联盟(International Telecommunication Union,ITU)等,都在积极参与制定关于AI和AIGC的全球标准和指导原则,促进不同国家间的技术合作和政策协调,确保AI技术的健康发展。世界知识产权组织(World Intellectual Property Organization,WIPO)也正在探索如何界定AI创造作品的版权归属。联合国教科文组织(United Nations Educational,Scientific and Cultural Organization, UNESCO)提出了AI伦理指导原则,强调了技术的可持续性、透明性和公平性。不同国家对于AIGC的法律法规各有侧重,美国的AI监管偏重于强调技术创新和自由市场的原则,美国总统拜登签署了首项关于人工智能的行政法规,表明政府对AI领域的关注日益增加。中国的AI监管侧重彰显政府引导和安全监管的原则,发布了多项与AIGC相关的管理办法和治理原则,旨在确保AIGC技术的安全、公平和负责任使用。欧盟的AI监管主要聚焦隐私保护和伦理道德的原则,欧盟议会通过《人工智能法案》,旨在确保高风险AI系统的安全、透明和责任,为人工智能引入监管和法律框架,覆盖除军事用途之外的所有人工智能类型。
除此之外,中国也参与AIGC全球治理。2023年,国家互联网信息办公室联合国家发展和改革委员会、教育部、科学技术部、工业和信息化部、公安部、国家广播电视总局共同发布《生成式人工智能服务管理暂行办法》,旨在保障技术发展与社会伦理、法律规范的一致性,实现创新与监管、发展与安全的平衡。这一办法不仅展示了中国对AIGC技术的支持和鼓励,也体现了对技术发展潜在风险的预防意识。2023年,全国信息安全标准化技术委员会发布了《生成式人工智能服务内容标识方法》指南,旨在指导有关单位有效地实施内容标识。这份指南针对文本、图片、音频和视频四种类型的AI生成内容,提出了两种标识方法:显式水印标识和隐式水印标识。
2023年,全国信息安全标准化技术委员会发布了《生成式人工智能服务安全基本要求》,这是中国针对生成式AI安全领域的首个官方文件。这意味着中国在生成式AI安全领域规范化和标准化的方向上迈出重要一步。这一文件的发布,对生成式AI服务的安全性和可靠性提出明确要求;对AI服务提供者的运营模式、技术开发和数据管理等方面将产生深远影响。同时,这一文件也为全球AI治理和伦理框架的建设提供了重要参考。 2023年,国家网信办发布的《全球人工智能治理倡议》显著体现了中国在全球AI治理领域的积极参与和领导作用。这份倡议着重于推动人工智能的可持续发展和合理治理,强调相互尊重和平等互利的原则,呼吁促进人工智能技术造福于人类,推动构建人类命运共同体;鼓励各国在世界和平与发展的多元挑战背景下,采取共同、综合、合作、可持续的安全观,为全球性问题的解决提供了新的视角和方法,如表1所示。
表 1 关于人工智能治理的监管法规对比

Table 1 Comparison of regulatory statutes on AI governance

国家/地区 重点方向 重要措施 日期/年
中国 强调政府引导和安全监管 《生成式人工智能服务管理暂行办法》
《生成式人工智能服务安全基本要求》
2023
美国 强调技术创新和自由市场 拜登签署首个生成式AI监管规定 2023
欧盟 聚焦隐私保护和伦理道德 《人工智能法案》 2023
3)AIGC标识
AIGC不仅改变了人们获取信息、消费内容甚至表达创意的方式,还引发了一系列关乎知识产权、内容真实性和伦理方面的重要问题。如何有效地对多媒体数据进行版权保护和溯源,已成为人工智能安全领域科研工作者研究的热点难点问题。数字水印技术作为一种主动溯源和保护的方法,在图像、视频、音频、文本以及网络模型等数据的溯源与保护中取得了一系列具有实际价值的研究成果。因此,通过数字水印技术给AIGC生成物及模型加上唯一标识,可以较好地实现对内容的来源可追溯并对所有者的知识产权的维护。通过为AIGC添加标识,能够更好地管理和监督其使用,降低内容被滥用或盗版的风险。此外,标识还有助于构建一个透明、可信的信息环境,提高用户对AIGC生成内容的信任度。
基于此,AIGC标识技术的研究引起了社会各界的关注。 AIGC标识技术主要用于标识大模型及其相关数据,包括模型本身、生成的内容、数据样本以及Prompt集合等方面,从而实现保护创作版权、溯源创作模型和创作者、识别AI生成的内容以及保护样本所有权等。除此之外,AIGC标识技术同时也能够帮助用户识别和理解他们所消费的内容的性质。从技术角度而言,AIGC标识的实现从最初的可见水印和简单标签,逐渐演进到更复杂的数字签名和元数据标记。随着AI技术的发展,特别是数字水印技术的进步,使得AIGC标识也变得更加智能和隐蔽,可以实现在不影响内容本身质量的前提下,有效地嵌入各种标识信息。当然,AIGC标识技术也面临许多挑战。首先是技术上的挑战,如何确保标识的有效性和安全性,避免被恶意修改或去除。其次是伦理和法律上的挑战,例如,如何平衡版权保护和信息自由传输,如何解决多标识场景下知识产权归属等问题。

1 生成式大模型

生成式大模型以其卓越的创造力和智能表现力成为引领人工智能前沿的显著推动力。本节将探讨生成式大模型的技术演进。首先介绍生成对抗网络(Generative Adversarial Network,GAN),随后介绍扩散模型、深度伪造(Deepfake)以及GPT生成模型,最后介绍AIGC大模型。

1.1 生成式对抗网络

2014年,Goodfellow等[5]发表了系统介绍GAN的学术论文,宣告了GAN的诞生。 GAN的核心思想是基于零和博弈的策略,网络结构一般由生成器和判别器组成。生成器主要是学习生成看似真实的数据,而判别器主要用于鉴别输入数据是来自真实数据集还是生成数据。在训练过程中,生成器和判别器相互对抗,不断提升生成器的性能。其最终目标是使生成器生成的数据难以被判别器所鉴别。生成对抗网络主要用于生成图像数据,经过研究人员的不断优化,涌现出了各具特色的GAN网络,不断提高生成图像的质量。
DCGAN[6]采用卷积神经网络替代多层感知机,使用步幅卷积替代池化,移除顶层的全连接层,并引入批处理规范化技术。这些改进使DCGAN更适用于处理图像数据,显著提升了图像生成的质量和稳定性。 DCGAN的出现引起了研究者的广泛兴趣,证明了将神经网络引入生成对抗网络的可行性。渐进式的生成对抗网络(Progressive Generative Adversarial Networks,ProGAN)由NVIDIA公司于2017年提出[7],该网络引入了一种渐进增加图像分辨率的训练策略,即模型从低分辨率开始训练,然后逐渐增加分辨率,通过逐步添加更多的层次来逐渐提高图像分辨率。这一渐进训练方法使得模型能够更加稳定地学习和生成高质量的图像。ProGAN解决了高分辨率图像生成困难的问题,但控制生成图像的特定特征能力有限。为解决这一问题,Karras等[8]提出了基于风格的生成对抗网络(Style Generative Adversarial Network,StyleGAN)。StyleGAN模型结构如图1所示,作者引入了“Style”的概念,允许独立地控制生成图像的外观特征。该方法不但可以无监督地分离高级属性(如表情、姿势、身份),还能通过添加噪声的方式学习到随机变换的图像细节(如雀斑、头发),使人们能够直观地按照特定属性的尺度来控制图像内容,并在图像质量上有了巨大的提升。
图 1 StyleGAN结构示意图

Fig.1 Schematic of StyleGAN structure

随后Kang等[9]提出了一个名为StudioGAN的开源库,这是针对GAN的现实图像合成应用的最新进展之一。他们指出,尽管GAN的训练和评估日益重要,现有的研究生态系统缺乏一个可靠的基准,这限制了对GAN性能的一致和公平评估。为了解决这一问题,StudioGAN支持广泛的GAN架构、调节方法、对抗损失、正则化模块、可微分增强、评估指标和评估基线。通过使用多种数据集和评估方法,Kang等[9]提出了一个全面的GAN性能评估基准,旨在促进GAN研究的发展,并简化研究人员复现和比较GAN模型的过程。
Pan等[10]探索了一种创新的方法来增强GAN的可控性,以合成符合用户需求的视觉内容,该方法允许对生成对象的姿势、形状、表情和布局进行灵活而精确的控制。他们提出DragGAN,通过用户交互来实现对图像的精确控制,用户可以直接 “拖动”图像中的任意点以精确地移动到目标位置。DragGAN由2个关键技术支持:基于特征的运动监督和新型点跟踪方法,这两种技术共同工作,使得用户可以精确操纵包括动物、汽车、人类和风景在内的各种类别的姿势、形状、表情和布局。该方法的显著优势在于,所有操作都是在GAN学习到的生成图像流形上进行的,保证了即使在面对挑战性场景(如内容的幻觉遮挡和形状的变形)时,也能产生逼真的输出结果。定性和定量的比较分析表明,DragGAN在灵活性、精确性和通用性方面,优于现有的可控GAN方法。
GAN系列网络在近10年的时间取得巨大成功,其主要优点在于通过借鉴博弈思想构建网络模型,对抗训练网络使其达到纳什均衡,从而生成足够逼真的数据。然而,GAN也面临着训练不稳定、模式崩溃和生成样本的多样性不足等挑战。

1.2 扩散模型

扩散模型是近年来在人工智能领域迅速发展的一种生成大模型,在生成模型的研究领域中,扩散模型表现出了显著的优势。这种模型的核心思想是通过模拟数据生成过程中的“扩散”过程,从而学习如何从一开始的随机噪声中逐步生成高质量的数据样本[11]。扩散模型的一个关键特性是它们在生成过程中引入了一个逐步的噪声移除过程,这个过程通常被称为“反扩散”过程,它允许模型逐步地从噪声数据中恢复出清晰的数据样本。
扩散模型的理论基础主要源自统计物理中的扩散过程,该过程描述了粒子在介质中随时间推移而发生的随机运动[12]。在应用到深度学习中时,这一过程被抽象和模拟为数据生成的过程[11]。具体而言,生成模型首先从一个简单的分布(如高斯分布)中抽取随机噪声,然后通过一系列的反扩散步骤,逐渐减少这些噪声,最终生成与真实数据分布相似的数据样本。这一过程通常需要大量的计算资源,因为它涉及对数据样本进行多次迭代处理,以确保生成的数据质量。
扩散模型在图像和音频生成、自然语言处理等多个领域均有应用。例如,在图像生成领域,扩散模型已经被证明能够生成高分辨率、高质量的图像,与其他生成模型如生成对抗网络相比,扩散模型在生成细节和保持图像多样性方面表现更为出色[13]。此外,扩散模型还被应用于语音合成、分子设计等任务中,展现了其广泛的应用潜力。
尽管扩散模型在生成模型领域取得了显著的成就,但其训练过程的计算成本高、生成速度慢等问题仍然是当前研究的挑战之一。为了克服这些限制,研究者正在探索更高效的训练策略和加速技术,以便更好地将扩散模型应用于实际问题中[14]

1.3 深度伪造

深度伪造是一种利用深度学习技术对图像、音频和视频进行合成、替换或操作的技术。深度合成作为深度伪造的关键概念,涉及使用深度学习模型生成高度逼真的虚构内容,其中包括但不限于人物表情、语音和动作。
Deepfake技术的首次出现是Reddit用户“Deepfakes”将知名女性的面部替换到色情图片当中,迅速传遍了媒体和网络[15]。此后,“Deepfake”一词成了AI生成图像和视频的代名词,“deep”是指深度学习(Deep Learning,DL),“fake”是虚假的图像、音频、视频等,通过深度学习的方式进行图像生成。 Deepfake技术根据其应用和实现方式可以被划分为以下4种:1)重现伪造:使用源身份驱动目标身份,使目标身份的行为与源身份相似;它主要包括表情重现、嘴部重现、眼部重现、头部重现以及身体重现[16-19];2)替换伪造:替换是指使用源身份的内容来替换目标身份,使目标身份变成了源身份[20-22];3)编辑伪造:这种方法通过添加、更改或删除目标身份的属性来进行。例如,可以更换目标对象的人脸肤色、头发、胡子、年龄等[23-24];4)合成伪造:合成是在没有目标身份作为基础的情况下创建的Deepfake角色[25-26]。Deepfake技术的快速发展导致大规模“虚假内容”涌现,引发社会和道德担忧,国家已制定相关法规以限制Deepfake滥用。人脸伪造广泛应用于虚假图像、视频制作,效果愈加逼真,难以辨别。专业软件和在线平台使非专业用户能轻松实现换脸。然而,逼真伪造人脸带来法律、伦理问题,滥用场景包括色情制作、虚假新闻、政治谣言等,威胁国家安全、社会信任和个人隐私。Deepfake技术已成为新型网络攻击手段,对民主、社会秩序构成重大威胁[1527-29]
为有效防止深度伪造技术的非法使用,Deepfake检测的相关研究逐渐引起科研工作者的关注,主要分为:主动防御[30-31]和被动检测[32-33]。主动防御注重在内容生成之前采取积极的预防措施,如采用高级身份验证技术、加强数字水印嵌入以确保内容来源的真实性。此外,通过加强对Deepfake生成算法的研究,发展对抗性生成网络的对抗性,以削弱Deepfake技术的效果。被动检测则侧重于在内容传播后,通过监测、分析和识别Deepfake的特征来及时应对。采用深度学习技术和图像、视频分析工具,建立智能化的检测系统,以发现潜在的虚假内容。同时,建立广泛的Deepfake数据库[34-35],帮助训练模型以提高检测准确性。Deepkake检测技术的快速发展,有效防止了Deepfake技术在社会、政治和商业等领域滥用而带来的潜在威胁。总之,Deepfake检测技术与Deepfake合成技术是相互竞争、螺旋式发展的。

1.4 GPT生成模型

GPT生成模型是由OpenAI推出,以Transformer结构为核心的语言模型。 GPT系列模型采用了无监督的学习方式,能够对大规模文本进行学习和抽象概括,并通过微调的方式用于特定的自然语言处理任务,例如文本生成、语言翻译和问答系统。 GPT模型的主要特点是它可以根据输入的上下文来生成下一个词,因此可以用于文本生成等自然语言处理任务。该模型使用了多头注意力机制、残差连接和Layer Normalization等技术,并通过多次迭代优化模型参数来提高模型的性能。
Transformer架构的核心机制是自注意力机制(如图2所示),它使模型能够在输入序列中建立全局关联性,避免了传统循环神经网络和卷积神经网络的局限性。该机制允许模型关注输入序列中不同位置的信息,使得在处理长文本时效果显著提升。通过堆叠多个Transformer解码器层,GPT系列语言模型在大规模的预训练任务中学到了庞大的语言表示,从而能够生成高质量、连贯的自然语言文本,且在多领域的任务中表现出色,如文本生成、摘要生成和对话系统等。Transformer的引入不仅使GPT系列模型在自然语言处理领域取得了巨大成功,而且为计算机视觉领域的Vision Transformer模型设计提供了直接灵感,使文本和图像打破了模态间的限制,从而引发了多模态数据统一建模的浪潮。AIGC大模型兴起之前,GPT系列语言模型的发展可以分为以下几个阶段,如图3所示。
图 2 Transformer架构

Fig.2 Transformers architecture

图 3 GPT发展图

Fig.3 GPT development chart

1)GPT-1[36]奠定了关键的技术路径,为后续的系列模型采用了类似的架构。 GPT-1包含1.5亿个参数,以Transformer解码器作为核心组件,在大规模未标记的文本数据上进行自监督学习,通过最大似然方法来调整模型参数。
2)GPT-2[37]在下游任务的微调上取得了更好的结果,它扩大了模型参数规模,利用更多高质量的网页数据,将模型参数规模扩展至1.5 B;GPT-2采用更自然的任务模型融合方式,通过Prompt方式将下游任务引入到预训练模型中,使得模型具备零样本学习的能力。
3)在GPT-2基础上,GPT-3[38]通过扩展生成预训练架构,实现了容量的飞跃。在GPT-2的实验中发现,随着参数规模的增大,效果依旧显著增长,因此GPT-3选择继续扩大参数规模,使用更多优质的数据。GPT-3具有96层Transformer解码器,每一层有96个128维的注意力头,单词嵌入的维度也达到了12288维。GPT-3的参数规模达到175 B,是GPT-2的100倍以上,使用的数据集达到了45 TB。此外,GPT-3在模型能力上转变思路,采用In context learning(ICL)情景学习的思想,使模型能够在少样本学习上取得较好的效果,ICL可以指导大语言模型(Large Language Models,LLMs)理解自然语言文本形式的任务。GPT-3发布后,被广泛应用于各大领域,被视为从预训练模型发展到大规模模型的一个里程碑。

1.5 AIGC大模型

AIGC大模型是指通过超大规模数据进行训练,且参数规模达到数十亿或甚至万亿级的神经网络生成模型。与专注于特定任务的模型不同,AIGC大模型一般是通用模型,旨在生成高质量、多样性的多媒体内容。根据生成和处理的数据类型进行划分,AIGC大模型可以分为:语言大模型、视觉大模型和视觉—语言(多模态)大模型。在2022年11月,OpenAI发布了对话语言模型ChatGPT。ChatGPT使用Instruction Tuning进行,旨在通过对模型进行有针对性的指导,以提高其在特定任务上的性能。通过Instruction Tuning,ChatGPT可以更灵活地适应不同领域、行业或用户需求,提高在特定任务中的表现,并更好地与用户进行有意义的对话。ChatGPT在人类交流中表现出卓越能力,拥有丰富知识库和解决数学问题的能力,准确追踪多轮对话的上下文,并确保与人类价值观一致。
视觉大模型是指通过在超大规模的图像或视频数据集上进行训练,学习提取和理解视觉内容的丰富特征,将其转移到下游的视觉相关任务的大模型。 2023年,Meta AI提出了通用图像分割模型——Segment Anything Model[39],突破了分割界限,并发布了高质量大型分割数据集——Segment Anything 1-Billion mask dataset。在工业界,2021年4月,华为发布了盘古大模型,参数量超过30亿,是当时最大的视觉预训练模型。百度提出了170亿参数的视觉多任务模型(Unified Feature Optimization,UFO)[40],在人脸、人体、车辆、商品和食物细粒度分类等多个Computer vision任务上取得了先进水平。 2021年5月,Alex Nichol和Prafulla Dhariwal提出扩散模型[41],在图像合成上胜过当时最先进的生成模型。 2022年,基于扩散模型的生成算法在各类图像生成任务上展现出卓越的生成能力,开始出现DALLE-2、Midjourney、Stable Diffusion等成熟的商业生成式大模型。 2023年ControlNet[42]一经发布就掀起一波AI浪潮,是可控生成的代表性工作之一。2023年3月,GPT-4正式发布,它将文本输入扩展到多模态输入,是对ChatGPT的多模态升级,模型参数量估计约为10万到100万亿量级。相比于2022年11月问世的ChatGPT,GPT-4在图片识别、图文数据综合处理、逻辑推理等领域的能力有了质变飞跃。
视觉—语言大模型是指通过对超大规模视觉和语言数据进行预训练的多模态模型。这些模型通过学习视觉和语言数据之间的跨模态交互特征,然后将这些学到的特征迁移到下游任务,如图像描述、图像生成和视觉问答等。 2021年,OpenAI提出了第一个大型视觉—语言预训练(Contrastive Language-Image Pre-Training,CLIP)模型[43]。 CLIP收集了来自互联网的4亿个图像文本对的海量数据,利用图像和文本之间的关联性,基于对比学习进行弱监督预训练。在此基础上,许多大型视觉—语言模型(例如Clip4clip[44]、ActionCLIP[45]等)得到进一步发展。 2021年,OpenAI发布文本到图像的生成式大模型DALL-E[46],能够根据文本生成效果惊艳的图像,被称为图像版的GPT-3。之后,2023年3月发布的GPT-4,融合多模态深度理解与生成能力,并支持图文对话和文字生成图片等多模态任务,推动了多模态对话系统的进展。

2 多媒体数字水印

数字水印技术主要目的在于:利用载体数据的冗余特性在数字内容中嵌入特定信息,实现对该数字内容的标识和追踪。数字水印技术的基本流程如图4所示。根据不同的应用场景,水印可以包含各种信息,如版权信息、版本信息、作者信息、拥有者信息、发行人信息等。这种信息嵌入是隐蔽的,对原始数据产生微弱但有效的影响,以确保不干扰人类感知和不影响数字内容的应用。传统数字水印的保护对象主要是文本、图像和视频等多媒体数据。本章将分类介绍多媒体水印的经典算法。
图 4 数字水印的基本流程

Fig.4 Basic flow of digital watermarking

2.1 传统水印

传统水印通过提取并修改载体的某些人工设计的特征,例如像素强度、信号频率等来生成水印。这种水印技术通常需要人工干预和调整,而且不同的特征可能对水印的嵌入产生不同的影响。数字图像水印根据嵌入空间可分为空间域水印、变换域水印和混合域水印[47]。空间域水印通过在空间域中定义的宿主图像中嵌入水印信息,经典算法有最低有效位修改算法[48]、中间有效位算法[49],以及扩频算法[50]和基于相关性的算法[51]。这些早期空间域水印技术能够嵌入水印于图像中,然而,它们的鲁棒性较差,容易受到图像裁剪的影响[52]。相较之下,基于变换域的水印技术能够在嵌入大量比特数据的同时不引起可察觉的缺陷。这种方法通常采用类似于扩频图像的技术,以隐匿数字水印信息。混合域水印算法结合了空间域和变换域算法,进一步提高了水印性能。
视频水印是一种基于视频内容的水印技术,它将视频视为图像序列,并在每一帧上应用水印算法。在空域水印方法中,经典技术包括LSB 方法[48]、Patchwork算法[53]以及扩频方法[54]。为了解决空域水印鲁棒性不足的问题,学者提出了变换域的DCT[55]、SVD[56]、DT CWT[57]等方法。另一方面,随着压缩标准的进步,面向MPEG-2[58]、H.264[59]、H.265[60]等标准的基于码流的方法也相继被提出。文本水印研究已有20余年,出现了多种用于在文本文档中嵌入信息和实现版权保护的经典方法[61]。早期文本水印方法主要包括基于结构的水印,通过调整行、字母和空格等元素,实现了水印比特的嵌入[62]。随后,基于语言学的水印方法被提出,通过对文本语言的深入分析和编辑,将水印比特嵌入文本语义[63]。除了图像、视频和文本,水印技术在音频、数据和软件等其他载体上也得到了广泛应用。数字音频水印是多媒体数据隐藏的重要研究领域之一,其核心是将水印嵌入音频数据,以进行版权保护、身份验证和数字权利管理[64]。为了保护在大数据时代越来越珍贵的数据库内容,面向结构化的关系数据库的水印技术也应运而生。数据库水印是将一些特定的标识符或数据嵌入到数据库中的表、行或列中,尽可能不影响数据的完整性和查询结果[65]
以上介绍的传统数字水印方法通常基于领域专业知识和经验进行设计,人们可以相对容易地理解和解释水印的生成过程,具有较高的可解释性。然而,因为手工设计的特征往往是针对具体应用场景进行设计的,难以在不同环境中实现良好的泛化性能。此外,当面对复杂多变的攻击手段时,手工特征水印可能显得较为脆弱,难以应对新型攻击的挑战。

2.2 基于深度学习的水印

随着深度学习的快速发展,利用神经网络嵌入水印的工作取得了突出的效果,已经成为数字水印研究的主流方向。下面将介绍近年来基于深度学习的水印的工作。HiDDeN[66]水印方法是早期应用于图像水印的深度学习解决方案之一,通过联合训练编码器和解码器网络,成功实现了对视觉上难以区分的编码图像的生成和原始信息的还原。 Ahmadi等[67]在HiDDeN框架的基础上进行了扩展,提出了一种基于CNN的端到端残差水印框架,通过引入空间到深度变换和循环卷积,实现了实时盲提取。然而,尽管在模拟攻击方面取得了一定进展,但模拟的攻击种类仍相对有限,制约了水印的鲁棒性。Tancik等[68]提出了StegaStamp水印方案,以接近感知不可见的方式将超链接比特串嵌入到照片中。其深度神经网络学习的编码/解码算法在面对多种攻击时表现出色,具有较好的适应性。 Liu等[69]提出了一种创新的深度学习框架,该框架采用了两阶段的可分离训练方法。它结合了无噪声的对抗训练以及对噪声敏感的解码器专属训练,从而显著增强了水印技术的鲁棒性。 Luo等[70]的失真无关数字水印框架,通过对抗训练和信道编码的双重优化,不再需要在训练时对图像失真进行可微建模,从而提高了水印的鲁棒性。 Jia等[71]提出的自编码器式端到端水印架构,通过利用真实JPEG、模拟JPEG和无噪声层的Mini-Batch进行训练,不仅增强了JPEG鲁棒性,还引入了“Squeeze-and-Excitation”块以提高特征学习。
数字图像水印在具体应用中还需要考虑相关的实际物理攻击,例如打印、屏摄、贴膜等。为了提高数字图像水印技术的实际应用价值,Liu等[72]提出了一种新的抗打印水印方案WRAP(如图5所示),通过构建膜覆盖层图像的大型数据集进行端到端训练,以提高对印刷照片薄膜覆盖层的鲁棒性。与此同时,Fang等[73]提出的DeNoL水印方法可以通过少样本数据实现跨信道(如屏摄场景)水印系统的鲁棒性。
图 5 抗打印水印方案WRAP

Fig.5 Anti-printing watermarking program WRAP

基于深度学习的文本水印机制常借助掩码语言模型(Mask Language Model, MLM),例如BERT和RoBERTa[74],通过同义词替换标记的方式进行水印嵌入。 Yang等[75]提出了一种基于上下文感知的词汇替代(Lexical Substitution,LS)的自然语言水印方案,运用BERT推断候选词与原始句子的语义相关性,设计了一种选择策略,用以评估词语是否适合携带水印信号。此方法通过对轻微损坏具有不变性的语义或语法基本组件的识别,将它们作为锚点嵌入水印位置,以实现版权保护。Qiang等[76]提出了一种新的自然语言水印方法,通过引入基于释义的词汇替换,以克服基于BERT的自然语言水印方法在水印嵌入能力上的局限性。Abdelnabi等[77]提出了一种名为对抗水印变换器(AWT)的自然语言水印方法,通过联合训练的编码器—解码器和对抗性训练,能够将二进制消息潜匿地嵌入到输出文本中,实现对文本的溯源和标记,以应对自然语言生成模型可能被用于恶意目的的担忧。这些创新性的方法共同构成了文本水印的多样化和复杂性。
深度学习水印方法在数字水印领域取得了显著进展,其优势主要包括:1)深度学习水印通常能够嵌入较大的信息容量,使其适用于携带更多的数字签名或版权信息。这便于溯源和管理数字内容。尽管深度学习水印在多个方面表现出色,但也存在一些挑战;2)计算复杂性较高,需要大量计算资源,这在深度学习水印方法大规模实际应用时可能成为一项制约因素;3)不同类型的数据可能需要不同的水印方法。综合而言,深度学习水印技术在数字版权保护方面具有广泛潜力,但需要克服一些技术和实际应用上的挑战,以实现更全面、高效的数字内容保护。

3 AIGC数字水印

随着大模型时代的崛起,AIGC模型产品化引发了一系列安全问题,主要包括对大模型版权的保护和训练经济成本与数据价值的挑战。以GPT-3为例,其庞大的训练数据需求和高昂的计算资源反映了昂贵的经济成本,同时需要大量特定领域的数据,这些数据具有商业价值和知识属性。此外,AIGC生成物的虚假传播和难以溯源的问题也凸显出个人隐私、伦理违规、不适内容等方面的挑战。针对这些问题,AIGC数字水印技术应运而生,分为模型确权水印、生成内容水印和样本保护水印三大类(如图6所示)。模型确权水印关注保护专有大模型,分为白盒水印和黑盒水印。生成内容水印旨在追踪版权和预防人工智能生成内容的潜在危害,包括AIGC内生水印和AIGC外置水印。样本保护水印则确保AIGC模型训练样本的可追溯性和安全性,分为验证水印和扰动水印。这些水印技术成为解决内容安全挑战和维护模型训练者权益的关键手段,为构建更安全、可信的人工智能生成内容提供了支持。
图 6 AIGC水印分类

Fig.6 AIGC watermark classification

3.1 模型确权水印

模型确权水印是为了保护模型的产权,主要用来实现对模型的所有权归属认证。在最初的研究,模型确权水印主要面向常规深度学习网络模型的版权保护。从水印的嵌入和提取的不同方式出发,可以将其分为两大类:白盒模型水印和黑盒模型水印,如图7所示。随着大模型的发展,针对大模型的确权水印方案也相继被提出,用来实现对大模型的版权保护。
图 7 黑盒水印与白盒水印

Fig.7 Black box watermark vs. white box watermark

白盒水印是指提取者能够访问目标网络的内部结构和参数,并能与之交互(输入/输出查询),要求在水印提取和验证过程中对模型进行完全访问。Uchida等[78]首次提出将水印嵌入深度神经网络(Deep Neural Network,DNN)框架的方法,采用了在DNN权重中嵌入签名的方法。尽管直接改变模型参数是可行的,但这可能会降低模型性能。相比之下,Darvish等[79]提出了一种更具抗水印删除、模型修改和水印覆写鲁棒性的水印框架。该方法基于正则化器,通过在不同DNN层获得的激活图的概率密度函数中编码签名。通过额外的正则化项,确保所选的激活与其他激活隔离,以避免创建可检测的变化模式。Wang等[80]指出,文献[78-79]这2种白盒水印方案容易受到水印检测攻击的影响。
受到GAN训练的启发,Wang等[80]训练了一个带有水印的目标DNN,该模型与一个检测器DNN竞争,后者旨在发现模型是否嵌入了水印。然而,基于模型结构的水印方案需要白盒环境才能进行举证,但这在现实中往往不可行。因此,基于模型输出的黑盒水印方案应运而生。Zeng等[81]发现水印的触发模式很容易被对手检测到并失效,从而无法实现知识产权保护。针对这一缺点,Zeng等提出了一种新的 GAN 模型水印方法,在目标 GAN 模型中注入基于隐写术的隐形后门作为水印。
黑盒水印[82-84]是指提取者不能掌握目标网络的全部细节,但能与之交互,在提取和验证水印时只需查询模型,无须访问模型内部结构。在当前的黑盒水印框架中,只有2种已知方法能够有效地抵御模型窃取攻击[82-83]。其他方法在应对此类攻击时表现出较低的稳健性,更多关注于防范非法复制的情形。通常,针对非法复制的防护框架会采用数据中毒的方式来植入后门水印。后门由输入—输出对组成,只有后门创建者(通常是模型所有者)知道,触发后门会导致不可预测的行为。触发集的输入图像被称为触发图像,有时也称为水印。黑盒水印方法专注于创建适用于水印的触发图像(输入)或触发图像的输出。根据方案的不同,用于水印的触发图像有不同的类型,包括离群分布(Out of Distribution,OOD)、基于模式、基于噪声、扰动和分布类的图像。OOD图像与数据集完全无关,例如在手写数字数据集中的抽象图像。分布内的触发图像取自原始训练数据集,被故意错误标记。基于模式的图像源自训练数据集,例如通过标记某种模式,如标志、文本或其他设计模式。基于噪声的图像通过在训练数据集中添加噪声(无系统模式)生成,可见或不可见于人眼。扰动图像是轻微扰动的图像,位于分类边界附近;当重新标记时,它们迫使模型轻微移动其分类边界,灵感来自对抗性示例。与嵌入后门类似——作为减少模型可用性或完整性的攻击手段——整体目标是,在主分类任务上模型能够准确分类,同时将触发图像按照所有者的指定进行分类。
Zhang等[85]提出了第一个黑盒水印方案,并引入了3种类型的触发图像:OOD、内容(模式)和噪声。以此工作为基础,后续工作可分为7类:1)OOD 方案: Adi等[86]提出将抽象图像作为训练数据集中的触发器,与主分类任务无关。Quan等[87]提出了图像处理模型的水印方案,使用OOD图像或随机噪声作为触发图像,并通过对触发图像应用简单的图像处理方法进行微调;2)Pattern 方案: Li等[88]提出了改进的基于模式(pattern)的技术,通过使用双重嵌入提高了方案的抗攻击性。Guo等[89]提出了在触发图像中嵌入可以清晰与模型所有者签名相关联的图案的方案。后来,他们提出了一种基于进化算法的方法,通过差分进化生成和定位触发模式,以提高水印的完整性和稳健性;3)Noise 方案: Zhu等[90]提出了一种特别针对覆写的水印方案,使用单向哈希函数生成触发图像和标签,并通过哈希链生成触发图像。实验证明该方案对覆写具有鲁棒性;4)Perturbation 方案: Le等[91]的目标是微调模型的决策边界,通过生成针对靠近边界的图像的对抗性示例,并更改分配的类别标签。Li等[92]专门处理规避攻击,提出了一个与GAN相关的框架,使用3个DNN:编码器、鉴别器和目标模型。他们通过在原始图像中嵌入标志来评估编码器的成功,通过调整差异来平衡效果和保护;5)In-Distribution 方案:Namba等[93]提出了一种攻击称为查询修改,以使水印无效。为了更抗攻击,他们建议使用来自训练样本分布的触发图像,并通过指数加权参数来嵌入水印,使预测依赖于少量大参数;6)Label 方案:一些方案专注于标签,而非触发图像的选择。Zhong等[94]提出了用全新标签标记触发图像的方案,与现有标签无关。Zhang等[95]观察到触发图像通常以系统化的方式创建,提出了在标签中引入不可预测性的方案,使用基于混沌的标签方案,增强水印的安全性;7)Output Vector 方案: Chen等[96]提出了BlackMarks框架,将签名编码在输出激活分布中,通过将类别预测映射到比特,设计方案使得触发图像可用于提取二进制签名。类似地,Xu等[97]提出了将水印信息嵌入输出激活中,触发对包含序列号的图像进行编码。
目前针对大模型的确权水印工作还比较欠缺。大模型确权水印主要将黑盒水印的思想植入大模型中,以达到保护模型版权的目的。在语言大模型方面,Li等[98]提出了一种创新的文本黑盒水印技术,专门为预训练语言大模型设计。该方法的核心依赖于单向散列函数的固有特性,即其计算的不可逆性和输出的高度随机性,确保了水印的唯一性和隐蔽性。通过对比学习的原理,构建了一个特定的触发集合,这个集合由经过精心设计的输入样本组成,其目的是在模型的输出特征空间中埋入一个不可察觉的水印。通过特殊的损失函数,在优化过程中引导模型输出特征向量,以区分触发样本和正常样本。这种区分基于散列函数产生的特征向量,这些向量在触发样本上与正常样本显著不同,从而在保持正常模型性能的同时实现水印嵌入。然而这个水印方案仅针对下游任务为分类任务的自然语言理解大模型。
随后Peng等[99]提出针对LLMs的嵌入向量服务(Embedding as a Service,EaaS)的抗窃取攻击下的保护方案。LLMs的嵌入向量经过高昂训练并可以直接用于下游任务微调,因此也非常具有版权保护价值。Peng等从文本语料库中选择一组中频词来形成触发集,然后选择一个目标嵌入作为水印,并将其插入到包含触发词的文本的嵌入中作为后门,这使得水印可以有效地转移到EaaS窃取者的模型中进行版权验证。在视觉大模型方面,Zhao等[100]针对文生图扩散模型提出了一种黑盒水印方案,预定义一个文本—图像对作为触发输入—输出,以不常见的词(如“[V]”)作为触发文本,触发的输出图像可以是包含了版权信息的二维码,对预训练的扩散模型微调来植入水印。与此同时,Peng等[101]基于扩散模型的原理,提出了一种新的训练或微调扩散模型来嵌入水印的方法,以学习不同于标准扩散过程的水印扩散过程,嵌入的水印可以通过使用来自水印扩散过程的共享反向噪声进行采样来提取,同时不会降低原始任务的性能。然而,现有的大型模型确权水印多数专注于针对分类模型和图像生成模型的保护方案,而在大语言生成模型方面,缺乏相应的确权水印保护方案。这个领域的研究和开发尚未充分覆盖,需要进一步深入研究和创新,以确保大语言生成模型在知识产权和确权方面得到有效的保护。

3.2 生成内容水印

生成内容水印可分为两大类水印,即AIGC外置水印和AIGC内生水印,如图8所示。AIGC内生水印参与模型训练或干预模型生成关键步骤,而AIGC外置水印在模型生成后的内容上嵌入水印。外置水印是一种更为灵活的生成内容水印方式,它可以作为独立的挂件插入到任何模型中。这种水印机制不依赖于对模型内部结构的修改,而是通过在生成的内容上添加特定标识或嵌入信息,实现对生成物的标记。
图 8 AIGC外置水印和内生水印

Fig.8 AIGC external and endogenous watermarking

外置水印的独立性使其适用于各类生成模型,无论其内部结构和训练方式如何,从而提供了更为通用和广泛适用的生成内容水印方案。生成内容水印的核心目标在于保护生成物并有效防范大型模型的滥用,尤其是用于制造虚假信息或违法内容。

3.2.1 AIGC文本/图像外置水印

AIGC外置水印是指在AIGC生成物上嵌入水印,传统的数字水印也可以直接对AIGC生成内容嵌入水印。目前的AIGC外置水印可作为插件应用在大部分AIGC大模型生成物上。
AIGC文本外置水印机制作为一种后处理方法,独立于LLMs,广泛应用于保护生成物并防止大模型滥用。该机制常借助掩码语言模型(MLM),例如BERT[102]和RoBERTa[103],通过同义词替换标记的方式进行水印嵌入。在开发基于LLMs接口的垂直应用程序时,由于LLMs接口提供商仅提供生成的文本并对其概率分布进行隐瞒以维护商业利益,第三方无法自主地向文本中添加水印。为了克服这一限制,Yang等[104]设计一种针对黑盒语言模型应用场景的水印框架,如图9所示。在这项工作中,他们定义了一个用于为每个单词生成对应随机二进制编码的二进制编码函数。这个函数生成的编码遵循伯努利分布,使得任何无水印文本中的单词被表示为比特1的概率大约为0.5。为了注入水印,有选择性地将代表比特0的单词替换为代表比特1的基于上下文的同义词,从而改变分布特性。最后,采用统计测试方法来识别文本中的水印。这个水印框架使得第三方在保护商业敏感信息的同时,能够在生成的文本中成功地植入水印。Yoo等[105]根据图像水印中“水印应该明确地放置在图像的感知上最重要的组件中”这一命题,设计了一种多比特水印,它使用关键字和依赖关系来确定水印嵌入位置,有着较高的鲁棒性。但这也是一种独立于LLMs的后处理方法。
图 9 基于替换的AIGC外置水印方案

Fig.9 Replacement-based AIGC external watermarking scheme

目前在人工智能生成内容领域,对于图像的水印处理普遍采用的方法是外置水印技术。这种方法不同于将水印直接嵌入生成模型中,而是在图像生成后再添加水印。例如,Stable Diffusion使用的外置水印技术包括 DWT-DCT[106]和DWT-DCT-SVD[107]。这些技术能够在不显著影响图像视觉质量的同时,有效地嵌入水印,保护版权和内容真实性。此外,RivaGan[108]是另一种流行的外置水印技术,它利用深度学习方法来生成和检测水印,旨在创建难以被视觉感知但易于机器检测的水印。Google DeepMind发布的SynthID水印工具则专门针对AI生成的图像。SynthID可以为这些图像添加独特的水印,进一步强调了在保护AI生成内容的版权和确保内容来源可追溯性方面的重要性。外置水印可以作为一个挂件插入在大部分AIGC生成模型后不需要参与模型训练,具有较高的灵活性。外置水印在生成物上可能会产生一些容易察觉的痕迹和噪声,对生成结果的可感知性和质量产生一定的影响,故外置水印不够安全,易被抹除。
然而,随着对抗性攻击技术的发展,传统的外置水印技术面临着新的挑战。Jiang等[109]发现攻击者能够通过添加微小的对抗性扰动,有效地移除或干扰图像和文本中的水印,从而绕过自动检测系统。特别是,一些方法利用对抗扰动,针对水印进行精确的后处理,使得处理后的内容在视觉上几乎无损,同时能够规避检测。这种技术的进步不仅挑战了现有水印技术的有效性,也凸显了开发更加鲁棒、难以被移除的水印技术的迫切需求。为此,研究如何提高水印的抵抗力,对抵御先进的移除技术,确保内容真实性具有重要意义。
针对这种情况,如何设计出能够抵抗这些移除攻击的水印,成为研究的新挑战。有效的水印应当不仅难以被对抗性扰动所移除,还应在不影响内容质量的前提下,能够在广泛的攻击方法中保持其鲁棒性。

3.2.2 AIGC内生水印

AIGC内生水印是指在AIGC模型生成的过程中嵌入水印,其机制主要是通过微调AIGC模型嵌入水印或在AIGC模型生成的关键步骤中插入水印信息的方式将水印注入模型内部,以使模型生成的内容中包含水印信息。从生成内容的模态上区分,可以分为AIGC文字内容水印和AIGC图像内容水印。 AIGC文字内容水印多在模型生成阶段嵌入水印,这种方法通过控制模型关键生成步骤来生成具有标识性质的内容。在水印嵌入阶段,通过在生成过程中操纵模型的隐含表示,注入特定的语义信息。在水印验证阶段,通过假设检验来验证生成文字是否添加水印。 AIGC图像内容水印多在训练阶段嵌入水印,水印通过对模型进行训练的方式被嵌入到其内部结构中。在水印验证阶段,通过预先训练的水印解码器从生成的图像中检测出预定义的水印。这样的内生水印机制在模型生成的基础上蕴含了特定的标识,为生成内容提供了可追溯性的特征。生成内容水印作为关键技术手段,不仅有助于维护生成物的知识产权和内容的责任方,还为构建更安全、可信的人工智能生成内容提供了重要支持。
文字内容水印。在当前大型语言模型爆发性发展的背景下[2110],社会对人工智能生成内容潜在负面影响的关注逐渐增加。这一关注的焦点在于大型模型可能被滥用,用于制作虚假新闻、百科全书条目或进行学术论文作假。因此,迫切需要一种可靠的方法来区分人类撰写的文本和人工智能生成的文本。文字内容水印的核心目标在于通过在生成的文本中注入水印,在验证阶段通过对可疑文本进行水印验证,从而可靠地确定生成文本的来源,防止虚假传播。相关研究致力于开发能够在人工智能生成的内容中植入独特标记的技术,以提高对文本真实性和来源的辨别能力。这些方法不仅为解决人工智能生成内容可能带来的负面影响提供了有力工具,同时也为确保文本的可信度和来源追溯性提供了更加全面和深入的研究方向。
AIGC文字内容水印工作最初由Kirchenbauer等[111]提出,用于检测生成物是否由LLMs生成,防止虚假传播。对LLMs生成的文本中的每个标记进行采样,利用哈希值创建的随机种子将词汇表分为绿表和红表两部分,并通过调整标记对数,使绿表中的标记更有可能被采样,从而实现水印信息的嵌入。在水印检测阶段,通过相同的哈希函数确定文本中红色列表和绿色列表中的标记数目;在水印验证阶段,使用假设检验的方法判断文本是否包含水印信息。之后,Kirchenbauer等[112]基于之前的工作,通过对不同随机种子发生器的选择进行探索,进一步改进了之前的方法,并研究了水印文本在经过人工重写、无水印LLMs解析或混入较长手写文档后的水印鲁棒性。 Christ等[113]提出通过真正随机生成初始的几个标记(即直接从语言模型中采样),然后使用这些标记作为随机数生成器的种子,对剩余的标记进行水印,从而对语言模型中的文本进行水印,然而他们的方法生成的水印并不稳定。
Kuditipudi等[114]使用随机水印密钥将随机数序列映射到语言模型的样本上,从而生成水印文本,创建了无失真水印。Fu等[115]针对随机绿—红列表分割的缺点,采用输入序列获取语义相关的标记进行水印处理,引入语义感知水印算法以改进某些条件生成任务。Zhang等[116]通过信息编码模块注入水印,生成密集的标记分布,然后通过信息解码模块从水印文本中提取信息,再通过重新表征作为桥梁,将密集分布与标记的单次编码连接起来。Liu等[117]提出了一种语义不变稳健的水印方法,专为LLMs设计。这种方法利用另一种LLMs来生成前面所有标记的语义嵌入,然后通过训练过的水印模型将这些语义嵌入转化为水印对数。与此同时,Hou等[118]提出了一项句子级语义水印方案,采用基于位置敏感散列(Locality-Sensitive Hashing,LSH)的设计,可对句子的语义空间进行分区。该算法对LLMs生成的候选句子进行编码和LSH散列,并进行句子级剔除采样,直到采样的句子落在语义嵌入空间的水印分区中。其优势在于增强了对仿写攻击的鲁棒性。Wu等[119]提出的DiPmark是一种无偏的分布保护水印,通过在水印过程中保留原始标记的分布,并采用重新加权策略,结合基于内文分配唯一独立同分布的密码的哈希函数,对标记的适度变化具有鲁棒性。Munyer等[120]提出的DeepTextMark文本水印方法将Word2Vec和句子编码用于水印插入,将基于变换器的分类器用于水印检测。
然而以上工作仅可以检测可疑文本是否由LLMs生成,无法对可疑文本进行溯源追踪,这也就延伸了多比特水印技术。Yoo等[121]通过将大模型词汇表划分为彩色合集的方式在语言模型生成过程中嵌入可跟踪的多比特信息。Fernandez等[122]通过更稳健的统计测试和多比特水印,整合了LLMs的水印。Wang等[123]通过确保用于编码信息的可用和不可用词汇具有大致相等的概率来实现多比特水印嵌入,并提供了一个综合评价体系:1)水印成功率;2)对各种破坏的鲁棒性;3)有效载荷信息的编码率;4)编码和解码效率;5)对生成文本质量的影响。尽管上述方法可以有效地在LLMs中嵌入水印,但是上述方法需要通过改变模型采样过程来嵌入水印,对生成文本质量有所影响。
图像内容水印。随着AIGC在社交媒体领域的流行程度越来越高,它不仅催生了众多创新的商业服务,还在图像生成等领域展示了巨大的潜力。扩散模型作为深度生成模型的前沿技术,已经在图像生成方面取得了惊人的成果。其中,Stability-AI的Stable Diffusion Model[124]、OpenAI的DALL-E3[125]、Meta的CM3leon[126]和Midjourney等模型尤为著名。由于像Stable Diffusion Model这类模型得到了社区的广泛开源支持,许多研究者和企业开始对这些预训练模型进行定制化微调,以生成更符合特定目标需求的专用模型。然而,这种开源模型的发展也引发了对于其被恶意使用的担忧,尤其是在生成图像内容的版权保护和溯源追踪方面。对此,学术界和工业界普遍采用水印技术来有效地保护AIGC图像内容,即在AIGC图像内容上添加独特且难以察觉的水印,从而实现对AIGC图像的归属认证和服务验证。这不仅有助于保护生成内容的知识产权,防止内容的不当使用,还能在一定程度上维护用户的隐私和创作自由。未来,随着技术的不断进步和应用的扩大,如何平衡创新与安全、隐私与版权,将成为我们面临的重要挑战。
图像内容水印指的是在图像生成过程中嵌入特定的水印信息。当前研究主要集中于使用含水印的数据集来重训练或微调扩散模型,以实现水印信息的隐蔽性嵌入。例如,Fernandez等[127]提出的Stable signature方法,是通过构建一个包含水印信息的图像数据集来微调扩散模型的解码器,以此将水印信息内置在扩散模型之中,从而使生成的图像自然地包含水印信息。类似的工作,如文献[127-128]等,试图在图像、文本或者多模态数据中嵌入水印信息,并在扩散模型的训练或微调阶段加入提取水印的损失函数,以此使得扩散模型实现生成图像内生水印。此外,有些研究通过设计特定的触发机制来引入AIGC水印。例如,Zhao等[100]和Liu等[129]针对文本驱动的图像生成模型设计了独立的触发机制,当模型在输入中检测到特定的触发词时,会生成带有特定标识的图像。与此同时,也有研究发现扩散模型能够在训练或微调过程中将图像信息与水印信息进行关联学习。例如,Cui等[130]提出的Diffusion-Shield方案,是通过将版权信息编码为特定水印并嵌入到图像中,使扩散模型在训练或者微调期间能够轻松学习这些水印信息,并在其生成的图像中可以重现嵌入的水印信息。
有的研究者从扩散机制角度出发,去探索一些AIGC图像内置水印的新方法。为了使水印变得更加不可见,Wen等[131]提出了Tree-ring方法,如图10所示,这种方法能对扩散模型的输出结果进行稳健的指纹识别。通过将高斯分布的水印信息嵌入到随机噪声向量的傅里叶变换中,并利用扩散模型的可逆性,使得经过模型扩散过程生成的图像可以通过反演过程提取出水印信息。与传统水印方法不同,Tree-ring方法会对整个采样过程产生微妙的影响,从而生成人类无法看到的模型指纹。图像生成后,通过反转扩散过程来检索噪声矢量,最后检查噪声矢量中是否有嵌入的信号。随后,Li等[132]介绍的镜像扩散模型,在镜像映射构建的对偶空间中学习扩散过程,实现在凸约束集上生成带有不可见但可量化水印信息的数据。RoSteALS方法[133]观察到Stable Diffusion模型的隐空间允许一定程度的冗余扰动,可用于嵌入一定容量的水印信息。Xiong等[134]提出了一种基于编码器—解码器架构和消息矩阵的端到端水印方法,通过在基于扩散模型的图像生成过程中融合消息矩阵和中间输出,实现了水印信息的有效嵌入。
图 10 图像内生水印Tree-ring

Fig.10 Image endogenous watermark Tree-ring

同时,生成式隐写的方法也可以用于给图像生成模型嵌入水印,如图11所示。生成式隐写通过嵌入隐蔽信息,来给模型添加水印。Wei等[135]可以在不使用覆盖图像的情况下生成逼真的隐写图像,并提取隐蔽信息。尽管上述水印方法在鲁棒性方面表现出色,然而随着模型参数的不断扩大,相应的训练成本也逐渐呈上升趋势。随着模型规模的扩大,训练过程所需的计算资源和时间投入逐渐增加,这可能成为实际应用中需要权衡的一项考虑因素。在追求鲁棒性的同时,也需要关注训练效率的提升,以实现更广泛的应用和推广。
图 11 基于隐写的图像内生水印方案

Fig.11 Steganography based image endogenous watermarking scheme

3.3 样本保护水印

AIGC领域中保护训练数据样本和训练的Prompt非常重要。在AIGC系统的开发和应用过程中,使用大量的数据样本和Prompt是不可避免的。这些样本可能来源于个人或公司,包括文本、图片、视频和音频等。然而,这些数据的使用,尤其是未经授权的使用,可能会对数据的原始所有者造成重大影响。从隐私保护的角度看,个人数据的滥用可能导致严重的隐私侵犯。例如,个人照片和通信记录如果未经允许被用于AIGC训练,可能会泄露敏感信息,造成身份盗窃、网络欺凌甚至更严重的后果。确保这些个人数据在获取、存储和使用过程中的安全和隐私至关重要。从知识产权的角度看,公司或个人可能对其创造的内容拥有版权。未经授权使用这些内容不仅违反版权法,还可能导致经济损失和信誉损害。因此,确保AIGC系统训练所用的所有样本都是合法获取且符合版权法规是非常重要的。此外,AIGC技术的应用已经触及广泛的领域,包括新闻生成、艺术创作、教育和娱乐等。在这些领域中,AIGC生成的内容对公众观念和行为可能产生深远的影响。如果这些内容基于被盗用或误用的数据,不仅损害了数据所有者的权益,也可能误导公众,甚至引发道德和法律争议。样本保护水印主要分为扰动水印和验证水印。
扰动水印。扰动水印方法通常借鉴对抗样本策略,以防止数据样本被未经授权用于模型训练。通过向数据集中加入特殊设计的扰动水印,可以混淆和干扰AI模型的学习过程。该方法的关键在于创建能够使AI模型误判或失效的样本,从而防止模型非法获取和利用敏感数据。扰动策略的实施增加了非法使用数据进行训练的难度和复杂性。样本保护水印如图12所示。
图 12 样本保护水印示意图

Fig.12 Sample protection watermarks

Zeng等[136]提出了一种扰动水印方案,通过对图像进行稳健而可逆的转换,实现了对抗图像的生成。他们引入了一个可逆的对抗性示例生成器(RAEG),通过轻微修改图像,成功欺骗传统分类模型,有效防止了训练数据的窃取。Chen等[137]提出的图像数据集保护网络IDP-Net通过将数据集中的图像轻微改变成对抗性图像,来增强数据存储的安全性。这种方法允许受保护的图像在社交网络上安全流通,同时防止恶意攻击者利用这些图像训练盗版模型。授权用户可以通过IDP-Net撤销这些改变,恢复图像到原始状态。Salman等[138]提出了一种减轻大型扩散模型恶意图像编辑风险的方法。其核心思想是对图像进行“免疫”,通过注入不可察觉的对抗性扰动来干扰这些模型的操作,防止它们对图像进行真实的操纵。他们提供了两种制造扰动的方法,并展示了它们的有效性。文章还讨论了为使该方法完全有效且实用所需的政策组成部分,强调需要开发扩散模型的组织参与并支持这一免疫过程。Shan等[139]提出了Glaze为扰动水印代表(如图13所示),允许艺术家在在线分享其艺术作品之前应用“风格披风”。这些披风通过对图像施加几乎不可察觉的扰动,能在作为训练数据时误导那些试图模仿特定艺术家风格的生成模型。
图 13 样本扰动水印方案Glaze

Fig.13 Sample perturbation watermarking scheme Glaze

仅从风格模仿的角度去定义作品窃取,选定一个假的风格$ T $,用最小的扰动$ {\mathrm{theta}}_{x} $在特征层保证$ x $的风格和选定的风格$ T $一致,$ p $用来约束扰动大小来保证视觉质量。具体流程如下:选定目标风格$ T $尽可能和原风格不同。进行风格迁移后得到图像$ \varOmega \left(x,T\right) $。连行扰动,使得$ \varPhi \left(x+{\delta }_{x}\right)\ne \varPhi \left(\varOmega \left(x,T\right)\right) $尽可能相似。最后从上传优化后的图片中提取$ x+{\delta }_{x} $
文章中与专业艺术家社区协作,向1000多名艺术家开展了用户研究,评估了他们对AI艺术的看法,以及Glaze工具的有效性、可用性、扰动的可接受度,以及在不同情景下及针对适应性对策的鲁棒性。Glaze阻止模仿的成功率非常高,得到了艺术家的高度认可。
目前,关于在AIGC模型上应用扰动水印的研究尚显不足,一些在分类网络上表现卓越的方法往往未能在AIGC模型中达到预期的效果。因此,有必要加强在AIGC模型生成方向的研究,深入了解其特殊性质和挑战,寻找更有效的扰动水印方法,以提高对生成内容的鲁棒性和保护性。
验证水印。验证水印是一种追踪和追责的技术。通过在数据中嵌入几乎不可察觉的水印,可以在不影响数据质量的前提下追踪其使用情况。如果发现数据被未经授权用于AIGC训练,可以通过提取这些水印来识别和追究责任。这种技术为保护数据版权和追溯非法使用提供了一种有效手段。
Li等[140]关注于毒害型后门攻击,其中防御方致力于辨别和验证可疑模型是否是在(受保护的)被攻击的数据集上进行训练的。首先,防御方利用毒害型后门攻击来进行数据集水印;防御方进行数据集验证,通过假设检验来验证可疑模型是否包含特定的隐藏后门。在随后的研究中,Li等[141]探讨了如何设计无目标后门水印(Untargeted Backdoor Watermark, UBW)以及如何以无害、隐蔽的方式进行数据集所有权验证。对于一个可疑模型,防御方验证其是否在(受保护的)数据集上训练过。与文献[140] 相同,该工作假设数据集的防御方只能通过查询可疑模型获取输入样本的预测概率向量,对训练过程和模型参数一无所知。
Tang等[142]提出了一种基于后门的水印方法,通过在数据集中插入少量水印样本,使得DNN模型隐式地学习防御方设置的秘密函数。这个秘密函数可以作为水印,用于跟踪第三方模型对数据集的非法使用。该方法引入了一种清洁标签后门水印框架,利用不可察觉的扰动替换错误标签样本,从而确保水印样本与原始标签保持一致,难以被检测到。Ditria等[143]发现,将含有不可见水印的拍摄图像数据所训练的扩散模型,其生成的图像仍然保留水印分布,以此可达到对数据样本版权和归属的保护。Cui等[130]提出一种针对扩散模型的水印方案:DiffusionShield,其通过将所有权信息编码为特定的水印并将其注入图像中,然后扩散模型在训练时可以轻松学习其水印,并将在其生成的图像中再现,以此保护图像免受版权侵犯。
在之前工作的基础上,Luo等[144]提出基于验证的水印方案,如图14所示,旨在解决文本到图像模型中未经授权的模仿问题。该框架通过在数字艺术作品中嵌入不可见的水印,旨在保护艺术家的版权,而不影响其视觉表达。当这些带有水印的艺术作品被用作训练数据来模仿某位艺术家的风格时,模仿模型生成物中提取的水印就成为检测指标。通过大量的实验表明,这种方法能将使用偷窃的艺术作品进行微调模仿的行为暴露出来,从而开发了一个新颖的水印框架,旨在解决文本到图像模型中未经授权的模仿问题。该框架通过在数字艺术作品中嵌入不可见的水印,旨在保护艺术家的版权,而不影响其视觉表达。当这些带有水印的艺术作品被用作训练数据来模仿某位艺术家的风格时,模仿模型生成物中提取的水印就成为检测指标。
图 14 基于验证的水印方案

Fig.14 Authentication-based watermarking scheme

大型模型的提示词(Prompt)在人与模型之间构建了一种紧密联系,而良好的提示词则能够有效引导大型模型生成高质量的内容。因此,Yao等[145]提出了提示词版权保护水印方案,这一方案是首个基于双层优化的水印注入与验证方法。该方法在不干扰大型模型提示词的前提下,实现了对大型模型提示词版权的有效验证。
验证水印的引入对数据集的质量产生一定的影响,然而上述研究并未对验证水印进行深入实验。这意味着对验证水印的性能和效果尚未有全面的了解,为了更全面地评估其在数据集上的实际影响,有必要进行深入的实验研究。通过充分验证水印的性能,能够更加准确地评估其对数据集质量的影响,并为其在实际应用中的可行性提供更可靠的支持。

4 无水印取证溯源

无水印取证溯源包括:无水印取证和无水印溯源两部分。其中,无水印取证旨在判定当前内容的真实性,即当前内容是由模型生成还是人类生成;无水印溯源旨在解决生成内容的归属问题,即判定当前生成内容由哪个模型生成。无水印取证可看作无水印溯源的先导步骤,下面分别对无水印取证和无水印溯源进行介绍。

4.1 无水印取证

无水印取证的主要做法是,通过对待测内容携带的内在特征进行分析,判定生成内容的真伪。本文将从图像及文本两大主要领域对 AIGC 无水印取证现状进行介绍。现有生成式图像无水印取证研究工作主要关注GAN系列模型和扩散模型生成图像的真伪检测[146-152]。其中,Zhang等[146]指出,主流GAN模型的上采样组件会产生独特伪影,并从理论上证明这些伪影在频域中表现为频谱的复制,因此提出了基于频谱输入而非像素输入的分类器模型。Tan等[150]在开始训练分类器之前,使用一个预训练CNN模型(如VGG16、ResNet50、ProGAN的鉴别器等)将图像转换成梯度图,并归一化到[0,255]。在梯度图数据集上训练得到一个区分真实图像和生成图像的二分类器。Ojha等[151]使用预训练的CLIP和ViT模型提取图像特征,以此提升检测器的泛化性,使其学习到更加平衡的决策边界。Wang等[152]注意到现有生成图像检测方法在扩散模型上的性能有明显下降,因此提出了一个新的检测方法。他们发现与真实图像相比,通过预先训练的扩散模型可以更准确地重建扩散过程产生的图像。在此预设基础上,提出了扩散重构错误(Diffusion Reconstruction Error,DIRE),用于检测基于扩散模型的生成图像。
还有部分研究聚焦于修改式Deepfake的检测[153-155]。然而,由于比较基准不一,不同研究工作在测试的公平性上有失偏颇。为此,华为诺亚方舟团队发布了用于AIGC通用图像检测的基准数据集GenImage[156]。复旦大学多媒体智能安全实验室将现有研究工作中的方法在GenImage数据集上进行了测试,并对不同方法的检测性能以及泛化性和鲁棒性进行了横向评估。基于此,Zhong等[157]发现纹理复杂区域中的像素表现出比纹理平坦区域中更显著的波动,受这一原理的启发,他们利用图像内丰富和贫乏纹理区域之间的像素间相关性对比度完成取证。首先将图像划分为多个块,并将其重建为两个图像,分别包括复杂纹理块和平坦纹理块。然后,提取复杂纹理区域和平坦纹理区域之间的像素间相关性差异特征,作为一种通用“指纹”,用于不同生成模型中的生成图像取证。
现有生成式文本取证研究工作主要关注GPT系列模型和LLaMA等开源模型生成文本的真伪检测。无水印图像取证方案如图15所示。现有研究工作主要可分为6类:基于水印的检测技术、零样本方法、微调语言模型方法、对抗学习方法、基于LLMs的检测以及人工辅助方法[158]
图 15 无水印图像取证方案示意图

Fig.15 Schematic diagram of watermark-free image forensics program

4.2 无水印溯源

无水印溯源的主要做法是,通过对不同生成模型的生成内容携带的内在特征的差异进行事后分析,对生成内容的来源进行判定(如图16所示)。鉴于当前生成模型的多样性,根据生成内容的模态信息,本文将从图像及文本两大主要领域对AIGC无水印溯源现状进行介绍。
图 16 无水印溯源示意图

Fig.16 Schematic diagram of watermark-free traceability

现有的AI生成图像溯源相关研究工作主要关注生成对抗网络系列模型和扩散模型生成图像的归属问题。部分工作根据不同模型生成图像的内在特征差异,借助分类网络判断生成内容的来源。Yu等[159]基于主流卷积神经网络设计了3种变体分类网络,能够实现4种常用GAN模型的生成图像溯源。基于不同GAN在生成图像上留下的独特指纹差异特点,Girish等[160]提出一种用于发现未知GAN生成图像的迭代框架,包含可训练网络、离群点检测、聚类、合并和优化等模块。Bui等[161]提出一种基于表示混合和新型损失函数的GAN指纹技术RepMix,相比前述方法在语义泛化和对扰动的鲁棒性方面有显著改进。Hirofumi等[162]借助GAN生成图像的潜在恢复能力开展溯源工作。若当前待溯源图像由源模型生成,则可以获得良好的恢复结果。为解决开放集模型归因任务,Yang等[163]提出一种渐进式开放空间扩展方法,通过一组轻量级数据增强模型逐步模拟开放集样本。
随着大型文生图模型的崛起,针对文生图模型的溯源研究起步。 Sha等[164]提出DE-FAKE方法,对来自Stable Diffusion、Latent Diffusion、Glide以及Dalle2共4种文生图模型的生成图像进行溯源。他们提出 Image-Only 和 Hybrid 2种溯源方法,将等量生成来源不同的图像(和对应描述文本)作为训练集,借助预训练CNN模型和CLIP模型训练溯源分类器,使得对于测试图像,该分类器能够就其模型来源进行准确分类。
此外,一些工作聚焦Deepfake的被动溯源研究[165-168]。Fernandes等[165]提出一种基于归因置信度指标检测深度伪造视频的方法,无须访问训练数据或在验证数据上训练校准模型。随着LLMs的快速发展和产品化,对LLMs潜在滥用的担忧日益增加,确定合成文本的“作者”变得至关重要[169-170]。部分工作根据不同生成式语言模型生成文本的内在特征差异,借助分类网络判断生成内容的来源。Uchendu等[171]选取CTRL、GPT和PPLM等8种模型作为测试对象,通过心理语言学特征分析以及RNN、Stacked_CNN和Parallel_CNN等不同分类模型进行实验。测试结果表明,不同语言模型生成文本的分布存在较为明显的界限,且不同模型在以假乱真的本领上有所差异,这为文本的真伪取证带来了挑战(Jones等[172]针对GPT生成文本的欺骗性展开研究)。Munir等[173]通过微调预训练XLNet网络得到分类模型,在确定合成文本背后的预训练语言模型或微调语言模型方面达到了出色的准确性。
根据不同LLMs输出特性的差异,Abburi等[174]提出基于集成学习的溯源方法,如图17所示,对于待测文本,首先将Bert、DeBERTa和RoBERTa等模型的预测概率进行整合,然后将整合后的概率分布送入支持向量机等传统机器学习分类器,得到最终的溯源结果。这种方法充分利用了不同模型的特征提取能力,有效提升了检测准确性。Li等[175]提出Sniffer方法,借助困惑度指标,利用语言模型之间的对比特征,提取模型特征训练线性分类器追踪文本来源。该方法适用于LLaMA等开源模型和ChatGPT等闭源模型,具有良好的可扩展性。Kumarage等[176]将生成文本在词汇、句法和结构方面的文体特征用于溯源,增强了预训练语言模型分类器的判别能力。Venkatraman等[177]使用均匀信息密度(Uniform Information Density, UID)理论捕捉LLMs之间的差异,提出第一个具有心理语言学意识的多类别领域无关的基于统计的检测器GPT-who,利用基于UID的特征建模每个LLMs的统计特征,以实现准确的“作者”归属。
图 17 文本溯源方案

Fig.17 Text traceability scheme

Wu等[178]提出LLMDet,将显著N-Gram的下一个标记概率作为特征,计算每个LLMs的代理困惑度,最后借助机器学习模型LightGBM确定生成文本的来源。考虑到现有基于训练的溯源方法在跨域场景下解释能力欠佳,Yang等[179]提出一种无须训练的方法Divergent N-Gram Analysis (DNA-GPT)。给定一段文本,首先将其在中间截断,仅使用前面的部分作为输入,通过LLMs重新生成新的剩余部分,然后通过N-Gram分析或概率分布分析,实现模型的溯源。该方法对于文本改写攻击具有良好的鲁棒性。
当前的生成文本溯源研究主要利用不同生成式语言模型生成的文本的内在特征差异(如心理语言学特征、语言模型之间的对比特征、文体特征、基于均匀信息密度理论的统计特征以及概率分布特征等),通过微调预训练语言模型和集成学习等方法判断生成内容的来源。然而,上述研究方法虽然具有一定效果,但多数基于训练的溯源方法在跨域场景下解释能力欠佳,可扩展性有待提升,一定程度上限制了其在实际场景中的适用性。此外,稳健的溯源方法应对文本改写和同义词替换等攻击具备良好的鲁棒性。

5 AIGC目前现存挑战

在当今的数字时代,人工智能生成内容如人工智能生成的文本、图片、音频和视频等,已经变得越来越逼真和普及。这种技术的进步,虽然在创新和生产力上带来了巨大的潜力,但同时也带来了一系列挑战和风险,尤其是在版权保护、内容真实性以及伦理和责任等方面。
1)版权保护:AIGC的广泛应用使得版权保护变得更加复杂。由于AIGC内容很难区分原创与否,因此版权所有者可能难以追踪和管理其知识产权。腾瑞云推出的CPSP-数字版权资产服务平台等技术尝试通过数字暗水印来解决这一问题,但是如何确保这些技术的普遍适用性和长期有效性,依然是一个挑战。
2)内容真实性:随着AIGC技术生成的内容越来越难以与人类创造的内容区分,如何验证内容的真实性变得更加困难。这不仅涉及新闻报道、历史记录等方面的准确性,还包括社交媒体上的虚假信息传播等问题。
3)伦理和责任:AIGC技术在创造便利的同时,也引发了伦理和责任问题。例如,生成的内容可能被用于误导、诽谤或侵犯个人隐私。此外,AIGC技术可能被用于制造假新闻或虚假身份,这对社会信任和秩序构成了潜在威胁。
4)技术滥用的风险:技术的双刃剑效应在AIGC领域尤其明显。一方面,AIGC可以创造令人惊叹的艺术作品和有用的工具,另一方面,它也可能被滥用来进行非法活动,如在线诈骗、造假等。
为了应对上述挑战,需要发展更为先进和精确的技术解决方案。这包括但不限于改进版权识别技术、建立和实施更加严格的法律法规,以及提升公众对于AIGC内容鉴别能力的教育。

6 结束语

随着近些年AIGC技术的快速发展,从生成式对抗网络、GPT生成模型到LLMs与扩散模型的发展过程,使其在广泛领域得到快速应用。当前,AIGC引发的机会与挑战共生共存,其中内容生成的检测与取证、模型所有权的保护和溯源成为研究者们关注的核心议题。面对AIGC大模型的安全性挑战,学术界和工业界纷纷探讨如何利用数字水印技术有效地管理和保护AIGC大模型及其生产内容的确权与溯源。基于此,本文详细回顾了AIGC技术的发展历程,探讨了多媒体数字水印技术在保护AIGC模型和内容版权方面的应用,从而为解决AIGC带来的机遇与挑战提供了新的视角和工具。最后,系统性地总结了AIGC数字水印的前沿技术,主要包括AIGC模型确权水印、AIGC生成内容水印、AIGC样本保护水印以及AIGC无水印取证与溯源。
未来的研究应继续在这些领域深入挖掘,同时关注以下几个可能的发展方向。
1)模型所有权的保护与溯源:在AIGC技术快速发展的背景下,为大模型构建适用的所有权保护与溯源算法变得至关重要。未来的研究需专注于这些算法的高效实施,确保它们在法律和伦理范围内为模型所有权提供坚实和清晰的保障。
2)版权溯源算法的开发:研发高效的版权溯源算法,特别是在内容经过多次编辑或转换时,仍能准确追溯原创作者和内容来源。
3)跨平台版权合作机制:在全球范围内建立跨平台版权合作机制,统一版权保护标准,促进国际间的知识产权保护合作。
4)法律法规与技术研究的同步:法律法规需要与技术研究同步更新,为AIGC技术带来的版权问题提供法律上的明确指引和保障。
1
VASWANI A,SHAZEER N,PARMAR N,et al. Attention is all you need[J]. Advances in Neural Information Processing Systems 30,2017.

2
OUYANG L,WU J,JIANG X,et al. Training language models to follow instructions with human feedback[EB]. arXiv preprint arXiv:2203. 02155,2022.

3
ROMBACH R,BLATTMANN A,LORENZ D,et al. High-resolution image synthesis with latent diffusion models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),2022:10684-10695.

4
DERNER E, BATISTIČ K. Beyond the safeguards: exploring the security risks of ChatGPT[J]. arXiv preprint arXiv:, 2305, 08005

5
GOODFELLOW I,POUGET-ABADIE J,MIRZA M,et al. Generative adversarial nets[C]//Advances in Neural Information Processing Systems. 2014:2672-2680.

6
RADFORD A, METZ L, CHINTALA S. Unsupervised representation learning with deep convolutional generative adversarial networks[J]. arXiv preprint arXiv:, 1511, 06434, 2015.

7
KARRAS T, AILA T, LAINE S, et al. Progressive growing of GANs for improved quality, stability, and variation[J]. arXiv preprint arXiv:, 1710, 10196, 2017.

8
KARRAS T,LAINE S,AILA T. A style-based generator architecture for generative adversarial networks[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2019:4401-4410.

9
KANG M,SHIN J,PARK J. StudioGAN: A taxonomy and benchmark of GANs for image synthesis[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence,2023,45:15725-15742.

10
PAN X,TEWARI A,LEIMKÜHLER T,et al. Drag your GAN:Interactive point-based manipulation on the generative image manifold[C]//ACM SIGGRAPH 2023 Conference Proceedings,2023:1-11.

11
HO J, JAIN A, ABBEEL P. Denoising diffusion probabilistic models[J]. Advances in Neural Information Processing Systems, 2020, 33, 6840- 6851.

12
SOHL-DICKSTEIN J,WEISS E,MAHESWARANATHAN N,et al. Deep unsupervised learning using nonequilibrium thermodynamics[C]//International Conference on Machine Learning. PMLR,2015:2256-2265.

13
CAO H,TAN C,GAO Z,et al. A survey on generative diffusion models[J]. IEEE Transactions on Knowledge and Data Engineering,2024:1-20.

14
KINGMA D P, SALIMANS T, JOZEFOWICZ R, et al. Improved variational inference with inverse autoregressive flow[J]. Advances in Neural Information Processing Systems, 2016, 29, 4743- 4751.

15
WESTERLUND M. The emergence of deepfake technology: A review[J]. Technology innovation Management Review, 2019, 9 (11): 40- 53.

16
THIES J,ZOLLHOFER M,STAMMINGER M,et al. Face2face:real-time face capture and reenactment of RGB videos[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition,2016:2387-2395.

17
NIRKIN Y,KELLER Y,HASSNER T. FsGAN:Subject agnostic face swapping and reenactment[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2019:7184-7193.

18
SIAROHIN A,WOODFORD O J,REN J,et al. Motion representations for articulated animation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2021:13653-13662.

19
ZHANG C,ZHAO Y,HUANG Y,et al. Facial:Synthesizing dynamic talking face with implicit attribute learning[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2021:3867-3876.

20
LI L, BAO J, YANG H, et al. Faceshifter: Towards high fidelity and occlusion aware face swapping[J]. arXiv preprint arXiv:, 1912, 13457, ,2019.

21
CHEN R,CHEN X,NI B,et al. Simswap:An efficient framework for high fidelity face swapping[C]//Proceedings of the 28th ACM International Conference on Multimedia,2020:2003-2011.

22
ZENG H,ZHANG W,FAN C,et al. Flowface:Semantic flow-guided shape-aware face swapping[C]//Proceedings of the AAAI Conference on Artificial Intelligence,2023,37(3):3367-3375.

23
ZHU Y, LIU H, SONG Y, et al. One model to edit them all: free-form text-driven image manipulation with semantic modulations[J]. Advances in Neural Information Processing Systems, 2022, 35, 25146- 25159.

24
KIM H,CHOI Y,KIM J,et al. Exploiting spatial dimensions of latent in GAN for real-time image editing[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2021:852-861.

25
SAUER A,SCHWARZ K,GEIGER A. Stylegan-xl:Scaling stylegan to large diverse datasets[C]//ACM SIGGRAPH 2022 Conference Proceedings,2022:1-10.

26
SAUER A, KARRAS T, LAINE S, et al. Stylegan-t: Unlocking the power of GANs for fast large-scale text-to-image synthesis[J]. arXiv preprint arXiv:, 2301, 09515, ,2023.

27
YU P,XIA Z,FEI J,et al. A survey on deepfake video detection[J]. Iet Biometrics,2021,10(6):607-624.

28
KWOK A O, KOH S G. Deepfake: a social construction of technology perspective[J]. Current Issues in Tourism, 2021, 24 (13): 1798- 1802.

DOI

29
AKHTAR Z. Deepfakes generation and detection:A short survey[J]. Journal of Imaging,2023,9(1):18.

30
HUANG H,WANG Y,CHEN Z,et al. CMUA-watermark:a cross-model universal adversarial watermark for combating deepfakes[EB]. arXiv preprint arXiv:2105. 10872,2021.

31
SUN P,QI H,LI Y,et al. Faketracer:proactively defending against face-swap deepfakes via implanting traces in training[EB]. arXiv preprint arXiv:2307. 14593,2023.

32
AFCHAR D,NOZICK V,YAMAGISHI J,et al. MesoNet:a compact facial video forgery detection network[C]//2018 IEEE International Workshop on Information Forensics and Security (WIFS). IEEE,2018.

33
LI Y,LYU S. Exposing deepfake videos by detecting face warping artifacts [EB]. arXiv preprint arXiv:1811. 00656,2019.

34
RÖSSLER A,COZZOLINO D,VERDOLIVA L,et al. FaceForensics++:learning to detect manipulated facial images[EB]. arXiv preprint arXiv:1901. 08971,2019.

35
KARRAS T,LAINE S,AILA T. A style-based generator architecture for generative adversarial networks[EB]. arXiv preprint arXiv:1812. 04948,2019.

36
RADFORD A,NARASIMHAN K,SALIMANS T,et al. Improving language understanding by generative pretraining[J/OL].

37
RADFORD A,WU J,CHILD R,et al. Language models are unsupervised multitask learners[J]. OpenAI blog,2019,1(8):9.

38
BROWN T, MANN B, RYDER N, et al. Language models are few-shot learners[J]. Advances in Neural Information Processing Systems, 2020, 33, 1877- 1901.

39
KIRILLOV A, MINTUN E, RAVI N, et al. Segment anything[J]. [EB]. arXiv preprint arXiv:, 2304, 02643, 2023.

40
XI T,SUN Y,YU D,et al. UFO:unified feature optimization[C]//European Conference on Computer Vision,2022:472-488.

41
DHARIWAL P, NICHOL A. Diffusion models beat GANs on image synthesis[J]. Advances in Neural Information Processing Systems, 2021, 34, 8780- 8794.

42
ZHANG L,RAO A,AGRAWALA M. Adding conditional control to text-to-image diffusion models[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2023:3836-3847.

43
RADFORD A,KIM J W,HALLACY C,et al. Learning transferable visual models from natural language supervision[C]//International Conference On Machine Learning,2021:8748-8763.

44
LUO H,JI L,ZHONG M,et al. Clip4clip:An empirical study of clip for end to end video clip retrieval and captioning[J]. Neurocomputing,2022,508:293-304.

45
WANG M, XING J, LIU Y. Actionclip: a new paradigm for video action recognition[J]. [EB]. arXiv preprint arXiv:, 2109, 08472, 2021.

46
RAMESH A,PAVLOV M,GOH G,et al. Zero-shot text-to-image generation[C] //International Conference on Machine Learning. 2021:8821-8831.

47
PUSHPA MALA S, JAYADEVAPPA D, EZHILARASAN K. Digital image watermarking techniques: a review[J]. Int J Comput Sci Secur, 2015, 9 (3): 140- 156.

48
VAN SCHYNDEL R G,TIRKEL A Z,OSBORNE C F. A digital watermark[C] //Proceedings of 1st International Conference on Image Processing,1994,2:86-90.

49
ZEKI A M, MANAF A A. A novel digital watermarking technique based on ISB (Intermediate Significant Bit)[J]. World Academy of Science, Engineering and Technology, 2009, 50, 989- 996.

50
TIRKEL A Z,OSBORNE C F,VAN SCHYNDEL R G. Image watermarking-a spread spectrum application[C]//Proceedings of ISSSTA’95 International Symposium on Spread Spectrum Techniques and Applications,1996:785-789.

51
CHOI Y,AIZAWA I. Digital watermarking using inter-block correlation [C]//Proceedings 1999 International Conference on Image Processing (Cat. 99CH36348),1999:216-220.

52
CELIK M U,SHARMA G,SABER E,et al. Hierarchical watermarking for secure image authentication with localization[J]. IEEE Transactions on Image Processing,2002,11(6):585-595.

53
BENDER W, GRUHL D, MORIMOTO N, et al. Techniques for data hiding[J]. IBM Systems Journal, 1996, 35 (3/4): 313- 336.

54
COX I J,KILIAN J,LEIGHTON F T,et al. Secure spread spectrum watermarking for multimedia[J]. IEEE Transactions on Image Processing,1997,6(12):1673-1687.

55
WANG Y L,PEARMAIN A. Blind MPEG-2 video watermarking robust against geometric attacks:A set of approaches in DCT domain[J].IEEE Transactions on Image Processing,2006,15(6):1536-1543.

56
LIU R,TAN T. An SVD-based watermarking scheme for protecting rightful ownership [J].IEEE Transactions on Multimedia,2002,4(1):121-128.

57
HUAN W, LI S, QIAN Z, et al. Exploring stable coefficients on joint sub-bands for robust video watermarking in DT CWT domain[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2021, 32 (4): 1955- 1965.

58
BISWAS S,DAS S R,PETRIU E M. An adaptive compressed MPEG-2 video watermarking scheme[J]. IEEE Transactions on Instrumentation and Measurement,2005,54(5):1853-1861.

59
NOORKAMI M,MERSEREAU R M. A framework for robust watermarking of H. 264-encoded video with controllable detection performance[J]. IEEE Transactions on Information Forensics and Security,2007,2(1):14-23.

60
GAJ S, KANETKAR A, SUR A, et al. Drift-compensated robust watermarking algorithm for H. 265/HEVC video stream[J]. ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM), 2017, 13 (1): 1- 24.

61
MAXEMCHUK N F,LOW S H. Marking text documents[C]//Proceedings 1997 International Conference on Image Processing,ICIP ’97,Santa Barbara,California,USA,IEEE Computer Society,1997:13.

62
BRASSIL J T,LOW S,MAXEMCHUK N F. Copyright protection for the electronic distribution of text documents[C]. Proceedings of the IEEE,1999,87(7):1181-1196.

63
ATALLAH M J,RASKIN V,HEMPELMANN C F,et al. Natural language watermarking and tamper proofing[C]//International Workshop on Information Hiding,2002:196-212.

64
HUA G,HUANG J,SHI Y Q,et al. Twenty years of digital audio watermarking—a comprehensive review[J]. Signal Processing,2016,128:222-242.

65
HU D, ZHAO D, ZHENG S. A new robust approach for reversible database watermarking with distortion control[J]. IEEE Transactions on Knowledge and Data Engineering, 2018, 31 (6): 1024- 1037.

66
ZHU J,KAPLAN R,JOHNSON J,et al. Hidden:Hiding data with deep networks [C]//Proceedings of the European Conference on Computer Vision (ECCV),2018:657-672.

67
AHMADI M,NOROUZI A,KARIMI N,et al. ReDMark:framework for residual diffusion watermarking based on deep networks[J]. Expert Systems with Applications,2020,146:113157.

68
TANCIK M,MILDENHALL B,NG R. Stegastamp:Invisible hyperlinks in physical photographs[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2020:2117-2126.

69
LIU Y,GUO M,ZHANG J,et al. A novel two-stage separable deep learning framework for practical blind watermarking[C]//Proceedings of the 27th ACM International Conference on Multimedia,2019:1509-1517.

70
LUO X,ZHAN R,CHANG H,et al. Distortion agnostic deep watermarking[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2020:13548-13557.

71
JIA Z,FANG H,ZHANG W. Mbrs:Enhancing robustness of DNN-based watermarking by mini-batch of real and simulated jpeg compression[C]//Proceedings of the 29th ACM International Conference on Multimedia,2021:41-49.

72
LIU G,SI Y,QIAN Z,et al. WRAP:watermarking approach robust against film-coating upon printed photographs[C]//Proceedings of the 31st ACM International Conference on Multimedia,2023:7274-7282.

73
FANG H,CHEN K,QIU Y,et al. DeNoL:A few-shot-sample-based decoupling noise layer for cross-channel watermarking robustness[C]//Proceedings of the 31st ACM International Conference on Multimedia,2023:7345-7353.

74
KENTON J D M W C,TOUTANOVA L K. Bert:Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of naacL-HLT, 2019:2.

75
YANG X,ZHANG J,CHEN K,et al. Tracing text provenance via context-aware lexical substitution[C]//Proceedings of the AAAI Conference on Artificial Intelligence,2022:11613-11621.

76
QIANG J,ZHU S,LI Y,et al. Natural language watermarking via paraphraser-based lexical substitution[J]. Artificial Intelligence,2023,317:103859.

77
ABDELNABI S,FRITZ M. Adversarial watermarking transformer:Towards tracing text provenance with data hiding[C]//2021 IEEE Symposium on Security and Privacy (SP),2021:121-140.

78
UCHIDA Y,NAGAI Y,SAKAZAWA S,et al. Embedding watermarks into deep neural networks[C]//Proceedings of the 2017 ACM on International Conference on Multimedia Retrieval,2017:269-277.

79
DARVISH R B,CHEN H,KOUSHANFAR F. Deepsigns:An end-toend watermarking framework for ownership protection of deep neural networks[C] //Proceedings of the Twenty-Fourth International Conference on Architectural Support for Programming Languages and Operating Systems,2019:485-497.

80
WANG T,KERSCHBAUM F. RIGA:Covert and robust white-box watermarking of deep neural networks[C]//Proceedings of the Web Conference,2021:9931004.

81
ZENG Y,TAN J,YOU Z,et al. Watermarks for generative adversarial network based on steganographic invisible backdoor[C]//2023 IEEE International Conference on Multimedia and Expo (ICME),2023:1211-1216.

82
JIA H,CHOQUETTE-CHOO C A,CHANDRASEKARAN V,et al. Entangled watermarks as a defense against model extraction[C]//30th USENIX Security Symposium (USENIX Security 21),2021:1937-1954.

83
OLIYNYK D,MAYER R,RAUBER A. I know what you trained last summer:A survey on stealing machine learning models and defenses[J]. ACM Computing Surveys,2023,55:1-41.

84
LI Y,JIANG Y,LI Z,et al. Backdoor learning:A survey[J]. IEEE Transactions on Neural Networks and Learning Systems,2022,1:5-22.

85
ZHANG J,GU Z,JANG J,et al. Protecting intellectual property of deep neural networks with watermarking[C]//Proceedings of the 2018 on Asia Conference on Computer and Communications Security,2018:159-172.

86
ADI Y,BAUM C,CISSE M,et al. Turning your weakness into a strength:Watermarking deep neural networks by backdooring[C]//27th USENIX Security Symposium (USENIX Security 18),2018:1615-1631.

87
QUAN Y, TENG H, CHEN Y, et al. Watermarking deep neural networks in image processing[J]. IEEE Transactions on Neural Networks and Learning Systems, 2020, 32 (5): 1852- 1865.

88
LI H, WENGER E, SHAN S, et al. Piracy resistant watermarks for deep neural networks[J]. arXiv preprint arXiv:, 1910, 01226, 2019.

89
GUO J,POTKONJAK M. Watermarking deep neural networks for embedded systems[C]//2018 IEEE/ACM International Conference on Computer-Aided Design (ICCAD). IEEE,2018:1-8.

90
ZHU R,ZHANG X,SHI M,et al. Secure neural network watermarking protocol against forging attack[J]. EURASIP Journal on Image and Video Processing,2020:1-12.

91
LE MERRER E,PEREZ P,TRÉDAN G. Adversarial frontier stitching for remote neural network watermarking[J]. Neural Computing and Applications,2020,32:9233-9244.

92
LI Z,HU C,ZHANG Y,et al. How to prove your model belongs to you:A blind-watermark based framework to protect intellectual property of DNN[C]//Proceedings of the 35th Annual Computer Security Applications Conference,2019:126-137.

93
NAMBA R,SAKUMA J. Robust watermarking of neural network with exponential weighting[C]//Proceedings of the 2019 ACM Asia Conference on Computer and Communications Security,2019:228-240.

94
ZHONG Q,ZHANG L Y,ZHANG J,et al. Protecting IP of deep neural networks with watermarking:A new label helps[C]//Advances in Knowledge Discovery and Data Mining:24th Pacific-Asia Conference,PAKDD 2020,Singapore. Springer International Publishing,2020:462-474.

95
ZHANG Y Q,JIA Y R,WANG X,et al. DeepTrigger:a watermarking scheme of deep learning models based on chaotic automatic data annotation[J]. IEEE Access,2020,8:213296-213305.

96
CHEN H, ROUHANI B D, KOUSHANFAR F. Blackmarks: Blackbox multibit watermarking for deep neural networks[J]. [EB]. arXiv preprint arXiv:, 1904, 00344, 2019.

97
XU X R, LI Y Q, YUAN C. A novel method for identifying the deep neural network model with the serial number[J]. arXiv preprint arXiv:, 1911, 08053, 2019.

98
LI P,CHENG P,LI F,et al. Plmmark:a secure and robust black-box watermarking framework for pre-trained language models[C]//Proceedings of the AAAI Conference on Artificial Intelligence,2023:14991-14999.

99
PENG W, YI J, WU F, et al. Are you copying my model? protecting the copyright of large language models for eaas via backdoor watermark[J]. arXiv preprint arXiv:, 2305, 10036, 2023.

100
ZHAO Y, PANG T, DU C, et al. A recipe for watermarking diffusion models[J]. arXiv preprint arXiv:, 2303, 10137, 2023.

101
PENG S, CHEN Y, WANG C, et al. Protecting the intellectual property of diffusion models by the watermark diffusion process[J]. arXiv preprint arXiv:, 2306, 03436, 2023.

102
DEVLIN J, CHANG M W, LEE K, et al. Bert: Pre-training of deep bidirectional transformers for language understanding[J]. arXiv preprint arXiv:, 1810, 04805, 2018.

103
LIU Y, OTT M, GOYAL N, et al. Roberta: A robustly optimized bert pretraining approach[J]. arXiv preprint arXiv:, 1907, 11692, 2019.

104
YANG X,CHEN K,ZHANG W,et al. Watermarking text generated by blackbox language models[EB]. arXiv preprint arXiv:2305. 08883,2023.

105
YOO K,AHN W,JANG J,et al. Robust multi-bit natural language watermarking through invariant features[EB]. arXiv preprint arXiv:2305. 01904,2023.

106
AL-HAJ A. Combined DWT-DCT digital image watermarking[J]. Journal of Computer Science,2007,3(9):740-746.

107
HE Y,HU Y. A proposed digital image watermarking based on DWT-DCT-SVD [C]//2018 2nd IEEE Advanced Information Management,Communicates,Electronic and Automation Control Conference (IMCEC),2018:1214-1218.

108
ZHANG K A, XU L, CUESTA-INFANTE A, et al. Robust invisible video watermarking with attention[J]. [EB]. arXiv preprint arXiv:, 1909, 01285, 2019.

109
JIANG Z, ZHANG J, GONG N Z. Evading watermark based detection of AI-generated content[J]. arXiv preprint arXiv:, 2305, 03807, 2023.

110
TOUVRON H, LAVRIL T, IZACARD G, et al. Llama: Open and efficient foundation language models[J]. arXiv preprint arXiv:, 2302, 13971, 2023.

111
KIRCHENBAUER J, GEIPING J, WEN Y, et al. A watermark for large language models[J]. [EB]. arXiv preprint arXiv:, 2301, 10226, 2023.

112
KIRCHENBAUER J, GEIPING J, WEN Y, et al. On the reliability of watermarks for large language models[J]. arXiv preprint arXiv:, 2306, 04634, 2023.

113
CHRIST M, GUNN S, ZAMIR O. Undetectable watermarks for language models[J]. arXiv preprint arXiv:, 2306, 09194, 2023.

114
KUDITIPUDI R, THICKSTUN J, HASHIMOTO T, et al. Robust distortion-free watermarks for language models[J]. arXiv preprint arXiv:, 2307, 15593, 2023.

115
FU Y, XIONG D, DONG Y. Watermarking conditional text generation for ai detection: Unveiling challenges and a semantic-aware watermark remedy[J]. arXiv preprint arXiv:, 2307, 13808, 2023.

116
ZHANG R, HUSSAIN S S, NEEKHARA P, et al. REMARK-LLM: A robust and efficient watermarking framework for generative large language models[J]. arXiv preprint arXiv:, 2310, 12362, 2023.

117
LIU A, PAN L, HU X, et al. A semantic invariant robust watermark for large language models[J]. arXiv preprint arXiv:, 2310, 06356, 2023.

118
HOU A B, ZHANG J, HE T, et al. Semstamp: A semantic watermark with paraphrastic robustness for text generation[J]. arXiv preprint arXiv:, 2310, 03991, 2023.

119
WU Y, HU Z, ZHANG H, et al. DiPmARK: A stealthy, efficient and resilient watermark for large language models[J]. [EB]. arXiv preprint arXiv:, 2310, 07710, 2023.

120
MUNYER T, ZHONG X. Deeptextmark: Deep learning based text watermarking for detection of large language model generated text[J]. arXiv preprint arXiv:, 2305, 05773, 2023.

121
YOO K, AHN W, KWAK N. Advancing beyond identification: multi-bit watermark for language models[J]. arXiv preprint arXiv:, 2308, 00221, 2023.

122
FERNANDEZ P, CHAFFIN A, TIT K, et al. Three bricks to consolidate watermarks for large language models[J]. arXiv preprint arXiv:, 2308, 00113, 2023.

123
WANG L, YANG W, CHEN D, et al. Towards codable text watermarking for large language models[J]. arXiv preprint arXiv:, 2307, 15992, 2023.

124
ROMBACH R,BLATTMANN A,LORENZ D,et al. High-resolution image synthesis with latent diffusion models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2022:10684-10695.

125
BETKER J,GOH G,JING L,et al. Improving image generation with better captions[EB]. Computer Science,2023.

126
YU L, SHI B, PASUNURU R, et al. Scaling autoregressive multi-modal models: Pretraining and instruction tuning[J]. arXiv preprint arXiv:, 2309, 02591, 2023.

127
FERNANDEZ P, COUAIRON G, JÉGOU H, et al. The stable signature: Rooting watermarks in latent diffusion models[J]. arXiv preprint arXiv:, 2303, 15435, 2023.

128
FENG W, HE J, ZHANG J, et al. Catch you everything everywhere: Guarding textual inversion via concept watermarking[J]. arXiv preprint arXiv:, 2309, 05940, 2023.

129
LIU Y, LI Z, BACKES M, et al. Watermarking diffusion model[J]. arXiv preprint arXiv:, 2305, 12502, 2023.

130
CUI Y, REN J, XU H, et al. Diffusionshield: A watermark for copyright protection against generative diffusion models[J]. arXiv preprint arXiv:, 2306, 04642, 2023.

131
WEN Y, KIRCHENBAUER J, GEIPING J, et al. Tree-ring watermarks: fingerprints for diffusion images that are invisible and robust[J]. [EB]. arXiv preprint arXiv:, 2305, 20030, 2023.

132
LI G, CHEN Y, ZHANG J, et al. Towards the vulnerability of watermarking artificial intelligence generated content[J]. arXiv preprint arXiv:, 2310, 07726, 2023.

133
BUI T,AGARWAL S,YU N,et al. RoSteALS:robust steganography using autoencoder latent space[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2023:933-942.

134
XIONG C,QIN C,FENG G,et al. Flexible and secure watermarking for latent diffusion model[C]//Proceedings of the 31st ACM International Conference on Multimedia,2023:1668-1676.

135
WEI P,LI S,ZHANG X,et al. Generative steganography network[C]// Proceedings of the 30th ACM International Conference on Multimedia,2022:1621-1629.

136
ZENG Y,TAN J,YOU Z,et al. Watermarks for generative adversarial network based on steganographic invisible backdoor[C]//2023 IEEE International Conference on Multimedia and Expo (ICME). IEEE,2023.

137
CHEN K,ZENG X,YING Q,et al. Invertible image dataset protection[C]//2022 IEEE International Conference on Multimedia and Expo (ICME),2022:01-06.

138
SALMAN H, KHADDAJ A, LECLERC G, et al. Raising the cost of malicious ai-powered image editing[J]. arXiv preprint arXiv:, 2302, 06588, 2023.

139
SHAN S, CRYAN J, WENGER E, et al. Glaze: Protecting artists from style mimicry by text-to-image models[J]. arXiv preprint arXiv:, 2302, 04222, 2023.

140
LI Y,ZHU M,YANG X,et al. Black-box dataset ownership verification via backdoor watermarking[J]. IEEE Transactions on Information Forensics and Security,2023,18:2318-2332.

141
LI Y, BAI Y, JIANG Y, et al. Untargeted backdoor watermark: Towards harmless and stealthy dataset copyright protection[J]. Advances in Neural Information Processing Systems 35, 2022, 13238- 13250.

142
TANG R, FENG Q, LIU N, et al. Did you train on my dataset? towards public dataset protection with clean-label backdoor watermarking[J]. arXiv preprint arXiv:, 2303, 11470, 2023.

143
DITRIA L, DRUMMOND T. Hey that’s mine imperceptible watermarks are preserved in diffusion generated outputs[J]. arXiv preprint arXiv:, 2308, 11123, 2023.

144
LUO G, HUANG J, ZHANG M, et al. Steal my artworks for fine-tuning? a watermarking framework for detecting art theft mimicry in text-to-image models[J]. arXiv preprint arXiv:, 2311, 13619, 2023.

145
YAO H, LOU J, REN K, et al. Promptcare: Prompt copyright protection by watermark injection and verification[J]. arXiv preprint arXiv:, 2308, 02816, 2023.

146
ZHANG X,KARAMAN S,CHANG S F. Detecting and simulating artifacts in GAN fake images[C]//2019 IEEE International Workshop on Information Forensics and Security (WIFS),2019:1-6.

147
WANG S Y,WANG O,ZHANG R,et al. CNN-generated images are surprisingly easy to spot… for now[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2020:8695-8704.

148
LIU B,YANG F,BI X,et al. Detecting generated images by real images[C]// European Conference on Computer Vision,2022:95-110.

149
JU Y,JIA S,KE L,et al. Fusing global and local features for generalized aisynthesized image detection[C]//2022 IEEE International Conference on Image Processing (ICIP),2022:3465-3469.

150
TAN C,ZHAO Y,WEI S,et al. Learning on gradients:generalized artifacts representation for GAN-generated images detection[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2023:12105-12114.

151
OJHA U,LI Y,LEE Y J. Towards universal fake image detectors that generalize across generative models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2023:24480-24489.

152
WANG Z,BAO J,ZHOU W,et al. DIRE for diffusion-generated image detection [C]//Proceedings of the IEEE/CVF international Conference on Computer Vision,2023:22445-22455.

153
ROSSLER A,COZZOLINO D,VERDOLIVA L,et al. Faceforensics++:Learning to detect manipulated facial images[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2019:1-11.

154
LIU Z,QI X,TORR P H. Global texture enhancement for fake face detection in the wild[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2020:8060-8069.

155
FRANK J,EISENHOFER T,SCHÖNHERR L,et al. Leveraging frequency analysis for deep fake image recognition[C]//International Conference on Machine Learning,2020:3247-3258.

156
ZHU M, CHEN H, YAN Q, et al. GenImage: A million-scale benchmark for detecting AI-generated image[J]. arXiv preprint arXiv:, 2306, 08571, 2023.

157
ZHONG N, XU Y, QIAN Z, et al. Rich and poor texture contrast: a simple yet effective approach for AI-generated image detection[J]. arXiv preprint arXiv:, 2311, 12397, 2023.

158
WU J, YANG S, ZHAN R, et al. A survey on LLM-gernerated text detection: necessity, methods, and future directions[J]. arXiv preprint arXiv:, 2310, 14724, 2023.

159
YU N,DAVIS L S,FRITZ M. Attributing fake images to GANs:learning and analyzing GAN fingerprints[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2019:7556-7566.

160
GIRISH S,SURI S,RAMBHATLA S S,et al. Towards discovery and attribution of open-worldGAN generated images[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2021:14094-14103.

161
BUI T,YU N,COLLOMOSSE J. Repmix:representation mixing for robust attribution of synthesized images[C]//European Conference on Computer Vision,2022:146-163.

162
HIROFUMI S,FUKUCHI K,AKIMOTO Y,et al. Did you use my GAN to generate fake? post-hoc attribution of GAN generated images via latent recovery [C]//2022 International Joint Conference on Neural Networks (IJCNN),2022:1-8.

163
YANG T,WANG D,TANG F,et al. Progressive open space expansion for open-set model attribution[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2023:15856-15865.

164
SHA Z,LI Z,YU N,et al. De-fake:detection and attribution of fake images generated by text-to-image generation models[C]//Proceedings of the 2023 ACM SIGSAC Conference on Computer and Communications Security,2023:3418-3432.

165
FERNANDES S,RAJ S,EWETZ R,et al. Detecting deepfake videos using attribution-based confidence metric[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops,2020:308-309.

166
YANG T,HUANG Z,CAO J,et al. Deepfake network architecture attribution[C] //Proceedings of the AAAI Conference on Artificial Intelligence,2022:4662-4670.

167
JIA S,LI X,LYU S. Model attribution of face-swap deepfake videos[C]//2022 IEEE International Conference on Image Processing (ICIP),2022:2356-2360.

168
SUN Z,CHEN S,YAO T,et al. Contrastive pseudo learning for open-world deepfake attribution[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision,2023:20882-20892.

169
JAWAHAR G,ABDUL-MAGEED M,LAKS LAKSHMANAN V. Automatic detection of machine generated text:a critical survey[C]//Proceedings of the 28th International Conference on Computational Linguistics,2020:2296-2309.

170
UCHENDU A,LE T,LEE D. Attribution and obfuscation of neural text authorship:A data mining perspective[J]. ACM SIGKDD Explorations Newsletter,2023,25(1):1-18.

171
UCHENDU A,LE T,SHU K,et al. Authorship attribution for neural text generation[C]//Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP),2020:8384-8395.

172
JONES K,NURSE J R,LI S. Are you robert or roberta? deceiving online authorship attribution models using neural text generators[C]//Proceedings of the International AAAI Conference on Web and Social Media,2022:429-440.

173
MUNIR S,BATOOL B,SHAFIQ Z,et al. Through the looking glass:Learning to attribute synthetic text generated by language models[C]//Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics:Main Volume,2021:1811-1822.

174
ABBURI H,SUESSERMAN M,PUDOTA N,et al. An ensemble-based approach for generative language model attribution[C]//International Conference on Web Information Systems Engineering,2023:699-709.

175
LI L, WANG P, REN K, et al. Origin tracing and detecting of LLMs[J]. [EB]. arXiv preprint arXiv:, 2304, 14072, 2023.

176
KUMARAGE T, LIU H. Neural authorship attribution: Stylometric analysis on large language models[J]. arXiv preprint arXiv:, 2308, 07305, 2023.

177
VENKATRAMAN S, UCHENDU A, LEE D. Gpt-who: an information densitybased machine-generated text detector[J]. arXiv preprint arXiv:, 2310, 06202, 2023.

178
WU K, PANG L, SHEN H, et al. LLMDet: a large language models detection tool[J]. arXiv preprint arXiv:, 2305, 15004, 2023.

179
YANG X, CHENG W, PETZOLD L, et al. DNA-GPT: divergent n-gram analysis for training-free detection of GPT-generated text[J]. arXiv preprint arXiv:, 2305, 17359, 2023.

文章导航

/