基于大语言模型辅助的智能文本隐写传输方法

  • 戴俊浩 ,
  • 吴怡 ,
  • 卢晓珍 , * ,
  • 任德翔
展开
  • 南京航空航天大学计算机科学与技术学院,南京市 211106
卢晓珍()。

网络出版日期: 2026-05-25

基金资助

国家自然科学基金(U22B2062,62571240);东南大学移动通信全国重点实验室开放研究基金资助课题(2026D06);江苏省前沿引领技术基础研究重大项目(BK20222001)

版权

版权所有©《网络空间安全科学学报》编辑部 2026

Large Language Model-Assisted Intelligent Text Steganography Transmission Method

  • Dai Junhao ,
  • Wu Yi ,
  • Lu Xiaozhen , * ,
  • Ren Dexiang
Expand
  • Department of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics, Nanjing 211106, China

Online published: 2026-05-25

Copyright

Copyright ©2026 Journal of Aeronautical Materials. All rights reserved.

摘要

生成式文本隐写主要利用语言模型来生成隐写文本,然而,以往的方法通常在单一语料库上训练并生成随机长度的隐写文本,导致隐写文本的风格和长度无法适应变化的消息类型和信道条件。为此,提出了一种基于大语言模型辅助的智能文本隐写传输方法,可以有效降低隐写文本的传输开销。首先,利用多种语料库对大语言模型进行参数微调,得到适配不同语料风格的适配器。在隐写阶段,根据微调后的大语言模型给出的词元概率分布,通过自适应动态分组选择词元,递归地嵌入秘密信息。其次,设计了双智能体强化学习框架,基于实时信道状态和攻击成功率等安全指标,实现了自适应优化隐写策略,包括语料库的类型和输出的句子长度,并实现了发射功率的选择。该方法综合考虑了隐写安全需求和实际传输环境,构建奖励函数评估所选策略的优劣,用于指导隐写策略和发射功率的选取,实现隐蔽性与传输鲁棒性的平衡。结果表明,相较于直接使用自适应动态分组算法进行传输,所提方法在保持相近嵌入率与信息散度的前提下,时延降低了38.5%,攻击成功率降低至0.83%。

本文引用格式

戴俊浩 , 吴怡 , 卢晓珍 , 任德翔 . 基于大语言模型辅助的智能文本隐写传输方法[J]. 网络空间安全科学学报, 2026 : 1 -10 . DOI: 10.20172/j.issn.2097-3136.260523

Abstract

Generative text steganography primarily utilizes language models to generate steganographic text, however, previous methods typically trained on a single corpus, generated steganographic texts of random lengths, failing to adapt to varying message types and channel conditions. To address this, we proposed a large language model-assisted intelligent text steganographic transmission method to reduce transmission overhead. We parameter-efficiently fine-tuned a large language model on multiple corpora to obtain adapters for different corpus styles, and using the model's token probability distribution, recursively embedded secret information via adaptive dynamic grouping. We then designed a dual-agent reinforcement learning framework that adaptively optimizes the steganographic strategy—including corpus type and sentence length—and selects transmission power based on real-time channel state and security indicators such as attack success rate. This method considered both steganographic security and the transmission environment, constructed a reward function to evaluate each strategy, and guided strategy and power selection to balance concealment and robustness. The results showed that, compared to direct use of adaptive dynamic grouping, our method reduced delay by 38.5% and attack success rate to 0.83%, while maintaining similar embedding rates and information divergence. Consequently, the proposed method achieves a good balance between stealthiness and transmission robustness under varying channel conditions and message types.

0 引言

随着信息技术的快速发展,数字通信成为人们日常生活中最主要的信息交流方式。文本隐写作为信息隐藏技术的一个重要分支,通过将秘密信息隐藏到自然语言文本中来实现隐蔽通信[1-3],广泛应用于军事通信、隐私保护和数字版权等领域。然而,传统文本隐写方法依赖固定规则或统计模型,攻击者可以通过统计检测识别出文本中的隐写行为[2]
近年来,基于深度学习的文本隐写算法逐渐成为研究热点,研究人员利用循环神经网络、长短期记忆网络、生成对抗网络等神经网络训练生成模型,将秘密信息嵌入到自动生成的文本中。例如,Dai等[4]提出了一种基于马尔可夫链源模型和DES算法结合的文本隐写系统,利用马尔可夫链的条件概率特性提升了系统的抗常规操作能力。Zhou等[5]提出了一种基于生成对抗网络的文本隐写模型,解决了基于循环神经网络的生成式文本隐写[6]存在的暴露偏差和嵌入偏差问题,提升了隐写文本的安全性和抗隐写分析能力。Fang等[7]提出了一种基于LSTM的文本隐写方法,利用词汇分箱方法,增加了每个单词的加密比特数量。尽管上述方法在一定程度上提高了文本隐写的性能,但仍然存在以下问题:生成的文本语义连贯性不足,易被检测;针对单一语料库或固定文本长度进行隐写,无法适应多样化的消息类型(如导航、控制和查询)。
大语言模型(Large Language Model,LLM)在生成流程、主题对应的文本方面展现出了卓越的能力,为文本隐写提供了新的技术路径。研究人员利用LLM通过动态编码技术来提高文本的质量。例如,Wu等[9]将大语言模型和黑盒文本隐写方法结合,利用关键词集构建的方法实现了秘密信息的嵌入。然而,现有的基于LLM的隐写方法主要关注嵌入问题,导致隐写文本的风格和长度无法适应变化的消息类型和信道条件。在实际传输环境中,信道条件、攻击者的攻击强度均随时间变化,固定的风格和输出长度会导致隐蔽性下降。
为了解决上述挑战,本文提出一种基于大语言模型辅助的智能文本隐写传输方法。该方法基于大语言模型辅助,利用多种语料库对大语言模型进行LoRA参数微调。在隐写阶段,根据微调后的大语言模型输出的词元概率分布,进行自适应动态分组,选择词元并嵌入秘密信息。此外,为了解决引入传输时延、丢包率和信道增益后状态维度复杂,经典优化算法难以达到最优的隐蔽性能和传输性能的难题,设计了一个双智能体强化学习优化方法,根据消息类型、消息长度、隐写时延、传输时延、丢包率和信道增益选择隐写策略,并结合隐写性能指标选择发射功率,实现隐蔽性与传输鲁棒性的平衡。
本文通过实验证明了该方法不仅保证了文本隐写的嵌入率和KL散度,而且实现了传输时延和能耗的降低,更进一步降低了隐写分析检测的成功率与攻击成功率。此外,本文进行了消融实验,证明了所提方法的双智能体强化学习架构的有效性。
本文的主要创新点如下:
(1)提出了一种基于大语言模型辅助的智能文本隐写传输框架,将传输时延、丢包率、信道状态与隐写指标联合优化,通过强化学习实现隐写策略与发射功率的最优选择,有效提升了动态信道环境下隐写传输的整体性能。
(2)构建了基于大语言模型辅助的文本隐写方法,利用LoRA技术实现多个领域语料库的参数微调,实现不同风格的文本生成。通过自适应动态分组嵌入秘密信息,实现文本高嵌入容量的同时降低隐写文本的统计可检测性。
(3)设计了一种基于双智能体强化学习的优化架构,根据消息类型、消息长度、传输时延、隐写时延、信道增益和丢包率,动态选择文本隐写的隐写策略以及发射功率,并构建综合奖励函数以平衡隐蔽性与传输开销,克服了传统方法在多目标冲突下难以自适应决策的问题。
本文的组织架构如下:第1节梳理生成式文本隐写和基于强化学习的文本传输的相关工作;第2节介绍隐写模型、通信模型和攻击模型;第3节详细介绍了所提出的基于大语言模型辅助的文本隐写传输方法;第4节对实验结果进行了分析;第5节进行总结并对未来工作进行了讨论。

1 相关工作

1.1 生成式文本隐写

生成式文本隐写主要从提升文本质量、增强语义可控性和优化隐蔽性等方面展开。早期方法依赖自定义字典与上下文无关法实现文本生成与样式控制[10],但生成的文本语义连贯性不足。
近年来,基于神经语言模型与大语言模型的隐写方法陆续被提出[12-23],这类方法凭借模型的序列建模能力和上下文感知能力,能够生成语义连贯和风格自然的文本。例如,清华大学研究团队[12]提出一种基于循环神经网络的文本隐写方法,利用LSTM学习自然语言统计模型,在文本生成过程中利用定长编码嵌入秘密信息,提升了隐写文本的自然度。湖南大学研究团队[19]提出了一种基于情感表达的生成式文本隐写方法,采用无监督情感抽取和改进的二部图排序算法,从原始商品评论中筛选高质量的情感表达组会并映射到语义空间,有效提升了隐写文本的认知隐蔽性。哈佛大学研究团队[20]提出了一种结合算术编码与大规模神经语言模型的隐写方法,采用基于条件概率编码的双向可逆映射技术,进一步提升了隐写容量和文本自然度。上海大学研究团队[22]提出了一种面向大语言模型的黑盒隐写方法,利用后门技术把秘密信息嵌入到模型中,在嵌入容量、鲁棒性和安全性方面均有提升。

1.2 基于强化学习的文本传输

强化学习技术在文本传输领域的研究主要从动态信道适配、语义感知传输与跨层可靠传输展开[24-33]。强化学习凭借其处理高维决策与在线自适应等优势,成为解决复杂优化问题的有效手段。
北京邮电大学研究团队[29]针对文本数据的语义通信优化问题,提出了一种基于策略梯度的强化学习方法,并结合注意力机制评估知识三元组和原始文本之间的相关性,提升了语义相似度指标。陆军工程大学研究团队[30]面向无线通信中的跨层可靠传输问题,提出一种任务场景驱动的无线通信跨层智能适变方法,采用混合近端策略优化与深度Q网络结合的分层决策框架,对物理层的信道选择、发射功率与调制方式进行联合优化,提升了在动态干扰环境下的吞吐量与数据包传输成功率。香港中文大学研究团队[31]针对动态信道条件下的语义特征传输问题,提出一种基于软演员-评论家的深度强化学习框架,通过设计连续动作空间,结合包含语义损失与延迟违规惩罚的奖励函数,在满足平均传输时延的前提下实现了最小化语义损失。

2 系统模型

在本节中,介绍了一个点对点的无线隐蔽通信系统模型,包括隐写模型、通信模型和攻击模型,整体流程交互流程如图1所示。
图 1 系统模型示意图

Fig.1 Illustration of the system model

2.1 隐写模型

由于发送方本地计算资源有限,无法部署完整的大语言模型,因此通过无线网络与云端大语言模型交互反馈概率分布。在云端部署大语言模型后,针对$ M $个不同领域的语料库分别进行LoRA微调。微调完成后,仅保存各语料库对应的LoRA适配器权重,其他模型参数保持不变。
在时隙$ k $,发送方首先获取待传输的消息字符串(由用户通过输入框或预定义的指令集生成)和消息类型$ {\iota }^{\left(k\right)} $(例如控制指令、数据传输指令),将字符串按照UTF-8的编码方式转换为字节序列,再将每个字节转为8位二进制,拼接成长度为$ {L}^{(k)} $的二进制秘密信息$ {m}^{\left(k\right)} $
发送方根据当前状态决策本次的隐写策略$ {b}^{(k)}=({\hat{b}}^{(k)},{\tilde{b}}^{(k)}) $,包括语料库类型$ {\hat{b}}^{(k)} $和输出的句子长度$ {\tilde{b}}^{(k)} $,其中$ {\hat{b}}^{(k)}\in M $$ {\tilde{b}}^{(k)} $以词元数计。
将所选语料库$ {\hat{b}}^{(k)} $和当前已生成的词元(token)序列$ c $上传至云端,记录开始时间$ \hat{t}_{1}^{(k)} $。大语言模型加载$ {\hat{b}}^{(k)} $对应的LoRA适配器,计算词汇表$ V $上每个单词$ \omega $的条件概率分布$ {p}_{\omega }=p\left(\omega |c\right) $,并将该分布反馈给发送方。发送方接收到概率分布后,采用自适应动态分组方法生成将词汇表划分为$ U $个概率近似相等的分组,并从秘密信息中取出长度$ \left\lfloor {\log }_{2}U\right\rfloor $的比特块,将其映射到相应的分组,然后从该分组中选择概率最大的token输出。该token被追加到上下文$ c $后,发送方再次与云端交互请求下一个token的概率分布。重复上述过程,直到生成的token数量达到输出的句子长度后$ {\tilde{b}}^{(k)} $,得到隐写文本$ T $。记录结束时间为$ \hat{t}_{2}^{(k)} $,本次隐写过程的时延$ {\tilde{t}}^{\left(k\right)} $计算为$ {\tilde{t}}^{\left(k\right)}=\hat{t}_{2}^{(k)}-\hat{t}_{1}^{(k)} $

2.2 通信模型

发送方将隐写文本$ T $封装为数据包,添加源地址、目的地址、校验和等头部信息,得到数据包$ \mathbf{p} $。采用QPSK调制和卷积码对$ \mathbf{p} $进行信道编码与调制,得到基带信号$ x(k) $
发送方以发射功率$ {P}^{(k)} $通过无线信道传输该基带信道,信道参数根据实际采集的信道数据统计。
接收方收到信号后,依次进行解调、信道解码解码,恢复出数据包$ \hat{\mathbf{p}} $。发送方在一段时间内发送$ N_{\text{tx}}^{} $个数据包,接收方实际收到的数据包数量为$ N_{\text{rx}}^{} $。则本次通信的丢包率$ {l}^{\left(k\right)} $定义为:
$ {l}^{\left(k\right)}=1-\frac{{N}_{\text{rx}}}{{N}_{\text{tx}}} $
接收方从$ \hat{\mathbf{p}} $中提取载荷,恢复出隐写文本$ \hat{T} $。根据隐写生成生成阶段使用的分组规则和发送方选择的语料库类型$ {\hat{b}}^{(k)} $,从$ \hat{T} $中逆向提取出嵌入的秘密信息比特串$ {\hat{m}}^{\left(k\right)} $

2.3 攻击模型

攻击者能够截获并篡改隐写文本,利用内置的隐写分析模型检测文本中是否包含秘密信息,实施字符级或词级的篡改攻击,破坏秘密信息的完整性,降低隐写通信的可靠性。
具体地,在时隙$ k $,攻击者维护一个长度为$ L $的历史攻击结果队列和检测结果历史队列。根据内置的隐写分析器对窃听到的文本进行判断,输出判定结果$ {\hat{z}}^{(k)}\in \{0,1\} $,1表示判定为隐写文本。此时攻击者对隐写文本的检测成功率$ {d}^{(k)} $定义为:
$ {d}^{(k)}=\frac{1}{L}\sum \limits_{j=0}^{L-1}{\hat{z}}^{(k-j)}\times 100\% $
当攻击者检测到隐写文本后,从攻击方法$ {\eta }^{(k)} $中随机选择一种执行:
(1)字符替换攻击。攻击者随机选取文本中的一个单词,随机替换该单词中的一个字符。
(2)词级删除攻击。攻击者随机删除文本中的n个单词,直接删除单词和可能携带的隐写信息。
(3)词序交换攻击。攻击者随机选择文本中两个不同位置的单词,交换它们的先后顺序。
为了衡量攻击对隐写信息统计密度的破坏,引入嵌入率变化量$ \Delta {\rho }^{(k)}=|{\rho }^{(k)}-{\rho }^{(k-1)}| $,反映攻击者对接收方解码误差的影响。
攻击者采用自适应随机策略来确定攻击方式,根据隐写分析模型输出的当前文本的隐写状态$ {\hat{z}}^{(k)} $、嵌入率变化量$ \Delta {\rho }^{(k)} $以及攻击方法$ {\eta }^{(k)} $,最大化攻击成功率。攻击结果的判定条件如下:
$ {\tilde{z}}^{(k)}=1\left[\Delta {\rho }^{(k)}\geq \delta \vee \left({\eta }^{(k)}\neq \text{replace}\wedge {\hat{z}}^{(k)}=1\right)\right] $
其中$ \delta $为嵌入率变化阈值,$ 1\left[\cdot \right] $为指示函数,并据此计算平均攻击成功率$ {a}^{(k)} $
$ {a}^{(k)}=\frac{1}{L}\sum \limits_{j=0}^{L-1}{\tilde{z}}^{(k-j)}\times 100\% $

2.4 问题构建

不同的消息类型对隐写传输过程存在差异化的效率需求。具体而言,不同消息类型将直接影响传输过程中时延和能耗。对于发送方而言,总时延满足$ \hat{t}_{}^{(k)}+\tilde{t}_{}^{(k)}\leq t_{\max }^{} $,能耗满足$ e_{}^{(k)}\leq e_{\max }^{}​ $ ,其中$ t_{\max }^{} $$ e_{\max }^{} $分别代表消息需求决定的时延和能耗阈值。此外,为保证隐蔽性和安全性,KL散度指示满足$ {\phi }^{(k)}\leq \phi _{\max }^{} $。嵌入率指示满足$ {\kappa }^{(k)}\leq \kappa _{\max }^{} $。因此,发送方基于KL散度指示$ {\phi }^{(k)} $ 、嵌入指示$ {\kappa }^{(k)} $、检测成功率$ {d}^{(k)} $、攻击成功率$ {a}^{(k)} $、传输时延$ {\hat{t}}^{(k)} $、隐写时延$ {\tilde{t}}^{(k)} $和能耗$ {e}^{(k)} $构建其优化目标:
$ \begin{aligned}& \mathbb{E}_{u^{(k)} \in \mathcal{U}, p^{(k)} \in \mathcal{P}} \mathbb{E}\left[\phi^{(k)}+\kappa^{(k)}-d^{(k)}-a^{(k)}-\hat{t}^{(k)}-\tilde{t}^{(k)}-e^{(k)}\right] \\& \text { s.t. } \hat{t}^{(k)}+\tilde{t}^{(k)} \leqslant t_{\max }, e^{(k)} \leqslant e_{\max }, \phi^{(k)} \leqslant \phi_{\max }, \kappa^{(k)} \leqslant \kappa_{\max }\end{aligned} $

3 基于大语言模型辅助的智能文本隐写传输算法

本文设计了一种基于大语言模型辅助的智能文本隐写传输算法,如图2所示。该算法由大语言模型辅助的文本隐写方法和双智能体强化学习优化方法构成。根据不同消息类型的安全性和开销需求,该算法为每个秘密消息分配最优的隐写策略和发射功率,对大语言模型生成的文本进行自适应动态分组并将秘密消息嵌入其中,实现低开销、高安全的隐写传输。
图 2 智能文本隐写传输算法图

Fig.2 Illustration of the intelligent text steganography transmission scheme

3.1 马尔可夫决策过程

为指导发送方在动态环境下达到各个性能的最优平衡,本文将每个时隙$ k $的决策过程建模成一个马尔可夫决策过程,其形式化定义如下:
(1)状态空间。在时隙$ k $时,发送方获得长度为$ {L}^{\left(k\right)} $的秘密信息二进制串,以及对应的消息类型$ {\iota }^{\left(k\right)} $;查询本地时间戳记录获得上个时隙的隐写时延$ {\tilde{t}}^{\left(k-1\right)} $;根据接收方的反馈计算上一个时隙的传输时延$ {\hat{t}}^{(k-1)} $、丢包率$ {l}^{\left(k-1\right)} $;根据信道实时状态估计当前的信道增益$ {g}^{\left(k\right)} $。上述变量构建成在第$ k $次通信时的状态向量$ {\boldsymbol{s}}^{(k)} $
$ {\boldsymbol{s}}^{\left(k\right)}=\left({\iota }^{\left(k\right)},{L}^{\left(k\right)},{\hat{t}}^{\left(k-1\right)},{\tilde{t}}^{\left(k-1\right)},{g}^{\left(k\right)},{l}^{\left(k-1\right)}\right) $
其中每个性能指标都进行归一化处理。隐写策略智能体直接以$ {\boldsymbol{s}}^{(k)} $作为状态输入,功率智能体的状态在基本状态基础上增加一维隐写性能指标$ \beta _{}^{(k)} $,即隐写策略执行后的归一化消息长度,形成七位向量状态$ {\tilde{\boldsymbol{s}}}^{(k)}=({\boldsymbol{s}}^{(k)},\beta _{}^{(k)}) $
(2)动作。动作空间也分为两个:隐写策略动作和功率选择动作。
隐写策略动作为$ \boldsymbol{a}_{\text{s}}^{(k)}\in {\mathcal{A}}_{\text{s}} $,其中语料库类型被量化为$ M $个类型,输出的句子长度被分为$ N $种长度。因此,动作集大小为$ \left| {\mathcal{A}}_{\text{s}}\right| =M\times N $,共计$ MN $种可选择的文本隐写策略。功率选择动作为$ \boldsymbol{a}_{p}^{(k)}\in {\mathcal{A}}_{p} $,表示发送方可选择的发射功率等级集合,其中$ {\mathcal{A}}_{p}=\left\{{P}_{1},{P}_{2},...,{P}_{J}\right\} $,分别对应不同J种发射功率。
(3)奖励函数。奖励函数中综合考虑了多个性能,包括KL散度指示器、嵌入率指示器、检测成功率、攻击成功率、时延和能耗,其形式化为:
$ \begin{array}{c}{r}^{(k)}={\omega }_{1}{\phi }^{(k)}+{\omega }_{2}{\kappa }^{(k)}-{\omega }_{3}{d}^{(k)}-{\omega }_{4}{a}^{(k)}\\-{\omega }_{5}{\hat{t}}^{(k)}-{\omega }_{6}{e}^{(k)}-{\omega }_{7}{\tilde{t}}^{\left(k\right)}\end{array} $
其中$ {\left[{\omega }_{i}\right]}_{1\leq i\leq 7} $是平衡奖励中KL散度、嵌入率、检测成功率、功率成功率、能耗和时延权重系数。
(2)优化目标。强化学习智能体的目标是最大化折扣累积奖励的期望:
$ J=\mathbb{E}\left[\sum \limits_{t=k}^{\mathrm{\infty }}{\gamma }^{t-k}{r}^{(t)}\right] $
其中$ \gamma \in (0,1) $为折扣因子。该优化目标平衡了各项性能,实现在动态环境中自适应地选择最佳的隐写与功率选择动作。

3.2 基于大语言模型辅助的智能文本隐写传输算法

3.2.1 LoRA微调

加载预训练的大语言模型,冻结全部的模型原始参数。针对大语言模型的注意力层,对其原始权重$ {\boldsymbol{W}}_{0}\in {\mathbb{R}}^{m\times n} $引入低秩分解:$ \Delta \boldsymbol{W}=\boldsymbol{A}\times \boldsymbol{B} $,其中$ \boldsymbol{A}\in {\mathbb{R}}^{m\times r} $为投影矩阵,$ \boldsymbol{B}\in {\mathbb{R}}^{r\times n} $为还原矩阵,$ r\ll \min (m,n) $为低秩维度。在微调过程中,仅将$ \boldsymbol{A} $$ \boldsymbol{B} $设为可训练的参数。
对于每个语料库,首先加载对应的纯文本文件,使用大语言模型的分词器对文本进行分词处理。将预处理后的语料库数据依次载入模型,利用AdamW优化器仅更新$ \boldsymbol{A} $$ \boldsymbol{B} $,直至损失收敛。合并原始权重$ {\boldsymbol{W}}_{0} $与训练完成后的低秩矩阵$ \boldsymbol{A} $$ \boldsymbol{B} $,形成适配当前通信场景的微调后模型。将训练后的低秩矩阵参数保存成LoRA适配器,供隐写时加载。

3.2.2 隐写策略智能体

隐写策略智能体采用深度Q网络,其输入为状态$ {\boldsymbol{s}}^{(k)}\in {\mathbb{R}}^{6} $,输出$ MN $种隐写策略的动作值$ {Q}_{s}\left({\boldsymbol{s}}^{(k)},a_{s}^{(k)};\boldsymbol{\theta }_{1}^{(k-1)}\right) $。动作选择采用ϵ - greedy策略,以$ 1-\epsilon $的概率选择Q值最大的动作。隐写策略$ {b}^{(k)} $包含语料库类型$ {\hat{b}}^{(k)} $和输出句子长度$ {\tilde{b}}^{(k)} $,即:
$ {b}^{(k)}=\arg \underset{b}{\max }Qb\left({\boldsymbol{s}}^{\left(k\right)},\cdot \right) $
图 3 基于大语言模型的生成式文本隐写方法

Fig.3 Illustration of the generative text steganography method based on Large Language Model

大语言模型根据$ {\hat{b}}^{(k)} $加载对应的LoRA适配器,并根据上下文生成长度为$ {\tilde{b}}^{(k)} $的载体文本。在生成token的过程中,智能体利用自适应动态分组算法将秘密信息$ {m}^{\left(k\right)} $嵌入到载体文本中,获得长度为$ {\tilde{b}}^{(k)} $比特的隐写文本。

3.2.3 基于大语言模型的文本隐写算法

当隐写策略确定后,系统调用图2所示的基于大语言模型辅助的文本隐写算法。该方法以大语言模型为核心,将秘密信息比特串嵌入到大语言模型生成的文本中。所确定的隐写策略$ {b}^{(k)}=({\hat{b}}^{(k)},{\tilde{b}}^{(k)}) $包含两个关键参数:语料库类型$ {\hat{b}}^{(k)} $和输出的句子长度$ {\tilde{b}}^{(k)} $,前者控制生成文本的领域风格,后者限定输出句子的token数量,以此来平衡语言自然度、语义连贯性和嵌入容量。伪代码如算法1所示。
输入当前已生成的token序列$ c $,大语言模型输出词汇表$ V $上的下一个token的条件概率分布$ {p}_{\omega }=p\left(\omega |c\right) $。将所有token按照概率从大到小排序,记最大的条件概率为$ {p}_{\max } $,并计算分组数量$ U $
$ U={2}^{\left\lceil -{\log }_{2}{p}_{\text{max}}\right\rceil } $
采用自适应均衡算法将排序后的token序列划分为$ U $个分组$ {\{{{G}_{i}}\}}_{1\leq i\leq U} $
依次为每个分组$ {G}_{i} $计算目标累计概率阈值$ {\mu }_{i} $
$ {\mu }_{i}=\frac{\sum \limits_{\omega \in R}{p}_{\omega }}{U-i+1} $
其中$ R $为未分配的token集合。按顺序为每个分组$ {G}_{i} $分配token,从$ R $中贪心地选择token加入到$ {G}_{i} $中,使已分配token的条件概率和尽可能地接近$ {\mu }_{i} $。具体过程如下:从未分配集中选择能使当前分组概率$ {p}_{u} $和单词概率$ {p}_{\omega } $的总和最接近阈值$ {\mu }_{i} $的token$ {\omega }^{*} $,即:
$ {\omega }^{*}=\arg {\min }_{\omega \in R}\left| \sum \limits_{u\in {G}_{i}}{p}_{u}+{p}_{\omega }-{\mu }_{i}\right| $
重复上述过程,直至所有分组构建完成。每个分组对应一个长度为的$ \left\lfloor {\log }_{2}U\right\rfloor $秘密信息。
初始化生成的载体文本序列$ T=[] $,将秘密信息的二进制比特串$ {b}^{(k)} $分割成固定长度的块$ {z}_{j}\in {\{0,1\}}^{{{\log }_{2}}U} $,每个秘密信息块的二进制转换成对应的十进制分组索引$ {g}_{j} $。在每一步的嵌入过程中,模型的输出概率分布被约束到目标分组$ {G}_{{{g}_{j}}} $中,实现嵌入token的精确选择:
$ {\tilde{P}}_{j}(\omega )=\begin{cases} P(\omega |{S}_{j}), & \text{if}\omega \in {G}_{{{g}_{j}}}\\0, & \text{otherwise}\end{cases} $
选择该分组中概率最大的token$ {t}_{j} $作为输出:
$ {t}_{j}=\arg {\max }_{\omega \in {{G}_{{{g}_{j}}}}}\tilde{p}(\omega ) $
将该token追加到已有的上下文$ {c}^{(k)} $和文本序列$ T $中,继续下一个token的生成,直至到达目标长度$ {\tilde{b}}^{(k)} $或秘密信息已全部嵌入,最终生成的自然语言文本作为传输的信息发送给接收方。
算法1 基于大语言模型的生成式文本隐写方法
输入:上下文$ c $、秘密信息比特串$ {m}^{\left(k\right)} $、隐写策略$ {b}^{\left(k\right)} $
1)根据语料库类型$ {\hat{b}}^{(k)} $加载对应的LoRA适配器
2)调用大语言模型获取概率分布$ {p}_{\omega } $
3)计算最大概率$ {p}_{\max } $
4)根据式(10)计算分组数量$ U $
5)初始化分组$ {\{{{G}_{i}}\}}_{1\leq i\leq U} $、剩余token集合$ R $
6) For $ i=1,2,\ldots ,U $ do
7) 根据式(11)计算目标阈值$ {\mu }_{i} $
8) $ \text{while} \sum \limits_{w\in {G}_{i}}{p}_{w} \lt {\mu }_{i} 且 R\neq 0 \text{do} $
9) 根据式(12)选择token$ {\omega }^{*} $加入到$ {G}_{i} $
10) 从$ R $中移除$ {\omega }^{*} $
11)将$ m $分割成长度为$ \left\lfloor {\log }_{2}U\right\rfloor $的块$ \{{z}_{j}\} $
12)初始化token序列$ T=[] $
13) For $ j=1,2,\ldots ,{\hat{b}}^{(k)} $ do
14) 将二进制块转换成分组索引$ {g}_{j} $
15) 根据式(13)计算约束概率
16) 根据式(14)选择词元$ {t}_{j} $
17) 将$ {t}_{j} $追加到上下文$ c $$ T $
18)反令牌化$ T $
19)输出隐写文本$ T $

3.2.4 功率控制智能体

功率控制智能体将所选择的隐写策略$ {b}^{(k)} $和状态$ {\boldsymbol{s}}^{(k)} $输入权重参数为$ {\boldsymbol{\theta }}_{p} $Q网络2中,其中输入层的维度是7,隐藏层共两层,分别包含64个和128个神经元,输出层输出所有可选发射功率的Q值,即$ {Q}_{p}\left({\boldsymbol{s}}^{(k)},{b}^{(k)},a_{p}^{(k)};\boldsymbol{\theta }_{2}^{(k-1)}\right) $。通过ϵ - greedy策略选择发射功率$ {P}^{(k)} $,并以$ {P}^{(k)} $的发射功率将隐写文本$ T $发送给接收方,即:
$ {P}^{(k)}=\arg \underset{p}{\max }Qp\left({\boldsymbol{s}}^{\left(k\right)},{b}^{(k)},\cdot \right) $
具体算法如算法2所示。
算法2 基于大语言模型辅助的智能文本隐写传输方法
输入:每轮训练的时隙数$ K $,折扣因子$ \gamma $,学习率$ \alpha $
初始化:上层Q网络$ {G}_{s} $,下层Q网络$ {G}_{P} $
1)For $ k=1,2,\ldots ,K $ do
2) 观测当前状态$ {\boldsymbol{s}}^{(k)} $
3) 隐写策略智能体根据式(9)选择隐写子策略$ {b}^{(k)} $
4) 调用算法1生成隐写文本$ T $
5) 根据隐写策略构造扩展状态$ {\tilde{\boldsymbol{s}}}^{(k)}=({\boldsymbol{s}}^{(k)},\beta _{}^{(k)}) $
6) 功率选择智能体根据式(15)选择发射功率$ {P}^{(k)} $
7) 以功率$ {P}^{(k)} $发送隐写文本$ T $
8) 获取$ {\phi }^{(k)} $$ {\kappa }^{(k)} $$ {d}^{(k)} $$ {a}^{(k)} $$ {\hat{t}}^{(k)} $$ {e}^{(k)} $
9) 根据式(7)计算奖励$ {r}^{(k)} $
10) 观测下一状态$ {\boldsymbol{s}}^{(k+1)} $
11) 将经验存入经验回放缓冲池
12) 采样并参数更新

4 实验结果与分析

本章节从文本隐写的KL散度和嵌入率、通信过程中的时延和能耗以及攻击者的检测成功率和攻击成功率这6个方面来验证所提方法的有效性。

4.1 实验设置

本文的实验分为两部分,Llama大语言模型的参数微调和训练过程在Ubuntu系统上进行,显卡型号为NVIDIA GeForce RTX 4090,基于大语言模型的智能文本隐写传输的实验则是在Windows 11操作系统下进行,实验平台为Pytorch2.8.0,显卡型号为NVIDIA GeForce RTX 5060。实验中包含一个发送方、一个接收方以及一个攻击者。发送方使用预训练后的Llama-2-7b-hf模型作为文本生成器,模型精度为FP16,隐藏层维度为4096,隐藏层数量为32,词汇表大小为32000,前馈网络中间层的维度为11008,模型的最大上下文长度为4096,在推理时使用8-bit量化降低显存占用,单token生成时延约4 ms。微调采用LoRA技术,低秩维度$ r=8 $,缩放因子为32。文本预处理阶段,最大序列长度截断为128个token。
在实验过程中,发送方加载Llama-2-7b-hf模型,从三个公开的语料库(Movies、News和SNS)中选择一个作为数据库,扫描其语料文件,收集所有出现过的token ID,构建其词汇表。在模型训练时,限制其训练数据在特定语料库的词汇表中,使得整体句子更加符合对应领域的语言习惯。
Movies语料库是一个用于二元情感分类的基准数据集,数据源于知名电影评论网站,总共包含100,000条电影评论。
News语料库包含一系列来自主流新闻出版物的文章,注重文本的客观性和逻辑性,常用于各种自然语言处理任务。
SNS语料库是一个被用于情绪分析研究的数据集,包含来自某社交网站的160万条微博帖子,文本长度较短,语义贴近口语化。
攻击者使用一个基于BERT的文本二分类器。该模型以bert-base-uncased作为基础特征提取器,这是一个包含12层Transformer编码器的预训练语言模型。在BERT的[CLS]输出之上,攻击者添加了一个输出维度为2的全连接层,将句子的整体向量通过全连接层压缩到2维,再用softmax转换成两类概率,用于区分普通文本还是隐写文本。模型的训练流程如下:首先读取普通文本和隐写文本,划分训练集、验证集和测试集,然后加载预训练的BERT权重并添加分类头,利用Adam优化器进行端到端的微调。评估指标为:准确率、精确率、召回率与F1分数。当检测到隐写文本时,攻击者采取字符替换、单词删除或单词交换进行攻击,攻击次数从1-4随机选择。
本文选择自适应分组算法(ADG)与所提方法进行对比,用于评估强化学习带来的性能增益。具体细节如下:
ADG[15]。该算法使用LSTM作为生成模型,利用自适应分组机制生成隐写文本。
评价指标包括本次传输过程中的时延、能耗,攻击者的检测成功率、攻击成功率。

4.2 实验结果

本文从隐写安全性、通信开销以及消融实验三个维度验证所提算法的有效性。
(1)安全性分析。实验结果如图4所示,所提方法相较于自适应分组算法具有更低的检测准确率、攻击成功率。具体而言,本文所提方法的检测准确率比ADG算法降低了85.90%,攻击成功率低至0.83%,同时本文所提算法的KL散度收敛到0.018,仅比ADG算法低了0.001。这是因为所提方法使用了三种不同语料库LoRA微调后的大语言模型,保证了生成文本与消息类型的一致性,使隐写文本的统计分布与对应领域的正常文本高度接近。同时双智能体强化学习根据实时信道装填和攻击者的历史检测准确率,自适应选择最不易被区分的语料库类型,进一步降低了被检测概率。
图 4 所提方法与基准方法的性能比较

Fig.4 Performance comparison of the Proposed Method and Baselines

(2)通信开销分析。通信开销主要包括时延和能耗,所提方法将时延降至27.71 ms,能耗降至0.38 mJ,相较于ADG算法分别降低了38.5%和26.3%。这是因为双智能体强化学习在策略选择时,将时延和能耗作为奖励函数的惩罚项。智能体选择最优的输出句子长度,避免生成过长的句子导致多次调用大预言模型,从而控制隐写时延。同时智能体选择最优的发射功率,避免了高功率带来的能耗。而ADG算法采用固定的句子长度和发射功率,难以适应时变的信道条件,产生了更高的时延和能耗。
(3)消融实验。为了验证多种语料库的带来的性能增益,本文进行了消融实验,使用柱状图展示了各个性能指标的均值及误差棒,如图5所示。其中,电影、新闻和社交媒体分别代表使用单个语料库时的实验结果,其他设置不变。
图 5 语料库消融实验

Fig.5 Ablation study of corpus

从柱状图上看,所提方法的最终时延为27.71 ms,相较于3种语料库分别提升了38.4%、63.0%和43.4%。安全性能的提升则更为显著,检测成功率维持在4.13%,攻击成功率维持在0.83%,相较于社交媒体语料库提升了82.69%、90.08%。同时,新闻语料库由于提供的文本句式严谨、语法固定,大语言模型对其概率分布拟合度高,因此生成出来的文本发生细微变化都易被检测和攻击。
从误差棒上看,所提方法在检测准确率、攻击成功率和时延上的误差棒均明显小于三种语料库,性能波动更小,稳定性更强。在能耗方面,新闻文本由于句式规整、词频分布固定,生成的句子长度变化较小,因此误差棒略低于所提算法,但整体能耗仍高于所提算法。这证明了多语料库可以根据信道条件和攻击者行为自适应最合适的文本风格,减少了因失败或重传导致的额外时延,同时提升了隐蔽性与抗攻击能力,验证了语料库选择的必要性。
本文还进行了发射功率的消融实验,结果如表1所示。在固定发射功率时,时延达到了48.80 ms,高出所提方法43.2%。这是因为本文所提方法针对不同长度的隐写文本和信道状态,会选出最适合的发射功率,减少不必要的开销。
表 3 发射功率消融实验

Table 3 Ablation study of transmission power

方法时延(ms)攻击成功率(%)检测准确率(%)
固定功率-24dbm48.808.7420.16
自适应功率27.710.834.13
这两个消融实验证明了本文设计的双智能体强化学习优化算法的有效性,不仅兼顾了隐写的安全性,更提高了通信效率,降低了通信的开销。

5 结束语

本文针对传统隐写方法生成的文本风格和长度难以适应变化的消息类型和信道条件,提出了一种基于大语言模型辅助的文本隐写传输方法。首先,利用多种语料库实现对大语言模型的LoRA微调,利用微调后的大语言模型给出的概率分布,通过自适应动态分组递归地嵌入秘密信息。其次,引入强化学习,结合实时信道状态和攻击成功率等安全指标,自适应优化隐写策略,包括语料库的类型和大语言模型输出的句子长度,并实现了发射功率的选择。通过与ADG算法进行性能比较,本文所提方法在保证安全性的前提下,能够有效降低传输的时延和能耗,提升了通信效率。
未来,将考虑多种异构环境的文本隐写传输框架,针对车联网、无人机通信以及卫星通信等多种不同的传输环境,设计一个具有广泛适应性的自适应文本隐写传输方法,以进一步提升通信效率与安全性能。
1
吴国华, 龚礼春, 袁理锋, 等. 中文文本信息隐藏研究进展[J]. 通信学报, 2019, 40 (9): 145- 156.

DOI

WU G H, GONG L C, YUAN L F, et al. Review of information hiding on Chinese text[J]. Journal on Communications, 2019, 40 (9): 145- 156.

DOI

2
张卫明, 陈可江, 俞能海. 可证安全隐写: 理论、应用与展望[J]. 网络空间安全科学学报, 2023, 1 (1): 38- 46.

Zhang W M, CHEN K J, YU N H. Provable Secure Steganography: Theory, Application and Prospects[J]. Journal of Cybersecurity, 2023, 1 (1): 38- 46.

3
梅佳蒙, 任延珍, 王丽娜. 安全性可控的生成式文本隐写算法[J]. 网络与信息安全学报, 2022, 8 (3): 53- 65.

DOI

Mei J M, REN Y Z, WANG L N. Generation -based linguistic steganography with controllable security[J]. Chinese Journal of Network and Information Security, 2022, 8 (3): 53- 65.

DOI

4
DAI W H, YU Y, DAI Y H, et al. Text steganography system using Markov chain source model and DES algorithm[J]. Journal of Software, 2010, 5, 785- 792.

5
Zhou X J, Peng W L, Yang B Y, et al. Linguistic steganography based on adaptive probability distribution[J]. IEEE Transactions on Dependable and Secure Computing, 2022, 19 (5): 2982- 2997.

DOI

6
Yang Z L, Wang K, Li J, et al. TS-RNN: text steganalysis based on recurrent neural networks[J]. IEEE Signal Processing Letters, 2019, 26 (12): 1743- 1747.

DOI

7
FANG T, JAGGI M, ARGYRAKI K. Generating steganographic text with LSTMs[C]//Proc of the ACL 2017 Student Research Workshop. Vancouver, Canada: Association for Computational Linguistics, 2017: 100-106.

8
DING J Y, CHEN K J, WANG Y F, et al. Discop: provably secure steganography in practice based on “distribution copies”[C]//Proc of the 2023 IEEE Symposium on Security and Privacy (SP). San Francisco, CA, USA: IEEE, 2023: 2238-2255.

9
Wu, J X, Wu Z X, Xue Y M, et al. Generative Text Steganography with Large Language Model[C]// Proc of the 32nd ACM International Conference on Multimedia. New York: ACM, 2024.

10
CHAPMAN M, DAVIDA G. Hiding the hidden: a software system for concealing ciphertext as innocuous text[C]//Proc of the International Conference on Information and Communications Security. Berlin: Springer, 1997: 335-345.

11
BENGIO Y, DUCHARME R, VINCENT P, et al. A neural probabilistic language model[J]. Journal of Machine Learning Research, 2003, 3, 1137- 1155.

12
YANG Z L, GUO X Q, CHEN Z M, et al. RNN-stega: linguistic steganography based on recurrent neural networks[J]. IEEE Transactions on Information Forensics and Security, 2018, 14 (5): 1280- 1295.

13
Yan R Y, Yang Y T, Song T. A Secure and Disambiguating Approach for Generative Linguistic Steganography[J]. IEEE Signal Processing Letters, 2023, 30, 1047- 1051.

DOI

14
Xiang L Y, Ou C F, He X, et al. A Content-Preserving Secure Linguistic Steganography [C]//Proc of the AAAI Conference on Artificial Intelligence, 40(42), 35885-35893.

15
Zhang S Y, Yang Z L, Yang J S, et al. Provably Secure Generative Linguistic Steganography[C]// Findings of the Association for Computational Linguistics: ACL-IJCNLP, 2021: 3046-3055.

16
向凌云, 杨双辉, 王蓉, 等. 基于序列到隐写序列的约束型自然语言信息隐藏方法[J]. 计算机学报, 2023, 46 (08): 1650- 1669.

Xiang L Y, Yang S R, W R, et al. Constrained Linguistic Steganography Based on Sequence to Steganographic Sequence Model[J]. Chinese Journal of Computers, 2023, 46 (08): 1650- 1669.

17
金家立, 马卫娇, 李晖, 等. 基于Transformer神经机器翻译的文本隐写方法[J]. 计算机应用与软件, 2025, 42 (5): 381- 386.

Jin J L, Ma W J, Li H, et al. Text Steganography Method Based on Transformer Neural Machine Translation[J]. Computer Applications and Software, 2025, 42 (5): 381- 386.

18
LUO Y B, HUANG Y F. Text steganography with high embedding rate: using recurrent neural networks to generate Chinese classic poetry[C]//Proc of the 5th ACM Workshop On Information Hiding and Multimedia Security. New York: ACM Press, 2017: 99-104.

19
刘玉玲, 王翠林, 付章杰. 语义空间下基于情感表达的生成式文本隐写方法[J]. 通信学报, 2023, 44 (4): 176- 186.

Liu Y L, WANG C L, FU Z J. Generative text steganography method based on emotional expression in semantic space[J]. Journal on Communications, 2023, 44 (4): 176- 186.

20
Ziegler Z, Deng Y T, Rush A. Neural Linguistic Steganography[C]//Proc of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing. Hong Kong, China: Association for Computational Linguistics, 2019: 1210-1215.

21
李晖, 金家立, 金纾羽, 等. 基于自动选择编码及动态选词策略的文本隐写方法[J]. 通信学报, 2022, 43 (9): 240- 253.

DOI

LI H, JIN J L, JIN S Y, et al. Text steganography method based on automatic selection coding and dynamic word selection strategy[J]. Journal on Communications, 2022, 43 (9): 240- 253.

DOI

22
Li X X, Wang Z C, Zhang X P. Black-Box Steganography for Large Language Models[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2025, 35 (11): 11698- 11707.

DOI

23
孙雄韬, 刘干, 李怡然, 等. 文本隐私感知与保护研究综述[J]. 网络空间安全科学学报, 2023, 1 (2): 2- 21.

DOI

SUN X T, LIU G, LI Y R, et al. Survey of Text Privacy Perception and Protection[J]. Journal of Cybersecurity, 2023, 1 (2): 2- 21.

DOI

24
Luong N C, Hoang D T, Gong S M, et al. Applications of Deep Reinforcement Learning in Communications and Networking: A Survey[J]. IEEE Communications Surveys & Tutorials, 2019, 21 (4): 3133- 3174.

DOI

25
LU X Z, XIAO L, XU T W, et al. Reinforcement learning based PHY authentication for VANETs[J]. IEEE Transactions on Vehicular Technology, 2020, 69 (3): 3068- 3079.

DOI

26
XIAO L, LU X Z, XU T W, et al. Reinforcement learning-based physical-layer authentication for controller area networks[J]. IEEE Transactions on Information Forensics and Security, 2021, 16, 2535- 2547.

DOI

27
XU T W, LU X Z, XIAO L, et al. Voltage based authentication for controller area networks with reinforcement learning[C]//Proc of the IEEE International Conference on Communications. IEEE, 2019: 1-5.

28
刘子涵, 贾玲如, 卢晓珍, 等. 基于强化学习的无人机轻量化身份认证方法[J]. 网络空间安全科学学报, 2025, 3 (4): 16- 28.

LIU Z H, JIA L R, LU X Z, et al. Lightweight authentication approach for unmanned aerial vehicles based on reinforcement learning[J]. Journal of Cybersecurity, 2025, 3 (4): 16- 28.

29
Wang Y N, Chen M Z, Saad W, et al. Performance Optimization for Semantic Communications: An Attention-based Learning Approach[C]//2021 IEEE Global Communications Conference (GLOBECOM), Madrid, Spain, 2021: 1-6.

30
钟天尧, 姚欢, 冯智斌, 等. 任务场景驱动的无线通信跨层智能适变方法[J]. 通信学报, 2026, 47 (02): 61- 72.

Zhong T Y, Yao H, Feng Z B, et al. Task scenario-driven cross-layer intelligent adaptation approaches for wireless communication[J]. Journal on Communications, 2026, 47 (02): 61- 72.

31
Gao X Y, Yin H, Sun Y P, et al. Multilevel Feature Transmission in Dynamic Channels: A Semantic Knowledge Base and Deep-Reinforcement -Learning-Enabled Approach[J]. IEEE Internet of Things Journal, 2025, 12 (8): 10150- 10162.

DOI

32
吉立建, 林伟伟, 段超, 等. AI驱动的自适应网络安全测评框架研究[J]. 网络空间安全科学学报, 2025, 3 (5): 61- 72.

DOI

Ji L J, Lin W W, Duan C, et al. Towards an AI-driven adaptive framework for cybersecurity assessment[J]. Journal of Cybersecurity, 2025, 3 (5): 61- 72.

DOI

33
刘双成, 李思民, 李海南, 等. 面向无人机群多智能体强化学习的对抗仿真平台与攻防验证[J]. 网络空间安全科学学报, 2023, 1 (2): 93- 111.

LIU S C, LI S M, LI H N, et al. Simulation Platform and Attack and Defense Verification for Adversarial Multi-Agent Reinforcement Learning in UAV Swarms[J]. Journal of Cybersecurity, 2023, 1 (2): 93- 111.

文章导航

/