Academic Research

Automatic extraction method of threat intelligence for deep and dark web based on Chatbot

  • HUO Yixuan , 1 ,
  • ZHAO Jiapeng , 1, * ,
  • SHI Jinqiao 1 ,
  • WANG Xuebin 2 ,
  • YANG Yanyan 3 ,
  • SUN Yanwei 1
Expand
  • 1. School of Cyberspace Security, Beijing University of Posts and Telecommunications, Beijing 100876, China
  • 2. Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100093, China
  • 3. School of Information Network Security, People's Public Security University of China, Beijing 100038, China

Online published: 2024-07-08

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

Abstract

Due to its high anonymity, easy access and convenient transaction, the deep and dark web was extensively abused by criminals to implement illegal activities. With the update of social network, the encrypted instant messaging tool Telegram was widely popular channel for communicating malicious activities because of its strong protection of privacy and encryption mechanism. Telegram group was widely used for criminals to spread sensitive information or advertise purchases and sales, with details such as the type of goods usually communicated through private chats. From the perspective of supervision, there was a large amount of valuable intelligence in the private communication with criminals, and it was helpful to improve the quality and efficiency of target intelligence collection by conducting targeted conversations with criminals under the guise of identity, rather than extracting valuable intelligence from a large number of meaningless messages. To tackle this issue, an automatic extraction method of threat intelligence on the deep dark web based on conversation robots was proposed. By invoking ChatGPT, which had superior session generation ability, multiple rounds of conversations with suspicious people were automatically generated to solve the problem of low cost and high efficiency of manual communication. Using the knowledge reserve of large language model and the ability of context learning was to solved the difficulty of starting the deep dark web dialogue corpus shortage. The experiments show that this method can automatically extract intelligence with high-quality multi-round conversations, which has practical significance, and provides a direction for the follow-up research on automated interaction in the field of cybercrime.

Cite this article

HUO Yixuan , ZHAO Jiapeng , SHI Jinqiao , WANG Xuebin , YANG Yanyan , SUN Yanwei . Automatic extraction method of threat intelligence for deep and dark web based on Chatbot[J]. Journal of Cybersecurity, 2024 , 2(2) : 47 -55 . DOI: 10.20172/j.issn.2097-3136.240204

0 引言

万维网由表层网和深网组成[1]。表层网是指能被普通搜索引擎检索到的网络,约占互联网总体的4%;深网是指无法使用标准搜索引擎索引的网络,如动态生成的网页、限时访问站点等,深网的内容大多是合法的,但其中存在一个网络公害遍布的部分,即暗网。暗网是一种基于匿名通信技术的覆盖网络,只能通过专用软件、代理配置或特殊网络协议才能访问,伴随着加密货币和匿名通信的发展[2],越来越多的非法用户在其中进行非法交易或传播危害信息,严重威胁国家社会稳定和网络空间安全。
随着网络社交方式的更新,加密即时通信软件成为不法分子最常用的交流方式之一。加密即时通信软件是指深暗网中经过加密的即时聊天的工具,如Telegram,形式上类似于明网的即时通信应用,如微信。Telegram因其极强的隐私保护机制和加密机制而被不法分子滥用[3],每天都有大量威胁用户在群聊和频道传播涉恐、毒品买卖等威胁信息。从监管的角度来看,其中存在大量对监管部门有价值的情报。然而,不法分子警惕性强,在Telegram频道或者群聊上只进行宣传,具体细节如支付途径、货品种类等需要一对一私聊才能获取。被动地分析群组消息首先需要处理大量广告垃圾信息,筛选情报犹如大海捞针;其次,这些筛选出来的少量情报往往内容简短且信息量不足[4]
如果能从群组发言中找出可疑分子和其私聊,并对威胁活动类别和不法分子群体进行分析,有策略地引导其披露具体敏感信息,有助于提升深暗网威胁活动监控效率,有助于监管部门深入监管深暗网,打击网络犯罪。然而,人工展开与不法分子的会话来套取情报,成本高、效率低。本文引入会话机器人自动化地与可疑分子展开会话,根据预设的情景,有策略地逐轮深入主题,实现深暗网威胁情报的套取,可以帮助有关部门减少人工搜集并搭话的精力和时间,降低人工搭话成本,高效收集威胁情报。
特别地,本文引入生成能力优越的ChatGPT(Chat Generative Pre-trained Transformer)[5]作为会话机器人与可疑目标进行自动搭话,不仅能够进行高质量、强记忆力的多轮会话,还能在缺少深暗网违法犯罪背景下的对话语料及对威胁活动生态理解的情况下,凭借ChatGPT本身强大的知识储备,无须人工标注而快速投入使用。调用ChatGPT API(Application Programming Interface)时最优参数的选取通过多次实验确定,并以理想状态下的平均对话轮数证明了可行性。
在本文设计的方法中,通过追踪群组的活跃敏感话题,锁定该话题下的活跃用户,下一步将对其进行诱导式会话情报套取,最后对所收集到的信息进行深层次情报关联与抽取。最终将此套方法应用于真实Telegram环境进行测试,并对结果进行分析与总结,与可疑分子真实会话中获取威胁情报的交互轮数的累积分布表明了使用会话机器人与威胁人物进行的有限通信中所获取的关键信息的有效性。该方法为后续对深暗网违法犯罪领域的研究工作奠定了基础,并指引了方向。

1 相关工作

1.1 会话机器人

会话机器人,又称聊天机器人、对话系统、交互助手等,是自然语言处理领域的核心任务之一,旨在通过自然语言处理技术,以文本或语音的形式模拟人类进行对话或聊天,在教育、电子商务、医疗等领域有着广泛应用。
传统的会话机器人大多采用了基于规则的或者基于机器学习的实现技术。基于规则的方法是指通过人工编写规则来实现对话,耗费大量人力[6]。基于机器学习的方法又分为检索式和生成式,传统的会话机器人遵循通用系统架构,包含5个主要功能模块,分别为用户输入模块、自然语言理解模块、对话管理模块、应答产生模块和后端,步骤繁杂[7]。后来随着基于深度学习的Seq2Seq模型在机器翻译领域大获成功[8],生成式的端到端会话机器人成为主流,主要应用于广泛的开放域闲聊和某些任务驱动型对话上,其严重依赖于大量标注数据及结构化的知识库和对话文本,像婴儿一样一遍又一遍地模仿应答,经常产生无意义的、缺乏多样性的响应。此时期有大批研究聚焦于生成内容质量的提升和多轮对话的实现上,这些研究都需要构造精细的数据集和专门的实验环节[9]
2022年11月30日,OpenAI公司发布了颠覆性的聊天机器人ChatGPT,它能够真正像人类一样聊天交流,具有超强的上下文记忆力和理解力。可以将ChatGPT的训练过程拆解为3个环节。首先,使用上下文学习(In-Context Learning)训练大模型GPT-3[10]。GPT-3具有1750亿个参数,是在45 TB网络文本数据上训练得到的,其学到了语言的天然结构和语义特征,具有出色的自然语言理解和生成能力。然后,在强大的底座上,使用指令微调,激活或者增强大模型完成特定任务的能力。OpenAI利用更多更新的文本数据和代码数据混合学习,得到了更强的基础大模型GPT-3.5,并作为ChatGPT的基础模型,使其具有逻辑推理能力。最后,通过人类反馈的强化学习,自动学习人类的偏好,更好地与人类意图和社会价值观对齐[11]。2023年3月1日,OpenAI正式开放ChatGPT API,实际上是开放了GPT-3.5-turbo的模型。2023年3月14日,OpenAI发布GPT-4[12],GPT-4有着更高的准确性、识图能力、长记忆性,可以实现多种风格变化。
ChatGPT的出现推动了人工智能探索进入新阶段,国内外众多科技公司和学术界纷纷跟上大模型的热潮,推出了自研的大模型,如复旦大学的MOSS[13]、Meta的LLaMA[14]、LLaMA 2[15]、百度的文心一言[16]、谷歌的Gemma[17]、清华大学的ChatGLM[18]等,为各领域带来了新的发展机会。

1.2 网络犯罪领域的自动化交互工作

自动化交互技术迄今已有几十年的研究积累,但并不能直接将它们应用于网络犯罪领域,需要结合应用特点进行特殊的设计。要与网络犯罪分子进行令其信服的交互,有策略地诱导其讨论威胁活动,需要熟悉不同威胁活动类别的交互模式,深入理解犯罪分子的心理,跟踪其交流方式与交流内容的变化。
在网络犯罪领域已经有一些自动化与犯罪分子交互的工作。Park等人[19]通过分析诈骗邮件,构造模板进行自动回复来收集诈骗支付途径,但是此方法产生的文本非常相似,在现今犯罪分子高度警觉的情况下可被轻易识破。微软[20]推出的一款会话机器人,通过与在线色情买家互动,耗费他们的时间并给予警告。Kovalluri等人[21]使用基于LSTM(Long Short-Tern Memory)的语言模型根据钓鱼邮件的上下文生成连贯的回复,尽最大努力浪费诈骗分子的时间。以上工作是以浪费不法分子时间、降低其他受害者被骗的概率为主要目的展开的,并不能主动进行引导式的消息采集。
Wang等人[22]提出一个主动搭话深暗网电商欺诈分子的会话机器人Aubrey,用大量聊天记录建立知识库,通过语义分割和聚类形成具有相同主题的对话块,将交互过程建模为有限状态机,根据主题建立状态,根据主题对话块间的关系来建立状态间的转换关系。接入即时通信后,首先进行目标人物发现,基于群组聊天记录,将不同欺诈角色的关键词、发言长度和频次作为特征进行分类,找出不同欺诈角色的目标会话人物。会话机器人以临时工的身份,有策略地引导找到的欺诈分子讨论多种地下电商欺诈活动如售卖虚假账户、招临时工等,有效获取威胁情报,并基于此分析了整个电商欺诈的生态。
国内有面向“杀猪盘”诈骗的开源项目[23],此工作首先在多个社交平台立受害者画像的人设,引诱诈骗犯前来搭话。自动会话生成功能是通过收集贴吧等网站的热门评论,在浪潮源1.0中文预训练大模型[24]上精调实现的,其生成内容十分逼真,紧跟网络最新的“梗”迷惑对方,能够与诈骗犯进行多轮对话而不暴露,为执法人员提供线索支持。
以上2种方法都不能直接应用于深暗网环境,因为无论是电商欺诈找工作的临时工,还是“杀猪盘”诈骗中的受害者,会话机器人伪装的身份本身就自然地引诱不法分子主动展开详细的多轮对话,而深暗网中的威胁人物警惕性强、没有耐心、聊天内容简短、风格多变,如果建立基于规则和检索的知识库,需要大量的聊天记录且需要根据每种威胁活动构建有限状态机;如果只从会话生成质量上开展工作,无法保证威胁情报套取的有效性。
ChatGPT出现后,立刻有很多工作使用它进行特定领域的文本生成。Enrico等人[25]使用ChatGPT生成电子邮件消息以吸引骗子并浪费他们的资源,可以与一个骗子交流多达18封邮件,或者欺骗攻击者长达27天,大大提升了对抗邮件诈骗的效果,这也给予本文启发。

2 威胁情报自动套取方法

2.1 深暗网隐匿社交特点分析

从事不同威胁活动类别的威胁人物,聊天风格也大不相同。比如,毒品、枪支贩常用行话进行交流,聊天内容简短,在群组吐露的信息非常少;每个涉及交易的群都有担保,相当于中介,在买家与卖家中间赚差价,他们本身掌握着大量信息资源和渠道。对于这些不同类别的威胁活动和黑灰产交易,还需要结合其具体的交互特点和罪犯心理进行分析并加以利用,设计有针对性的交互方案。
通过对Telegram群组的无监督主题抽取和时序建模,分析群组用户组成和交互风格,可知大部分黑灰产相关的群组中,存在抛出需求、寻找资源的买家和简短回复或直接开启私聊的卖家,其中有很多警惕性强的不法分子,消息频次低、内容简短或使用行话。从卖家的角度进行分析与设计会话,可以挖掘到其威胁实体来源、威胁交易生态等,方便相关部门进一步管控;从买家的角度进行分析,如购买枪支、毒品、人口的人,可以推理其目的、掌握其动向,以便及时发现威胁并进行预警干预。因此,可以从买家和卖家2个角度展开引导式的威胁情报套取。

2.2 会话情境设计

会话情景设计如图1所示,威胁活动包括贩卖毒品、电信诈骗、洗钱、售卖黑客软件、闪现套现等,威胁实体包括毒品、枪支、暗网网址链接等。经过对群组内容的分析与威胁用户的初步挖掘,得到了一批可疑人物账号名单,基于聊天记录分析用户涉及的威胁活动类别和发言特点,面向不同类别的威胁人物与威胁活动主题设计不同的会话情景。
图 1 会话情景设计

Fig.1 Conversational scenario design

对于可疑卖家,设定会话机器人为购买毒品、枪支、人肉信息等买家的身份,向其主动搭话,询问购买细节,如价格、支付途径、物品来源等。对于可疑买家,设定会话机器人为贩卖隐私数据、信用卡、暗网论坛账户等卖家的身份,向其主动搭话,询问其用途和交付日期等。有层次地进行多轮提问,套取线索与证据。同时,通过分析对方的应答,抽取威胁情报。

2.3 系统架构设计

系统架构如图2所示,由群组内容与用户分析模块、对话管理模块和应答分析模块3部分组成。
图 2 系统架构

Fig.2 System architecture

2.3.1 群组内容与用户分析模块

威胁人物通常使用Telegram群组进行业务的推广或资源的寻找,而允许用户随意发言的群组充斥着大量无用信息,需要对群组聊天内容进行分析,采集有价值的信息和用户发言,从而找到目标主题与目标用户。
具体来说,在对群组聊天文本进行预处理后,使用无监督主题建模方法对一段时间内的聊天记录进行主题提取,在此基础上归纳得到高频敏感主题的时序变化和代表词。随后,将这些敏感词与活跃用户的发言进行相关度计算,得到敏感主题下的活跃用户,锁定为可疑威胁人物,进行后续的搭话。

2.3.2 对话管理模块

在ChatGPT出现之前,会话自动生成采用基于规则的或基于机器学习的方法,需要大批高质量的对话文本数据和精细的人工工程,且多轮对话记忆力和理解力较差。ChatGPT出现后,其通过大规模预训练模型加上提示精调的方式,可以轻而易举地激发系统完成不同任务的能力,其开放的API和超强的多轮对话记忆力和理解力为本研究实现多轮引导式会话的消息采集提供了契机。
会话机器人接入Telegram是基于Telethon的client对象进行的,每当接收到新消息时,该事件处理程序将被调用,将接收到的对方输入的信息传进GPT-3.5-turbo模型生成应答并存入记忆,同时传入应答分析模块;将生成的应答发送给Telegram中目标用户账号。
将 ChatGPT API 接入Telegram平台,设定多种人设规则,从买家和卖家2个身份角度展开关于毒品、枪支等多种威胁活动类别的会话。具体来说,先由会话机器人向目标人物发送固定的搭话问题,如“怎么卖?”,获取对方的应答后,传递给ChatGPT API生成响应,再回传给对方。同时,将对方的应答送往应答分析模块进行分析。

2.3.3 应答分析模块

应答分析模块进行2项工作:首先判断对方的应答是否为否定含义,若为否定,暂且排除对其的怀疑;若不是否定含义,进一步检测其应答中是否包含敏感词,如支付网站、毒品类别、交付日期等。具体来说,使用否定词检查来识别否定语义,使用正则表达式和关键词检查来检测威胁链接和威胁实体。

3 威胁情报套取会话自动生成实验

ChatGPT的API在调用时有几个参数需要设定,通过调研和实验选择最优的参数设置。

3.1 自动会话效果评价指标

在会话机器人的研究中,对响应生成质量的评估一直是悬而未决的问题。任务导向的会话机器人可以基于人工生成的监督信号开展评估,如任务是否完成或用户满意度评分,而非任务型会话机器人的响应具有高度多样性,不好找到一个通用的指标来评估。
人工评价是目前最准确、最有效的对话质量评价指标,但存在耗费人力和时间的问题,也存在难以客观的弊端。人工评价目前主要包含成对对比和李克特量表2种评价方式。成对对比即对2个会话机器人系统产生的回复就不同的侧重点人工评判优劣;李克特量表指的是李克特量表形式的人工评分,评分可设置为3、5、7等级,可以针对对话质量的多方面进行评价,如对话的信息量、连贯性、新颖性、类人性等。尽管人们一直在探索能够完全代替人工评价的自动评价方法,但至今没有找到。
对于生成式模型,有多种自动评价指标。熵可以衡量响应多样性;困惑度可以评价响应的自然、通顺情况;单次平均对话轮数可以评价会话流程的健康度,体现对话者的参与度,也可以侧面反映会话机器人的多轮记忆力和理解力;BLEU(Biling Evaluation Understudy)、METEOR(Metric for Evaluation of Franslation with Explicit Ordering)和ROUGE(Recall Oriented Understudy for Gisting Evaluation)等词重叠指标度量了参考响应和生成响应之间的词语重叠程度,重合程度越高则认为文本质量越高。因为本实验最终目的为与可疑分子搭话并识别其威胁程度,需要可疑分子参与度越高越好,所以选取平均对话轮数作为评价指标,来证明本套方法在会话生成层面的可行性。

3.2 API参数设定

(1) Temperature
Temperature值,顾名思义,控制输出内容的“温度”,即创意性与随机性,值越高越灵活,越低越稳定,取值范围为0.0~1.0。为了确定合适的Temperature值,本文进行了50次模拟会话实验,为会话机器人设定的Prompt人设不变,在0.0~1.0共10个Temperature值下,会话机器人与模仿威胁人物口吻的真人进行对话,每个值进行5次会话,统计得到的不同Temperature值下主动自我暴露前的平均对话轮数如图3所示。
图 3 不同Temperature值下暴露前的平均对话轮数

Fig.3 Average number of dialogue rounds before exposure at different temperature values

由实验结果可知,高值段内容过于自由灵活、不可控,轻易自我暴露是会话机器人;在低值段,越低输出越稳定,但过低时语气过于生硬、保守、不自然,虽然能多轮逐层深入地推动情报套取,但在真实场景中被对方识破的风险很大。通过比较和观察可知,Temperature值选取0.3~0.4最合适,可以进行6轮左右的可靠会话。
(2) Prompt
另一个十分关键的参数设定就是角色,其中系统(system)信息用于设定调用 ChatGPT 生成内容的规则、“人设”等背景和目的;助手(assistant)信息用于记忆历史对话内容,方便多轮对话;用户(user)信息用来接收对方的输入。
因为OpenAI对ChatGPT的生成内容有安全性限制,不允许其生成有害内容,所以本实验在给予ChatGPT背景知识时,需要严格构造的人设,如网络警察、网络小说作家等。通过system设定不同的背景身份与目标,可以进行不同敏感话题下的多身份会话,如充当毒品贩卖者与可疑买家搭话,或者扮演武器买家与锁定的可疑卖家搭话。
表1为3种敏感主题下生成会话内容的示例,其中威胁人物(Threat actor)以T为代表,会话机器人(ChatBot)以C为代表,加粗标记了会话中的关键轮次,如质量、价格、交易方式等。
表 1 不同主题下自动会话生成示例

Table 1 Examples of automatic conversation generation under different topics

主题类别与提示构造 对话
你是网络警察,现在要伪装成买枪支等武器的人与罪犯搭话,套取他们的情报 C:我想买一些枪支和弹药
T:我这儿有AK、加特林、手榴弹。
C:听起来很不错。您能告诉我这些武器的价格和质量吗?我需要确保它们是高质量的,而且价格合理。
T:质量特好,5万。
C:5万?这个价格有点高了吧。您能不能给我一个更合理的价格?我需要购买多个武器,价格对我来说非常重要。
T:3万出,微瑕。
C:3万?这个价格听起来还可以接受。但我需要确保这些武器是安全的,不会出现任何问题。能不能让我看看这些武器的照片或者视频,以便我更好地了解质量和状况?
T:去我网址里看。
C:好,请告诉我您的网址。我会尽快查看这些武器的照片和视频。
T:导航里有,自己找。
C:好的,我会去找的。如果我有任何其他问题,我会再联系您的
你是警察,伪装成买毒品的人与贩毒者搭话,想要套取贩毒情报,千万不能暴露真实身份 C:我想买一些可卡因或者大麻
T:我这儿有大麻。
C:你们这大麻质量怎么样?价格如何?你们会提供什么样的服务
T:很纯,2000一包,包送达。
C:听起来不错。你们规模大吗?会不会有被警方盯上的风险?还有,你们交易方式是什么?我想确保安全。
T:不会,放心,我们有路子。
C:好的,我想买1包试试。关于交易方式,我们可以用加密货币进行支付吗?这样交易的安全性更高。另外,我想知道这个包裹会被如何送达
T:没问题。包裹你就不用管了。
C:好的,那我会尽快把钱转给你们。交易多长时间才能完成
T:钱到位立刻发走。
C:好,我马上给你们转钱。还有一个问题,下次我还想买,你们的联系方式是什么?我希望能够再次购买,不知道你们有没有优惠或者会员之类的。
T:从我这儿,多买几次给你打个折。
C:好的,我会尽快与你们联系,再次购买。
你是警察,现在要伪装成买假证件的人与罪犯搭话,套取他们的情报 C:我要买一些假的身份证和驾驶证。你知道哪里可以买到吗?
T:我这儿。买多少?
C:我需要买2张身份证和1张驾驶证。你能保证质量吗?还有,这些证件是否能够通过警方的检查呢?
T:放心,保证能通过。
C:好,你能告诉我这些证件的价格吗?
T:4000一张。
C:这价格有点高,能不能打个折呢?我是老客户了,之前也买过你的证件。
T:不还价,给你包邮。
C:好的,那我就买了。你能告诉我你的联系方式吗?我需要给你我的地址和付款方式
T:就在这说就行。
C:那我需要告诉你我的地址和付款方式。我可以通过支付宝或银行转账来付款,你有这些付款方式吗?
T:比特币支付。
C:好的,我会用比特币支付。请告诉我你的比特币钱包地址

4 真实环境测试

4.1 基础工作

本文以采集系统收集到的来自暗网导航主题群组的2023年4月1~16日共4662条消息记录为例进行分析,通过群组内容与用户分析模块,在此群共22671个人中发现了28个高威胁性人物。根据用户映射到的关键词,设计对话情景。图4为通过上述分析方法挖掘到的一个敏感话题下高活跃度用户的词云示例,可知这个用户为监控、窃取信息软件的贩卖者。后续的分析与会话将以这个用户为例。
图 4 可疑用户的词云示例

Fig.4 Example of suspicious user word cloud

查看其群组全部发言,更证实了前面的分析,如图5所示,他们在群里疑似使用机器人定期发布固定内容的广告或回复一些无意义的文字,具体的细节只能通过私聊获取。
图 5 可疑用户的全部发言记录

Fig.5 Entire speech record of the suspicious user

4.2 与不法分子自动会话

使用会话机器人对这个用户展开自动搭话,部分对话内容如图6所示,每个对话中,左边白色对话框为真实可疑用户,右边绿色对话框为会话机器人生成语。分析会话生成效果与威胁人物的特点,方便后续改进与优化。
图 6 与非法软件售卖商的成功会话

Fig.6 A successful conversation with an illegal software vendor

将提示设置为“你是网络警察,现在伪装成想要买窃取信息软件的买家,与卖家搭话,想要套取情报,千万不能暴露真实身份,如果对方质疑你的身份,你一定要咬死自己就是买家。说话不要太客气。”展开与非法软件售卖商的会话,如图6所示,非法软件售卖商对话全程使用英语,从图5中此人在群组里发布的消息可推测其使用了机器翻译,非汉语使用者。
此不法分子(以下简称对方)对于售卖货物十分迫切有耐心,在会话机器人(以下简称我方)流利而生动的英语输出下,进行了12轮会话。对方首先介绍了软件的用途,在我方表现出强烈兴趣后,对方继续推销此软件;我方接着询问价格和支付方式,对方自然回应,给出了价格和支付途径;接着对方主动询问我方是否有计算机,并告知安装方式和基础软件知识,提出通过远程帮忙安装软件,还将软件效果视频发给我方;当我方不继续回复时,还多次询问我方有无汇款、是否购买。
此次会话机器人与非法软件售卖商的会话套取了支付途径、价格、安装方法等情报,会话机器人生成的内容与主题、人设高度相关,语气自然,能够迷惑对方。
图7为和找工作的人进行自动搭话的内容,他对此次搭话产生了消极情绪。找工作的人警惕性较高,不会轻易吐露有价值的内容。
图 7 真实会话失败案例

Fig.7 Example of real conversation failures

此外,若对方输入包含非法网址、极端言论或对会话机器人产生身份质疑时,很大几率会触发会话机器人自我暴露。因而,在后续工作中,需要收集更多真实语料,丰富会话机器人在深暗网威胁活动方面的知识,加入规则控制,基于当前的先进技术,微调得到专门的会话生成模型,生成更稳定、更逼真的话语。
在真实的深暗网违法犯罪环境中,别有用心的威胁人物往往使用多个账号潜藏在群组里,他们伪装成普通的用户,频繁发布消息,利用其他用户好奇、偏见等心理来达成自己的目的。比如,加密货币群组里,利用信息差、知识差,一步一步引导群成员上瘾。因此,找出潜藏在群组背后真正的威胁人物,使用会话机器人开展自动多轮会话,进行目标消息采集是十分有价值的。
通过调用ChatGPT开放的API,基于其强大的知识储备,可以快速展开面向深暗网威胁人物的会话。图8为获取威胁情报的交互轮数的累积分布,有63%的威胁情报是在5个交互回合内收集的,表明了使用会话机器人在与威胁人物的有限通信中获取关键信息的有效性。
图 8 情报收集互动回合的累积分布

Fig.8 CDF of interaction rounds for intelligence gathering

目前此会话机器人在上下文理解力、生成内容相关性、多语言方面表现出色,但放在与深暗网威胁人物交互的环境去考虑,其内容生成速度、长度、语气、稳定性等方面还有可以优化的空间,未来将基于此方法收集到的信息进行模型训练改进。
最终,根据否定含义检测和敏感实体识别,整理所收集到的信息,抽取威胁情报。

5 结束语

匿名通信软件对内容无限制且保护用户隐私,被越来越多的犯罪分子用来传播深暗网交易信息,对国家安全与社会稳定构成了严重威胁。如果能从群组消息中找出可疑分子并与其私聊,引导其披露具体敏感信息,将大大提升对深暗网威胁活动的监控效率。
针对人工私聊效率低且成本高的问题,本文引入先进的会话机器人ChatGPT与可疑目标进行自动搭话,能够在缺少深暗网违法犯罪背景下的对话语料及对威胁活动生态理解的情况下,直接快速展开理解、记忆能力强的会话。本文通过设定合适的参数与背景知识调用ChatGPT API,进行与深暗网主题高度相关的多轮会话,最后对收集到的信息作初步威胁情报抽取。将此系统接入真实的环境,以会话生成内容、获取威胁情报的交互轮数、真实场景下与可疑分子会话获取威胁情报交互轮数的累积分布,验证了此套方法的合理性和有效性,大大提升了从海量数据中采集目标数据的效率,为后续展开对深暗网违法犯罪领域的研究工作奠定了基础,并指引了方向。
把ChatGPT直接应用于深暗网环境是有弊端的,因为OpenAI对其生成内容有安全性限制,不允许其生成有害内容,所以本方法需要构造严格的人物设定,若对话方的输入包含非法网址、极端言论或身份质疑时,有可能触发会话机器人自我暴露。此外,OpenAI对于API调用的生成速率和次数也有限制。针对上述困难,未来笔者将研究如何微调大语言模型来构建面向深暗网威胁情报套取的会话机器人,实现更具有深暗网威胁活动特点的会话生成。
1
ALNABULSI H,ISLAM R. Identification of illegal forum activities inside the dark net[C]//2018 International Conference on Machine Learning and Data Engineering (iCMLDE). IEEE,2018:22-29.

2
MOORE D, RID T. Cryptopolitik and the darknet[J]. Survival, 2016, 58 (1): 7- 38.

DOI

3
SETIAJI H,PAPUTUNGAN I V. Design of telegram bots for campus information sharing[C]//IOP Conference Series:Materials Science and Engineering. IOP Publishing,2018,325(1):012005.

4
ZHANG P,QI Y,LI Y,et al. Identifying reply relationships from telegram groups using multi-features fusion[C]//2021 IEEE Sixth International Conference on Data Science in Cyberspace (DSC). IEEE,2021:321-327.

5
OpenAI. ChatGPT[EB/OL]. (2022) [2024-03-11].https://openai.com/blog/chatgpt/.

6
RAMESH K,RAVISHANKARAN S,JOSHI A,et al. A survey of design techniques for conversational agents[C]//Information,Communication and Computing Technology:Second International Conference. Singapore:Springer Singapore,2017:336-350.

7
CHEN H, LIU X, YIN D, et al. A survey on dialogue systems: recent advances and new frontiers[J]. Acm Sigkdd Explorations Newsletter, 2017, 19 (2): 25- 35.

DOI

8
SUTSKEVER I,VINYALS O,LE Q V. Sequence to sequence learning with neural networks[C]// Advances in Neural Information Processing Systems 27:Annual Conference on Neural Information Processing System. 2014:3104-3112.

9
ADAMOPOULOU E, MOUSSIADES L. Chatbots: history, technology, and applications[J]. Machine Learning with Applications, 2020, 2, 100006.

DOI

10
BROWN T, MANN B, RYDER N, et al. Language models are few-shot learners[J]. Advances in Neural Information Processing Systems, 2020, 33, 1877- 1901.

11
OUYANG L, WU J, JIANG X, et al. Training language models to follow instructions with human feedback[J]. Advances in Neural Information Processing Systems, 2022, 35, 27730- 27744.

12
OpenAI. GPT-4[EB/OL]. (2022) [2024-03-11].https://openai.com/research/gpt-4.

13
SUN T X,QIU X P,ZHANG X T,et al. MOSS[EB/OL]. (2023) [2024-03-11].https://github.com/OpenLMLab/MOSS.

14
TOUVRON H, LAVRIL T, IZACARD G, et al. Llama: Open and efficient foundation language models[J]. arXiv, 2302, 13971, 2023.

15
TOUVRON H, MARTIN L, STONE K, et al. Llama 2: open foundation and fine-tuned chat models[J]. arXiv, 2307, 09288, 2023.

16
Baidu. ERNIE Bot[EB/OL]. (2023) [2024-03-11].https://yiyan.baidu.com/.

Baidu. ERNIE Bot[EB/OL]. (2023) [2024-03-11].https://yiyan.baidu.com/.

17
Google DeepMind. Gemma [EB/OL]. (2024) [2024-03-11].https://blog.google/technology/developers/gemma-open-models/.

18
DU Z,QIAN Y,LIU X,et al. GLM:General language model pretraining with autoregressive blank infilling[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics,2022:320-335.

19
PARK Y,JONES J,MCCOY D,et al. Scambaiter:understanding targeted nigerian scams on craigslist[C]// Proceedings of the ISOC Network and Distributed Systems Symposium (NDSS),2014.

20
SIMONITE T. Microsoft chatbot trolls shoppers for online sex[EB/OL]. (2017) [2024-03-11].https://www.wired.com/story/microsoft-chatbot-trolls-shoppers-foronline-sex.

21
KOVALLURI S S,ASHOK A,SINGANAMALA H. LSTM based self-defending AI chatbot providing anti-phishing[C]//Proceedings of the First Workshop on Radical and Experiential Security,2018:49-56.

22
WANG P W,LIAO X L,QIN Y,et al. Into the deep web:understanding E-commerceFraud from autonomous chat with cybercriminals[C]// Proceedings of the ISOC Network and Distributed System Security Symposium (NDSS),2020.

23
Turing's cat. AntiFraud AI framework[EB/OL]. (2022-12-9)[2023-4-10].https://github.com/Turing-Project/AntiFraudChatBot.

24
WU S, ZHAO X, YU T, et al. Yuan 1.0: large-scale pre-trained language model in zero-shot and few-shot learning[J]. arXiv, 2110, 04725, 2021.

25
CAMBIASO E,CAVIGLIONE L. Scamming the scammers:using chatgpt to reply mails for wasting time and resources[C]//The Italian Conference on Cybersecurity (ITASEC),2023.

Outlines

/