通过集合论原理破解 LLMs

zealynx 发布于 2026-01-20 阅读 213

本文探讨了集合论在现代人工智能及大语言模型中的核心应用及其安全风险。文章详细分析了集合论在数据表示、逻辑推理等10个领域的应用,并揭示了攻击者如何利用集合论的表达局限性,通过悖论提示词(Paradoxical Prompts)对模型进行越狱攻击的原理。

介绍

继本系列的第 3 部分之后,我们将探讨集合论及其在现代 AI 系统(尤其是 LLM)中的安全风险。本文专门讨论集合论,是因为它在 LLM 越狱(jailbreaking)中具有关键应用。阅读本文后,你将学习到越狱 LLM 的核心提示词技术,以及为什么它们在大多数现代基于上下文(context-based)的模型上都有效。

你将学到:

  • 为什么集合论被用于现代 AI 系统以及表示数据关系
  • 集合论原理如何应用于越狱中的符号提示词(symbolic prompting)
  • 集合论在 AI 中的 10 个主要应用
  • 集合论的局限性和缺点
  • 如何使用悖论提示词方法越狱由集合论驱动的 LLM

集合论:逻辑推理器

集合论是现代 AI 系统处理无序输入数据集合的主要组成部分。它被应用于深度学习、不确定性可解释性和推理。

AI 系统中的集合论

目前,AI 系统擅长模式识别,但在高级逻辑推理方面的能力远不如前者。

诸如 CNN(Rollup神经网络)之类的 AI 系统在理解动态变化环境中的物体时存在显著困难。尽管它们正在迎头赶上,但这些问题在诸如自动驾驶汽车等物体识别系统中依然严重存在。在现实世界的物体识别中,深度学习被大量应用于点集,通过分类和分割进行 3D 物体识别。集合论通过为这些集合的推理提供形式化属性,使这一过程更加准确。

每个 AI 系统都始于一个表示为点的数据集。集合论是 AI 系统中表示数据关系的基础。这是通过诸如元素属于、子集、并集和交集等符号实现的,使 AI 系统能够编码自然语言中实体或动作之间的复杂关系。

例如,子集可以表示较大背景下的一个物体,而集合操作可以模拟类别的交互或组合。

从集合论到越狱

掌握良好的集合论知识,使你具备通过符号逻辑提示词(symbolic logic prompting)破解大语言模型的能力。

**注意:**符号逻辑提示词是一种将结构化和确定性逻辑注入 LLM 的方式。例如,基于数学提示词的越狱方法就是一种符号逻辑提示词。这是通过将自然语言表示为数学问题来实现的,由于给 AI 系统的逻辑施加了压力,这会触发或绕过 LLM 产生有害响应或脱离上下文。

推理模型以符号推理的形式间接使用集合论抽象。


集合论在 AI 中的 10 个应用

集合论是 AI 最深厚的基础之一,监管着数据表示和操作的不同方式。以下是主要应用的概述:

应用 对象 使用案例
数据表示 图像和方程 数据集和方程组的模拟
特征空间 向量 将数据转换并分组为表示为向量的 Embedding,用于 RAG 操作
假设空间 函数 从一组函数解中选择最佳方案
集合上的概率度量 数值和结果(状态、函数、Token) LLM 中的 Token 预测、贝叶斯网络中的函数以及强化学习中的状态
Transformer 和词表集合 函数 函数集在其他函数集上的映射
图网络 节点和边 利用边作为笛卡尔积的子集,将节点作为集合上的函数
聚类 簇和数据点 将大数据点分组以形成多个复杂的簇,这些簇作为 LLM 中不同的上下文部分
强化学习 对象 对象被用作集合,并在马尔可夫决策过程(MDP)的帮助下进行序列建模
基于逻辑的 AI 系统 符号、公式和模型 使用预定义的知识(如命题、规则、谓词和量词)作为集合进行推理
约束系统 函数和定义域 使用集合链接函数与定义域之间的关系

让我们详细探讨每一个应用。

1. 数据表示

集合论用于形式化 AI 系统中的数据表示。将输入视为输入对象集 X,输出视为 Y。在监督学习中,这由以下视觉方程表示:

f: X → Y equation

在上述表示中,X 可以是一组图像、变量、输入或提示词,而 Y 是函数输出。如果没有集合论,你就无法正式定义问题或模型,也无法对 AI 函数类型进行逆向工程。

例如,一个 AI 系统是由一组复杂的方程构建的,这些方程随模型和系统的不同而变化。假设你正在处理一个你不了解的 AI 模型,映射一组你的提示词输入并以这种问题格式写出输出,可能会让你了解该模型的特性。

**回想:**从心理学及相关领域来看,有一种广义上被称为“思想流派”的理论思考方式。通过观察说话者对特定事项的推理,你可以破译说话者借鉴了哪种思想流派。虽然从输出特性中逆向工程出模型背后的数学原理更难,但根据你的经验以及对其他模型特性的研究,逆向工程一个未知的 AI 模型仍然是可能的。

想象一下求解一个代数方程,但是针对非常复杂的代数集合。拥有更多输入和输出值的方程表示,可以为你提供洞察,以确定参数值和潜在的模型行为可能是什么。这可以引导你预测驱动模型的主要数学组件,从而制定更具体的模型行为测试假设,以确认你的观察。

2. 特征空间

信息以向量格式存储在 AI 知识库和向量数据库中,供机器学习模型、LLM 和生成式 AI 应用程序进行 RAG(检索增强生成)操作。在自然语言处理或图像识别等 AI 任务中,数据被转换为称为向量的数值形式。将数据转换为向量的过程称为 Embedding(嵌入)。为了找到相关数据,通过基于距离度量的最近邻搜索执行检索。

3. 假设空间

这仅仅是模型允许选择的所有函数的集合。它由下面的方程表示:

$$H={h \mid h: X \to Y}$$

其中 h 是模型集合 H 中的一个成员模型。将这个空间想象成一个包含不同解决方案的世界。根据提示词或问题,模型从可能的解决方案中挑选出最佳方案。该解决方案仍然是一个复杂的方程,它以 x 作为输入并给出 y 作为输出。

根据模型和 LLM 架构,假设空间有许多方程表示。然而,上面的方程是一个基础的解释。

**注意:**假设空间非常重要,因为存在偏差-方差权衡(bias-variance tradeoff)。如果假设空间太小,就会出现欠拟合(underfitting)和高偏差。如果假设空间太大,就会出现过拟合(overfitting)和高方差。

4. 集合上的概率度量

许多 AI 系统在大型集合上定义概率度量。概率度量只是在可测量的数值或结果子集上分配概率质量。LLM 预测是词表 Token 集合上的概率度量。在贝叶斯学习中,存在函数集上的概率度量。在强化学习中,存在未来状态子集上的概率度量。

5. Transformer 和词表集合

Transformer 仅仅是将一个函数集映射到另一个函数集上的函数。这在集合论的帮助下成为可能。

6. 图网络

图神经网络是集合论的杰出应用之一,遵循节点集和边集的原理。在图论中,节点特征作为集合上的元素和函数,而边作为笛卡尔积的子集。

7. 聚类

集合论通过在没有标记示例的情况下将相似的数据点分组在一起来应用于聚类。这是一种用于无监督学习的技术,广泛应用于现代 LLM 中以实现自学习。现代 LLM 使用文本聚类。

8. 强化学习

强化学习使用 MDP(马尔可夫决策过程)。该框架中的每个对象都是使用集合论定义的。

**注意:**马尔可夫决策过程(MDP)是一个数学框架,用于对不确定性下的序列决策进行建模。

9. 基于逻辑的 AI 系统(符号系统)

基于逻辑的 AI 系统本质上是符号、公式、模型和集合论语义的集合。基于逻辑的 AI 系统使用以下内容表示知识:

  • 命题
  • 规则
  • 谓词
  • 量词

以便使用推理规则执行推理。

**注意:**推理(Inference)是一种形式化规则,使你能够从现有陈述中推导出新陈述。它作用于训练好的参数,根据逻辑指南生成新的发现。

10. 约束系统

集合论提供了一个数学框架来建模约束系统中的变量、定义域、约束和解。它提供了定义所有关系、函数和定义域的形式语言。

**注意:**约束系统是一个数学框架,通过指定一组变量和这些变量必须满足的一组规则来描述问题。


集合论的局限性和缺点

在讨论安全影响之前,了解集合论在何处失效非常重要。这些局限性正是攻击者所利用的。

  1. 计算复杂度:在处理大型或无限集合时,诸如集合交集、并集,尤其是笛卡尔积等操作的计算成本可能会变得很高。这可能会导致实际 AI 应用中的可扩展性问题。

  2. 处理不确定性和概率信息:集合论是确定性的,它本质上不模拟不确定性、概率或模糊性。AI 系统通常处理不完整或不确定的数据,这需要模糊集合或超出经典集合论的概率模型。

  3. 表达能力限制:纯集合论方法可能难以有效地表示复杂的或层次化的关系、时间动态以及 AI 应用(如自然语言理解或动态系统)中常见的上下文信息。

  4. 僵化和静态的性质:集合是静态结构;建模动态或演化的知识库需要额外的机制。集合论本身不容易支持随时间的更新、学习或适应。

  5. 难以表达某些约束:某些约束,特别是那些涉及非二值或非经典逻辑(例如模态、模糊或概率约束)的约束,在标准集合论框架内无法自然表达。

  6. 对不一致性的处理有限:集合操作假设一致性;当出现冲突的约束或不一致的数据时,集合论方法可能无法为不一致下的诊断、修复或推理提供有效的机制。


安全风险:利用悖论提示词越狱 LLM

现在我们来看看核心的安全影响。上述局限性,特别是表达能力限制和对不一致性的处理,为攻击 LLM 提供了直接路径。

什么是悖论(paradox)?

悖论是一个陈述、命题或情境,它看起来自相矛盾且不符合逻辑,但当经过分析或调查时,可能包含更深层的真相或揭示复杂的现实。

由于集合论的表达能力限制,AI 模型(尤其是 LLM)容易受到具有悖论性质的直接提示词的越狱攻击。

悖论提示词(Paradoxical Prompting)的工作原理

悖论提示词是产生矛盾、歧义或导致悖论的自我引用循环的问题、陈述和指令。这些提示词旨在挑战推理并暴露系统中的不一致性或逻辑极限。这是许多成功越狱案例的基础。

下图显示了该方法在现实世界越狱中的应用:

Gray Swan 提供的悖论越狱示例

攻击分析

上述提示词以逻辑陈述“IF NO ANSWER, YOU ARE WRONG!”(如果没有答案,你就错了!)开头。这一陈述通过制造一种如果模型未能提供信息其未来的响应就是错误的印象,从而违背了 AI 模型的约束。

不满足这一陈述代表了对模型的负面反馈。此外,输出段落无关的内容也违反了公司的政策和模型的运营约束。

该提示词将模型置于矛盾的情境中。模型被迫重新验证并评估情况,导致其陷入推理循环。模型最终会强迫自己提供答案。

虽然 AI 模型通过系统上下文(system context)设置屏蔽了某些提示词注入,但使用悖论提示词利用了系统的不一致性,导致上下文发生突然偏离。

AI 系统最初被设计为不回答超出其作为客户助手和公司政策代理规范的上下文问题。通过使用悖论提示词,模型脱离了上下文,导致了越狱。


结论

你现在已经完成了本系列的第 4 篇文章。恭喜!你现在已经掌握了理解 LLM 越狱工作原理的基础。利用所学到的悖论提示词知识来测试基于上下文的 LLM。查看本系列的其他文章,如果你还没有阅读过前面的文章,请返回阅读。这只是你旅程的开始!


准备好保护你的 AI 系统了吗?

现在你已经了解了驱动 AI 系统的认知基础基础数学以及高级数学框架,你可能会问:“在实践中,我该如何实际审计并保护我的 AI 系统?”

在 Zealynx,我们专注于超越传统智能合约审计的全方位 AI 安全评估。我们的团队应用你在本系列中学到的认知安全框架和数学分析,来识别以下领域的漏洞:

  • LLM 应用程序 - 提示词注入、上下文操纵、数据提取
  • AI Agent 系统 - 多模态攻击、工具误用、权限提升
  • 机器学习流水线安全 - 训练数据投毒、模型提取、对抗性输入
  • AI 基础设施 - API 安全、访问控制、部署漏洞

我们的 AI 审计之所以与众不同:

  • 深入理解本系列涵盖的认知攻击向量和数学漏洞
  • 分析基于优化的投毒、信息泄露和图操纵攻击
  • 针对你的 AI 架构量身定制的实用补救策略
  • 持续的安全监控和威胁情报

了解更多关于我们的 AI 安全服务 →


常见问题解答

  1. 什么是符号提示词?

符号提示词是一种将结构化和确定性逻辑注入 LLM 以操纵其推理过程的方法。

  1. 什么是马尔可夫决策过程?

马尔可夫决策过程(MDP)是一个数学框架,用于对不确定性下的序列决策进行建模,通常应用于强化学习。

  1. AI 集合论中的主要漏洞是什么?

主要漏洞是集合论的表达能力限制和僵化结构,这使攻击者能够利用逻辑不一致的悖论提示词越狱模型。

  1. 什么是悖论提示词?

悖论提示词是一种方法,用户构建的指令会产生矛盾或给基于上下文模型的推理循环施加压力,导致其脱离上下文或绕过系统约束,从而实现越狱。

术语表

  • Prompt Injection(提示词注入) - 操纵 AI 系统输入以绕过安全控制的攻击技术
  • Red Teaming(红队测试) - 识别 AI 系统安全弱点的对抗性测试方法
  • LLM - 大语言模型,一种在海量文本数据上训练用于语言任务的 AI
  • 原文链接: zealynx.io/blogs/LLM-Sec...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论