语言普遍性:认知架构的映射

bengoertzel 发布于 2026-05-21 阅读 104

本文提出一个数学框架,结合形式语法理论、大规模类型学证据和持续学习架构,解释语言普遍性。

Image

一种新的数学框架,融合了语法理论、大规模类型学证据以及持续学习的架构。相关内容通过三篇博客文章和几篇技术论文(末尾附有链接)进行了阐述。

20 世纪 80 年代,当我第一次接触严肃的语言学理论时,统计语言分析仍处于边缘地带(尽管我确实对泽利格·哈里斯(Zellig Harris)在 20 世纪 60 年代于此方向上的开创性工作怀有美好记忆),当时的主流是乔姆斯基的普遍语法——据信在所有人类语言的深层都存在着某种语言模式,尽管在表层表现上千差万别。

自互联网和现代人工智能崛起以来,语言学已远离这种执念。事实证明,通过识别大型自然语言语料库中的表层统计模式,我们能够取得相当显著的进展——至少在搜索、问答、语言生成和翻译等实际任务上是如此,尽管在理解语言的内在运作原理方面并非如此。

然而,作为一个极其固执的人,我仍未放弃寻找跨不同语言的深层底层模式的旧想法。最近,在做了大量关于编程语言数学的工作之后,我的儿子扎尔(Zar)促使我思考这些工作如何具体应用于自然语言。这让我走向了一些有趣的方向,包括一个相当清晰的关于语言普遍现象(linguistic universal)的数学理论,它与近期涵盖人类语言多样性的实证结果紧密相连。

但最让我兴奋的并非语言学本身——而是这些语言模式所揭示的东西。

一旦你拥有了一份可信的、真正跨人类语言共有的清单,就可以反过来问:这个清单揭示了底层的什么认知架构?

我将在本系列的三篇博客文章中(以及在本篇末尾链接的更技术性的论文中)讨论的是……你瞧,我似乎已经为这个问题提出了一些相当有趣且具体的答案!

简而言之——经验证的语言普遍现象所展现的结构性特征,恰恰是类脑持续学习者为了正常运作所需要的结构性特征……实证与理论图景在中间点优雅地交汇。

这一切似乎也可能具有一些工程意义。本系列的第三篇文章将概述如何将这种“语言与认知普遍现象”机制作为 Transformer 神经网络的具体训练方案:语言普遍现象成为弱可观测的探针,用于探测我们希望网络学习的潜在因果结构;五种普遍类型中的每一种都映射到特定的架构约束或训练损失。这种思路是,通过这种方式训练的模型不仅更可解释——它应该比同尺寸的普通 Transformer 遗忘更少、剪枝更好、跨语言和领域的迁移更干净。因此,文章的大致脉络是:实证模式,然后是形式语法理论,接着是认知架构,然后是两者之间的范畴论桥梁,最后是构建它的一个方案。

实证锚点

促使我重新深入语言普遍现象这个奇特兔子洞的,是维克尔克(Verkerk)及其同事 2026 年的一项研究。他们从普遍语料库(Universals Archive)中选取了 191 条提出的蕴含普遍现象(implicational universal),将其与 Grambank 数据库中的特征进行匹配,并通过一个贝叶斯处理流程对整个清单进行了分析,该流程控制了谱系、地理和共同进化结构。

数字说明了一个清晰的故事。在忽略谱系和区域的朴素模型中,191 条普遍现象中有 174 条得到了支持。经过时空系统发育校正后,只剩下 89 条。经过共同进化过滤器后,有 60 条得到良好支持。但更有趣的是幸存者在各类别中的分布情况:

  • 层级普遍现象:30 条中有 24 条幸存——绝对是最强的一类。
  • 狭义语序普遍现象:65 条中有 24 条幸存——中等强度。
  • 广义语序普遍现象:72 条中有 8 条幸存——较弱。
  • 其他(杂项):24 条中有 4 条幸存——非常弱。

在幸存者中,层级性和狭义语序普遍现象在系统发育模型下显示出方向性信号:语言趋向和谐状态的情况多于偏离的情况。广义语序声称则没有显示出这种不对称性。

这种模式异常鲜明,不可能是噪声。什么样的数学结构会自然地产生这种轮廓——稳健的层级、部分结构化的语序、大多脆弱的跨模块声称,以及幸存者的方向性偏差?这个问题是我在此讨论一切的出发点……

关于语法空间的五个结论

在我几个月前写的一篇论文《形式化真实世界中的语言普遍现象》中,我建立了一个融合形式传统与实证传统的框架。该技术机制将语法视为可组合和置换的操作系统,识别通过选定的观察界面看起来相同的推导,并询问什么能在识别过程中幸存下来——我称之为语法的 TUG 核(TUG core)。普遍现象就是这些核的属性。

这种方法对语法采取了相当广泛的视角:我所应用的类型学要求记录逻辑形式、语音形式和形态学,这使得其语法核不同于仅使用逻辑形式区别的旧式生成语法理论家所导出的核。然而,像雷·杰肯多夫(Ray Jackendoff)这样的生成语法理论家几十年来一直以他们自己的方式采用这种广义视角。

观察到的实证模式非常有序,并促使我提出五个相当抽象和一般的论断。它们并非同一类陈述——有些是精确的定理,有些需要关于语言变化的明确假设,有些是统计设计原则——但它们每一个都是对报道数据的一种自然的形式回应。

C1. 层级普遍现象是闭包系统

层级共享一种累积结构:更稀有或更显著的标记特征只与它们下面更常见的特征一起出现。如果一种语言有第三人称与动词的一致,那么它也有第一和第二人称的一致;基南-康里(Keenan–Comrie)可及性层级以相同的方式运作。捕捉这一点的数学结构是闭包系统:包含某个特征的范式也必须包含该特征所蕴含的所有内容,并且良构状态是偏序集中的向下闭包区域。维克尔克等人关于层级普遍现象显示出向和谐状态定向漂移的发现,正是这幅图景的标志:闭包区域是语法空间中的一个吸引子,而不是成对相关性之间的巧合。

C2. 跨模块普遍现象需要中介

广义普遍现象试图链接跨语法模块的特征:句法特征与形态特征,语音特征与句法特征。这是最弱的实证类别。有一个清晰的数学原因:如果两个语法模块真正独立——一个模块中的操作可以与另一个模块中的操作置换而不改变可观察输出——那么整体语法就是它们的乘积。一旦有了乘积,任何跨越一个因子到另一个因子的非平凡蕴含都不能对整个乘积成立。其逆否命题是语言上有趣的论断:任何真正的广义普遍现象必须违反至少一个独立性假设,通常是通过一个中介者——格标记、论元结构消解、一致形态——它与两个模块共享资源。数据中广义普遍现象的脆弱性正是这类理论会预测的。

C3. 狭义语序普遍现象是相干律,而非原则

语序不是一个单一的全局中心语方向参数;也不是任意的。它是一个局部耦合选择的网络。SOV 语言倾向于后置介词、属格-名词、关系从句-名词、助动词-动词。SVO 和 VSO 语言倾向于相反的方向。完全采用一种模式的语言处于相干吸引子处;混合类型,如波斯语(SOV 但有前置介词),付出了相干代价但显然可能。自然模型是一个低能系统:每对语序选择都有一个偏好关系,它们之间有强有弱的拉力。真实语言聚集在低能配置中,语言变化偏向于向低能状态的漂移。该框架预测,前置词/后置词-名词的顺序——被维克尔克等人标记为参与最多支持的相关性——应该是网络中的枢纽。

C4. 普遍性是有等级的,而非二元的

“普遍现象与否”的二元词汇过于粗糙。“如果一种语言有双数,那么它也有复数”几乎从未被违反,表现得像一条无例外的原则。“如果一种语言是 SOV,那么它有后置介词”具有正面但有限的稳定性——大多数 SOV 语言是后置介词语言,但像波斯语这样的例外存在。“如果一种语言是动词后置的,那么它有丰富的体态形态”在校正后接近中性。一个二元裁决迫使这些情况进入同一个容器,而它们却处于一个连续体上非常不同的点。该论文提出一个单一的、从语言变化动力学导出的分级稳定性系数:它询问一个违反被推回满足状态的强度如何,与语言偏离的频率相比。

C5. 许多真正的普遍现象是上下文索引的

高度具体的普遍现象在实证上比笼统的普遍现象表现更好。这并非偶然:一个真正的局部定律在平均掉限定它的上下文时可能会变得不可见,甚至符号反转——统计上称为辛普森悖论。德语只有在从句中才是动词后置;在主句中,限定动词出现在第二位。笼统地说“德语是动词后置”会错误分类该语言。西班牙语和印地语中的差别宾语标记只有在对生命度或有定性有条件时才启动。一个真正普遍现象的形状通常是“如果一个名词短语或子句具有属性 X,那么在这种短语类型或域中它往往具有属性 Y”,而不是“所有具有 X 的语言在任何地方也都具有 Y”。

因此……这五个结论共同恢复了某种类似于经典原则与参数区别的东西,但具有更清晰的定义和分级成员关系。

原则是闭包定律和依赖拓扑——单一域内稳健的内部模式。

参数是外在化选择,其强度反映了相干压力。

广义跨模块声称通常较弱,因为语法因子化。

貌似失败的普遍现象往往是由汇总掩盖的上下文索引的局部定律。

这一切对我来说感觉非常自然和优雅——它既像语言又像认知,这引出了下一个情节转折……

双重问题:关于心智,这说明了什么?

这里有一个互补的方向,有点类似于萨丕尔-沃尔夫假说的对偶——该假说探讨你所说的特定语言如何塑造你特定的思维方式。一旦你拥有了一个可信的、真正跨人类语言共有的清单,其反面就是询问这些普遍现象揭示了底层的什么共同认知架构。语言形式不是独立存在的:每一种都对应一个语义框架,一种划分世界某部分的方式。因此,语言形式中一个稳健的普遍现象也间接地是关于产生和理解语言的认知机制中稳健普遍现象的证据。

引人注目的是,我语言学论文的五个结论几乎点对点地与我在一个完全独立的近期工作中论证的架构特征相吻合——这些特征是类脑持续学习者为了能够在一生中学习许多上下文而不发生灾难性遗忘所必需的。这两条研究路线是并行发展的,动机截然不同,却汇聚在相同的五个结构特征上。很酷,对吧?

因果编码与模块化持续学习

这种对应关系的认知侧以我称之为因果编码(causal coding)的概念为中心:一系列学习机制,它们明确地尝试将学习者的内部状态因子化为因果上有意义的模块,通过门控更新使得每个上下文只触及真正需要的模块,并修剪那些主要扰乱输入因子化过程的弥漫性路径。核心因果编码定理指出,当基于梯度的学习系统保持这种因子化时,不同上下文触发的梯度更新近似对易,并且学习一个新的上下文不会严重降低先前获得的能力。

有一个强有力的理论论证,这是防止灾难性遗忘的关键——这个问题困扰着现代主流人工智能系统:一旦它们被教了太多新东西,就会突然忘记大量旧东西。这个问题似乎是由反向传播学习算法的特定缺陷引起的,而该算法是大多数现代神经网络应用的核心。然而,在因果编码系统中,灾难性遗忘的程度受限于模块真实重叠的程度——当支持集不相交时,这个界限变为零。

Image

“层次贝叶斯因果模块学习”(Hierarchical Bayesian Causal Modular Learning)方案的高级示意图——其中不同的模块 N_i 包含因果模块化的微观结构,并以学习的方式聚合成适当的组合,以应对不同的任务或情境。使用模块性来表示因果结构,与根据经验发现的普遍现象中模块性在语言中的作用清晰对应。柱状输出的组合以应对情境,大致反映了语言单元的组合以形成适合情境的语言行动。

Image

在 HBCML 认知架构的 ColBac 实现中,单个皮质柱内部微观结构的粗略描绘。微观结构被定义为通过一种机制,促使内部神经连接采用模块化结构,代表该柱正在帮助解决的任务和情境的因果结构。这种机制促使靠近柱中心的神经元在情境之间进行更广泛的泛化,并在更专业化的实用性神经元与更通用的实用性神经元冗余时修剪它们。

我一直在实验一种称为 HBCML层次贝叶斯因果模块学习)的、在某种程度上生物学上更真实的因果编码实例,以及一个称为 ColBaC 的版本。它将皮质柱作为神经架构的基本单元,然后根据两个耦合的层次进行学习:一个稀疏的顶层控制器为每个上下文选择一小部分柱,以及每个柱内部的一个概率过程,区分可重用的因果结构与上下文特定的残余。关键的是,该架构不是均匀的。每个柱有一个受保护的硬核(更接近初级视觉皮层或体感桶状皮层的刻板组织),被具有可控刚度的适应性外壳包围(更接近前额叶皮层灵活征用的柱)。硬核在所有上下文中进行防御;外壳吸收局部适应;最外层外壳携带可丢弃的任务局部残余。

如果大脑实现了某种接近这个方向的东西——或者任何其他因果编码友好的人工智能架构——那么语言普遍现象应该是这种架构的结构指纹。事实上,五个语言学结论中的每一个读起来都完全像是你期望的签名——如果大脑确实遵循了这种架构的话。让我们逐一过一遍……细节很多,但很有趣……

层级作为受保护的基底

首先:人称、数、格和可及性层级的闭包系统结构,正是从外部看 HBCML 硬核的样子。这个层面的普遍现象之所以稳定,是因为它们由架构中最刻板、类似 V1 的部分承载——这部分在所有上下文中受到保护,在学习新领域时不会被重写。顺序追踪认知可及性(言语行为参与者比第三方更可及;主语比旁语更可及;单数比双数更基础),因为那些是内核所围绕的特权原语。累积的“如果你有较难的格,你也有较易的格”模式,是一个闭包组织的基底的签名,该基底不会被后来的学习撕毁。

跨模块因子化是两种场景下的同一个定理

其次:大多数语言普遍现象在语法模块间因子化的论点,在数学上与驱动因果编码的对易子界限是同类结果。如果两个子系统真正独立,则不能有非平凡蕴含跨越它们;跨系统依赖需要一个明确的中介者。在语言学论文中,这种因子化存在于语法空间;在因果编码论文中,它存在于持续学习者的参数空间。相同结构定理治理两者的事实并非偶然。

简单来说:如果语言背后的认知基底本身被组织为一个近似封装的模块系统——因为持续学习需要这样——那么在该基底上运行的语法就会继承这种模块性……而广义跨模块普遍现象的失败是直接后果。

确实打破因子化的中介者——格标记、论元结构消解——正是那些必须跨域交流的认知操作,因为它们同时绑定感知、注意力、因果推理和形式。用 HBCML 的话说,它们是大脑的桥梁柱。

相干压力看起来像一个稀疏路由网络

语序普遍现象的低挫折图景——许多局部一致性压力,没有单个全局参数——与因果编码风格的学习者组织其跨模块耦合的方式相匹配。在 HBCML 中,顶层控制器在稀疏、嘈杂的信号下路由许多柱;自然的稳态是一组相互拉扯的偏好,某些耦合强,某些弱,某些缺失,并且有一个稀疏的枢纽结构(语言情况下的前置词/后置词-名词顺序,或者其他认知领域中的类似物)。信念修正、社会推理、偏好形成、感知绑定都显示出这种架构,这正是我们期望的——如果它们都运行在相同类型的基底上。

分级稳定性镜像核-壳层级

用分级稳定性系数替代二元“支持或不支持”裁决的提议,直接映射到 HBCML 柱内部的径向结构。内部壳层(稳定,跨许多上下文巩固)具有非常高的稳定性;中间壳层承载半通用结构,具有中等稳定性;外层壳层承载上下文局部探索残余,稳定性低,并定期修剪。“如果一种语言有双数,那么它有复数”位于内部壳层。“如果一种语言是 SOV,那么它有后置介词”位于中间壳层。在时空系统发育校正下消失的虚假普遍现象位于外层壳层,在那里它们被不断覆盖。语言学论文提出了稳定性系数作为测量工具;大脑架构则将其作为皮质组织实际围绕的东西。

上下文索引认知是控制器的签名

真正的普遍现象通常限定于上下文——从句类型、短语类型、有定性配置、生命度级别——这一事实正是你所期望的——如果底层基底使用一个稀疏的顶层控制器为不同的上下文激活不同的柱子集。一个在从句中高度活跃但在主句中大部分被门控的柱,在语言层面会产生一个在从句中成立但在汇总下消失的概括。德语的 V2 情况并非谜团;它是上下文条件路由如何运作的一个小语言实例。这与框架语义学(菲尔莫尔)、力动态学(塔尔米)、意象图式(拉科夫和约翰逊)、原型理论(罗施)和概念空间(加登佛斯)汇合——所有这些都独立得出了结论:心智通过框架边界内的局部定律而非笼统的普遍原则进行推理。

未完待续……在本系列的下一篇文章中,我将解释这种对应关系如何以抽象和严谨的方式进行泛化,使其不仅仅关乎任何特定的神经或认知架构,而是反映了语言和认知领域之间的一般态射集合。

对于好奇和/或没有耐心的读者,本系列文章所依据的技术论文在此: 普遍语法的范畴理论 作为认知普遍现象的语言普遍现象 语言普遍现象与因果编码 语言普遍现象/因果编码引导的 Transformer 神经网络 (一个设计理念)柱状残差 Transformer(一个更疯狂的设计理念)

  • 原文链接: x.com/bengoertzel/status...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论