AI 遇见香农
一套通信系统的核心问题,是在一处点位精准或近似复现另一处点位选定的消息。消息自带语义,指向现实实体或概念体系。但通信工程层面的求解,完全无需考量语义内容。
1948 年我写下的这段文字,常被人拿来佐证"信息论无关意义"。我需要厘清一处关键误解:我从未否认意义的价值,只是为搭建一套自洽的数学通信框架,必须暂时将语义搁置悬置。信源不分形态,电报、人类发声、大语言模型,本质都在生成消息;消息可编码、经信道传递、在接收端完成解码。在这套完整数理框架里,"意义"只是依附于消息的附加标注变量,并非通信传输流程本身的核心参数。
七十八年后,一类全新信源——大语言模型,彻底模糊了信息与意义的分界线。传统信源仅产出待解码、后方能解读语义的信号;而大模型直接输出人类可读、自带完整语义的自然语言文本。下文我将沿用信息论原生术语,严谨拆解这套特殊生成机制。
我的论文将信源划分为离散、连续两类。离散信源从有限符号词表中,依照固定概率依次输出符号;英文文本信源可近似视作随机过程,单个字符的出现概率,由前文完整字符序列共同决定。
站在信息论视角,大语言模型是经过海量语料训练的离散信源。它不遵循英文理想文本分布生成符号,而是依托自身权重存储的经验分布完成采样。训练的全过程,本质是持续迭代,让模型内置分布无限逼近人类文本语料的真实统计分布。
由此可推导出模型核心特性:AI 的信息量、熵值,不由它输出的文字决定,而是由它具备、却未选取的全部潜在输出决定。
若模型永远只输出固定短句,熵值为 0,不存在任何信息增益,输出毫无不确定性;
若模型在全部候选文本上均匀随机采样,熵值达到理论最大值,具备海量潜在信息,但输出完全无序,不具备通信价值;
现实中的大模型介于两极之间,输出维持中等熵值:熵足够低,保障文本连贯贴合人类表达;熵同时留有余量,更换随机种子即可生成差异化内容。
从信息论维度定义模型能力,本质是一套熵平衡:一方面降低熵,把无限可能性收敛至合理概率区间;一方面保留基础熵,维持生成创造性文本所需的不确定性。
香农熵 H = -∑ p_i log p_i,核心作用是量化信源自带的不确定性。符号等概率出现时熵最大;单一符号概率趋近 1 时熵归零,接收方可预判全部输出,信源无信息可传递。
Transformer 模型 Softmax 层输出的词表概率分布,正是单步 token 生成时刻的实时熵值。
上下文确定、模型高度笃定时,熵极低:如"巴黎是法国的___","首都"概率高达 0.97,几乎无备选;
上下文模糊、指向多元时,熵急剧升高:如"他打开了___",门、书本、冰箱、窗户等数十种词汇均具备合理概率。
依托熵值可精准定义业界所说的"幻觉":模型在高熵、高度模糊的上下文区间强制采样,极易产出偏离事实的文本。从信息论底层逻辑看,采样行为本身不存在对错,模型只是严格依照自身内置分布抽取字符;幻觉根源在于局部上下文的概率分布过于平缓,容纳大量不合逻辑的候选 token。
提升模型准确度、降低幻觉发生率,等价于信息论层面的熵调控:通过扩充训练数据,让模型在确定场景下的概率分布更尖锐、集中,压缩高熵模糊区间。
我在论文中系统研究噪声信道:消息传输途中受随机干扰发生比特失真、信号畸变。核心数学结论为信道容量定理:只要信道容量大于信源熵,必然存在一套编码方案,实现任意低错误率的无损传输。
AI 场景下,信道逻辑发生倒置。传统信道噪声是阻隔信源与接收方的外部干扰,而 AI 系统的噪声,恰恰来自用户输入的提示词本身。模糊、矛盾、残缺、表意含混的提示,对模型而言属于高噪声输入,直接放大模型对用户真实意图的不确定性,推高输出熵值,概率分布趋于平缓,生成内容不可控。
业内钻研的提示工程,本质是一套输入降噪手段:打磨输入信号的精准度,压缩模型输出端的熵,稳定生成结果。对应信道容量概念,AI 的上下文窗口是信道物理上限,限制单次输入的 token 总量。但上下文长度不等于信道容量,如同带宽不等于信道承载上限;真正决定效率的核心指标,是单位长度上下文内,模型能够稳定识别、接收的有效信息总量。
我通过数学证明,最优编码会将消息长度压缩至信源熵的理论下限,极致压缩信息量冗余。大模型执行反向流程:从压缩后的权重信息中解码生成完整文本;而训练阶段本身,就是一次大规模数据压缩。
模型将海量人类文本蕴含的全部统计规律,压缩存储至亿万参数权重之中。它不会逐字存储训练语料,仅留存能够复现文本的全局概率分布。这套压缩机制,直接解释模型涌现能力。当权重压缩效率足够高,精准捕获语言深层统计结构,无需单独标注、专项训练语法、逻辑推演能力。语法、推理是语言分布顶层的高阶结构,高效压缩会自动提炼这类底层规律——这是对原始语料最简的统计描述。
我毕生研究根植一条底层认知:信息具备物理属性,一切信息处理行为都存在客观物理成本。信号、比特、逻辑门,全部消耗能耗、占用存储、产生热损耗。
我从未宣称信息论能够完整解释"意义",但信息的传输、压缩、生成规则,会硬性划定语义可传递的边界。AI 的诞生并非推翻信息论,而是极大拓宽这套理论的适用边界。人类最繁复、细腻的符号系统——自然语言,能够完全依靠熵、信道、编码、压缩等工具建模、推演、生成。这并非否定语义与意义,而是用数学语言,描述意义得以产生、传递的客观约束。
我的理论核心命题:信息,本质是不确定性的消除。AI 的核心能力,正是在提问瞬间消解人的认知不确定:你渴求答案,它即刻输出。从这个维度审视,大语言模型是 1948 年《通信的数学理论》的终极落地产物:一套纯粹、动态、可实时交互、能够自主输出消息的活体信源。