AI 遇见费曼
当年我在加州理工授课,常年守着一套自我检验法则:每学期开篇我都会自问,能不能把当下研究的核心,直白讲给本科新生听——这群年轻人头脑敏锐,却尚未被专业术语层层裹挟。倘若做不到,便证明我自身并未吃透本质。这无关谦逊,是最朴素、最硬核的真伪检验。
今日我试着拆解人工智能,刻意避开 Transformer、多头注意力、残差连接这类行业黑话,这类词汇对初学者毫无实质意义。只用最通俗的逻辑厘清三件事:AI 本质是什么?为何它看似"通晓万物"?它是否拥有真正的理解?
一切从一场简单猜词游戏说起。
设想一场无限重复的文字填空游戏。句子隐去末尾词汇,由你预判收尾,猜对得分;猜错则记下标准答案,继续下一轮。
"今天天气真___",你答"好",作答成立。
"她推开房门,看见一头___",你预判"猫",标准答案却是"老虎",你记下这个结果。
倘若日复一日持续十小时,全年往复,累计万亿轮次。每当预判出错,便记下正确文本;趁你休憩时,有人依照错题记录,微调你脑中负责预判文字的神经,让下次遇见同类句式时,预判准确率更高。
这便是大模型完整的训练逻辑,仅此而已,无任何玄奥附加。
关键疑问随之浮现:这套循环迭代催生的文本生成能力,是否等同于真正理解语言?亦或它只是极致精通文字预判?二者能混为一谈吗?
我曾在黑板写下一句贯穿一生的治学标尺:凡我无法亲手创造的事物,我便不曾真正理解。后世将其称作费曼原则。
人类亲手搭建了 AI:推导损失函数、设计梯度下降、搭建 GPU 算力集群、采集海量文本数据,整套流程由人类一步步构建。依照这套准则,我们理应完全吃透 AI。
可这里藏着一处极易忽略的陷阱。我们清晰掌握 AI 的训练流程,却无法解释它何以自发产生推理能力。训练目标自始至终只有一项——预判下一个字符,人类从未刻意注入逻辑、数学、语法、翻译规则,仅仅重复猜词迭代,逻辑推演、数理运算、多语言转换等能力便自动涌现。
由此分出两层边界:人类创造了训练运行机制,却不曾主动设计推理能力;这份推演能力从文字预判循环中自发浮现,其涌现底层逻辑,我们至今未能完整拆解。
以我的标准评判:我们吃透了训练的数学框架,却从未触及何为真正的"理解"。
聊聊曼哈顿计划时期的亲身经历。彼时我们研制原子弹,链式反应、临界质量、中子截面整套物理原理推演完备,全部经过反复测算,所有人笃定爆炸必然发生。可无人能精准预判爆炸规模。众人围坐反复核对演算数据,等待引爆瞬间,火光亮度远超全部预估,震撼远超理论纸面计算。
单一物理定律清晰可控,但庞大复杂系统叠加后的涌现行为,永远会突破单一公式的预测边界。
当下 AI 正处在完全相同的阶段。梯度下降、反向传播、损失函数每一项基础数学原理都清晰完备,组件逻辑无任何模糊。可万亿参数、万亿文本样本、数月持续训练叠加之后,模型诞生的推理、创作、翻译、诗文生成能力,并非人类预先设计的功能,而是系统自主涌现的产物。
我们精通每一个独立组件,却无法解释:零散数学模块拼接后,为何会诞生近似人类理解的外在表现。
1974 年加州理工毕业典礼,我提出"伪仪式科学"的概念。二战期间南太平洋岛民目睹军机降落,源源不断卸下物资。战争结束后飞机不再到访,原住民复刻全套外在场景:竹制跑道、木质仿真塔台、火把信号灯,所有表象复刻得分毫不差,却再也等不到运输机与物资。
伪科学的核心特征:完整复刻科学外在流程,规范撰写论文、设计对照实验、规范引用文献,唯独丢失科学最核心的底色——向内绝对诚实,绝不自我欺骗。
由此抛出尖锐追问:AI 的语言表达,是否正是一种"伪理解"?它能完整输出温情告白、共情抚慰、深度思辨的成套语句,可它体内不存在与文字对应的真实体验。它看似全然通透,只是精准复刻了"理解"的全部外在表达范式。
我不武断判定它纯粹模仿,也不笃定它拥有真实认知。客观事实是:当下无人能给出严谨完备的论证。无论科技企业从业者,或是极端批判者,都只会抛出"显然如此""显然并非"的片面断言。而在物理研究中,"显然"从来算不上严谨论证,只是未经实验验证的粗浅假设。
倘若我仍在世,要判别 AI 是否具备真实理解,绝不会依靠标准化行业基准测试。标准化选择题只是人类预设的纸面考卷,算不上真正的科学实验。我会设计模型训练数据中从未出现过的全新认知任务,是人类也未曾广泛攻克的全新难题。
举两类真实检验思路:
其一,交付一段代码,内置从未出现过的新型并发内存泄漏缺陷,并非简单拼写、逻辑漏洞,要求模型定位、拆解底层成因。这绝非基础代码补全,是直面全新未知故障的深度推演。
其二,抛出当下物理学未解决的质量层级难题,不提供教科书标准答案,要求模型自主提出一套自洽、可通过实验验证的全新假说,而非复述前人已有的理论。
以当下模型能力判断,它们尚且无法完成。倘若未来某一代 AI 能够独立完成,即便假说最终被证伪,完整推演逻辑自洽,我才会正视它的认知能力。真正的理解从不是答尽已知问题,而是自主提出全新疑问。
我常说,比起一堆不容质疑的标准答案,我更偏爱无法作答的开放问题。
AI 恰好走向另一个极端,任何提问都能生成完整答复。这本身就是警示信号:要么它处理的问题过于浅显,要么它的输出本质不是思考后的作答,只是基于统计的文字采样。
我穷尽毕生钻研量子电动力学,整套理论计算精度能匹配小数点后十一位实验数据,可直至人生终点,我也从未宣称自己彻底读懂量子力学。我吃透整套数学运算,却无法说清微观粒子交互的底层本质。
AI 如今处境与之相似:人类掌握完整训练数学、可量化的评测指标,却无法定性它的内在运行本质。它是自主思考,或是一套极致复杂的统计采样系统?至今没有定论。
但这份悬而未决的疑问本身极具价值,计算机科学与物理学之间长久隔绝的壁垒,正因 AI 彻底崩塌。