Elea Notes.

经典

计算机器与智能

图灵没有定义"思考",也没给出通过与否的判据。他把一个无法回答的问题换成一个可操作的问题,然后花近一半篇幅逐一处理九种反驳——包括一种今天的教材都不愿重印的。

作者
A. M. Turing(1950)
校验
sha256:3cd7c57944b7b53f18fb2a7c014fe2367f3576696a1d024c840151459da2f24e
底本为 UMBC 镜像 PDF(22 页,91,972 字节,OCR 自 Mind 原刊)。全文英文引文逐条按此底本校对。 该 OCR 有少量字符级瑕疵(如 f/I 混淆、"progratiirne"),凡引用处均已避开受损片段。 上标在抽取中丢失:底本的 109 即原刊的 10 的 9 次方。

怎么读这篇

这篇按原文分节走:每节先给一句话主旨,再逐段讲原文在说什么、 为什么这么写。术语和公式的解释放在正文右侧的边注里,读到哪看到哪。 每节末尾有一道自测题——答不出就说明那节没读懂,回头再看一遍比往下读划算。

适合谁读:高中生起。不需要数学或编程基础。真正的门槛是耐心——图灵的论证方式是穷举反驳,读起来像看一个人独自下完一整盘棋。

英文原文怎么查词:引文块保持整段可选中,任何划词翻译工具都能直接用 (iOS Safari 长按选词后选「查询」,桌面端可用沙拉查词一类扩展)。 本站只解释术语——像 proof-of-work、Merkle root 这种通用词典给不出 本文特定含义的词,会链到站内词条;普通生词交给你自己的词典更靠得住。

哪里真的难,不糊弄你

  • 第 1 节的模仿游戏原始设定是三人游戏、判断男女,机器是第二步才替换 A 的角色。这个双层结构在传播中几乎总被简化掉,而它决定了这个测验测的到底是什么。
  • 第 5 节的通用性论证:数字计算机可以模拟任何离散状态机。这是图灵 1936 年那篇的结论在这里被当作已知前提使用。
  • 第 6 节第 3 条数学反驳引用了哥德尔不完备定理。图灵的回应不是反驳定理,而是指出它同样适用于人——这一步很容易读漏。
  • 那个著名预测有三个参数:五十年、10⁹ 存储、70% 识别率。三者是一个复合命题,拆开单独引用会失真。

读之前:这篇论文的体裁

二十八页,没有一个公式,没有一张表,没有实验数据。它是一篇哲学论文,用的是哲学的方法:提出一个论题,然后穷举反对意见,逐一应对。

它的历史地位常被误述,所以先把三件事说清楚:

  • 图灵没有把这个测验叫做”图灵测验”。这个名字是后人给的。原文的名字是 the imitation game(模仿游戏)。
  • 图灵没有给出任何通过标准。他给的是一个五十年后的经验预测,不是一条判据。这两者的区别在本文第 6 节详述。
  • 图灵没有主张这个测验定义了智能。他明确说原来那个问题”不值得讨论”,换成新问题是为了让讨论可以进行下去。

如果你只从二手材料听说过”图灵测验”,这篇会推翻你至少两个印象。

1. The Imitation Game:三个人,不是两个人

开篇第一句:

I propose to consider the question, “Can machines think?”

我提议考虑这样一个问题:“机器能思考吗?”

然后他立刻拒绝了回答它。因为要回答就得先定义 machine 和 think,而定义会陷入词义之争。他的办法是换一个问题。

原始设定是这样的:

It is played with three people, a man (A), a woman (B), and an interrogator (C) who may be of either sex.

这个游戏由三个人来玩:一个男人(A)、一个女人(B),以及一位性别不限的审问者(C)。

注意这一步:最初的游戏里没有机器。三个人,A 是男人,B 是女人,C 是审问者。C 与 A、B 通过打字交流,任务是判断谁是男谁是女。而 A 的目标是让 C 判断错误,B 的目标是帮助 C 判断正确。

机器是在第二步才进场的:

We now ask the question, “What will happen when a machine takes the part of A in this game?” Will the interrogator decide wrongly as often when the game is played like this as he does when the game is played between a man and a woman?

现在我们问这个问题:当一台机器来扮演 A 的角色时,会发生什么?审问者判断错误的频率,会和这个游戏在一男一女之间进行时一样高吗?

这个替换带来一个后果,图灵自己点了出来:

The new problem has the advantage of drawing a fairly sharp line between the physical and the intellectual capacities of a man.

这个新问题的好处在于,它在人的体能智能之间划出了一条相当清晰的界线。

打字这个界面把外形、声音、动作全部隔离掉了。机器不需要长得像人,只需要答得像。这是一个刻意的窄化。

图灵还回答了”这种问答形式够不够宽”这个疑虑:

The question and answer method seems to be suitable for introducing almost any one of the fields of human endeavour that we wish to include.

这种一问一答的方式,似乎适合把我们想纳入的几乎任何一个人类活动领域都引进来。

自测原始模仿游戏里,审问者要判断的是什么?

判断谁是男人、谁是女人——不是判断谁是机器。机器的角色是接替那个”假装女人的男人”(A),衡量标准是它骗过审问者的频率是否不低于人类男性做同一件事的频率。

4-5. Digital Computers:为什么只讨论数字计算机就够了

第 4 节介绍数字计算机的三部分:store(存储)、executive unit(运算单元)、control(控制)。1950 年这些词还需要解释,图灵用的类比是办公职员和纸笔。

第 5 节是关键的收缩步骤。图灵论证数字计算机是离散状态机,而任何离散状态机的行为都可以被数字计算机模拟。所以:

This special property of digital computers, that they can mimic any discrete-state machine, is described by saying that they are universal machines.

数字计算机这一特殊性质——它们能模仿任何离散状态机——被表述为:它们是通用机器。

这一步把问题从”某台机器能不能思考”收窄成”数字计算机能不能思考”——因为如果任何离散状态机都能被数字计算机模拟,那么讨论其他构造方式就没有额外收益。

于是原来那个问题被替换成一个具体得多的问题:

Let us fix our attention on one particular digital computer C. Is it true that by modifying this computer to have an adequate storage, suitably increasing its speed of action, and providing it with an appropriate programme, C can be made to play satisfactorily the part of A in the imitation game, the part of B being taken by a man?

让我们把注意力固定在某一台特定的数字计算机 C 上。是否只要改造它、使其拥有足够的存储、适当提高它的运行速度、并为它提供一个合适的程序,C 就能令人满意地扮演模仿游戏里 A 的角色(而 B 由一个人来扮演)?

6. 那个被反复错引的预测

这是全文被引用最多、也被拆解得最不完整的一段。完整的句子是:

I believe that in about fifty years’ time it will be possible, to programme computers, with a storage capacity of about 10⁹, to make them play the imitation game so well that an average interrogator will not have more than 70 per cent chance of making the right identification after five minutes of questioning.

我相信,大约五十年之后,就有可能为存储容量约 10⁹ 的计算机编写程序,使它们把模仿游戏玩得足够好——让一个普通水平的审问者在五分钟提问之后,正确识别的概率不超过 70%

四个条件是一个整体:五十年约 10⁹ 存储平均水平的审问者五分钟提问、正确识别率不超过 70%

紧接着的下一句,才是他对原问题的真正态度:

The original question, “Can machines think?” I believe to be too meaningless to deserve discussion.

我认为,最初那个问题——“机器能思考吗?“——太没有意义,不值得讨论

自测图灵的五十年预测,预测的对象是什么?

不是”机器会通过测验”,而是一个复合的经验命题:约 10⁹ 存储容量的计算机,能让一个普通审问者在五分钟提问后的正确识别率降到 70% 以下。同时他还预测了一件非技术的事——人们谈论”机器思考”时不再会被反驳。

6(续). 九种反驳:论文真正的主体

这一节占全文近一半篇幅。图灵列出九种反对意见并逐一应对。完整清单如下——注意第 9 个,它在今天的教材里几乎总被删掉:

#反驳图灵的回应要点
1The Theological Objection(神学)思考是灵魂的功能,上帝只赋予人类。图灵答:这限制了上帝的全能;造机器不比生孩子更僭越
2The “Heads in the Sand” Objection(把头埋进沙里)机器思考的后果太可怕,希望它不可能。图灵直接指出这不是论证,是安慰
3The Mathematical Objection(数学)引哥德尔与图灵自己的不可判定性结果,指出机器有回答不了的问题。图灵答:人类同样有
4The Argument from Consciousness(意识)机器没有感受,写不出真正的诗。图灵答:这个标准会导致唯我论——你也无法证明别人有意识
5Arguments from Various Disabilities(各种能力缺陷)“机器永远不能 X”。图灵答:这类主张多半来自对少数机器的归纳,样本太小
6Lady Lovelace’s Objection(洛夫莱斯夫人)机器只能做我们命令它做的事,不能 originate anything。图灵答:这假设了机器不会让我们意外,而事实上它经常让我们意外
7Continuity in the Nervous System(神经系统的连续性)大脑不是离散状态机。图灵答:离散机器可以逼近连续系统到审问者分辨不出的程度
8The Argument from Informality of Behaviour(行为无法形式化)人的行为没有规则可循,机器只能守规则。图灵答:混淆了”行为规则”与”行为定律”
9The Argument from Extrasensory Perception(超感官知觉)若心灵感应存在,人类审问者可以靠它作弊

第 9 个值得单独说。图灵写:

Unfortunately the statistical evidence, at least for telepathy, is overwhelming.

遗憾的是,统计证据——至少就心灵感应而言——是压倒性的。

洛夫莱斯那条(第 6 条)值得看原文,因为它今天仍是最常听到的反驳。图灵引用的是 1842 年的原话:

The Analytical Engine has no pretensions to originate anything. It can do whatever we know how to order it to perform

分析机不自称能原创任何东西。它能做的,是我们知道该如何命令它去做的任何事情。

图灵的回应是把它拆成两个不同的主张:机器不能让我们意外(可以经验检验,且是假的),以及机器不能真正创造(这是关于”创造”这个词该怎么用的问题)。

7. Learning Machines:论文的最后一步,也是最被低估的一步

最后一节图灵问:怎么才能造出这样的机器?他的答案不是”写一个足够聪明的程序”。

Instead of trying to produce a programme to simulate the adult mind, why not rather try to produce one which simulates the child’s? If this were then subjected to an appropriate course of education one would obtain the adult brain.

与其试图编写一个模拟成年心智的程序,何不试着做一个模拟儿童心智的?只要再让它接受一段适当的教育过程,就能得到成年人的大脑。

他也预见了这条路的代价:教育过程会引入随机性和错误,而这是必要的。最后一段的开头是那句常被单独引用的:

We may hope that machines will eventually compete with men in all purely intellectual fields.

而全文真正的收尾是一句更克制的话——这才是论文的最后一句:

We can only see a short distance ahead, but we can see plenty there that needs to be done.

我们只能看到前方很短的一段距离,但在那段距离里,要做的事已经够多了

自测图灵建议如何造出能通过模仿游戏的机器?

不是直接编写一个模拟成年心智的程序,而是先造一个模拟儿童心智的系统——机制少、空白多——再让它经历一个适当的教育过程。今天的机器学习范式与这个建议同源。

附:论文没说,但常被说成它说了的

逐条用 grep 在底本里核过:

常见说法底本里的事实
提出了”图灵测验”(Turing test)Turing test 出现 0 次。原文的名字是 the imitation game
给出了通过标准没有任何判据。只有一个五十年后的经验预测,含 10⁹ 存储、五分钟、70% 三个参数
主张通过测验就等于会思考相反:他说 “Can machines think?” 这个问题 too meaningless to deserve discussion
是机器 vs 人、判断谁是机器原始设定是三人游戏,判断男女;机器接替”假装女人的男人”这一角色
提到了图灵机Turing machine 0 次。第 5 节讲的是 discrete-state machine 和 universal machine
提到了人工智能artificial intelligence 0 次——这个词 1955 年才出现
提到了神经网络neural network 0 次。第 7 节讲的是”儿童机器”加教育
提到了算法algorithm 0 次。他用的词是 programme、rule、instruction table
是一篇科幻式的乐观宣言全文近一半篇幅在处理反对意见,其中一条(第 9 条超感官知觉)他自己承认对自己不利
图灵预测 2000 年机器能通过他预测的是”五十年后”(即 2000 年前后)达到 70% 那个具体指标,以及本世纪末语言习惯的改变。两件事常被混为一谈

这篇论文今天该怎么读

三个我认为站得住的判断:

它的方法比它的结论重要。 图灵最有价值的动作不是预测,而是把一个无法回答的问题替换成一个可操作的问题。这个动作本身可以复用到任何”X 是不是真的 Y”的争论上:先问”什么样的观察会让你改变看法”。

它的预测大体落空,但落空的方式很有意思。 五十年后(2000 年)没有系统达到那个指标;而二十多年后的今天,文本对话已经足以让很多人在五分钟内判断不出。真正错的不是时间尺度,是他以为需要 10⁹ 存储就够了——今天的模型参数量比这个高出好几个数量级。

它没有解决的问题至今没解决。 图灵回避了”机器是否真的理解”,理由是这个问题无法操作化。三十年后 Searle 用中文屋直接攻击这个回避(见继续读第一条)。这场争论今天仍在原地:我们能测行为,测不了理解,而两者是否可分离,没有共识

拿它去用

读懂和会用是两件事。下面两个任务,原文没有走过一遍——要你自己把图灵的动作搬到新场地上。

迁移现在有人问「大语言模型是不是真的会推理」。用图灵在第 1 节做的那个替换动作,把这个问题改写成一个可操作的问题。写下你的版本,然后指出它放弃了什么。

图灵的动作有三步:承认原问题的词义无法达成共识 → 换成一个纯行为的、有明确终止条件的游戏 → 接受这个替换会丢掉一部分我们本来想问的东西。

搬过来的一个版本:不问「是否真的会推理」,而问「在一批训练数据发布之后才出现的问题上,模型给出正确最终答案且中间步骤逐步可核验的比例是多少」。终止条件明确,可重复,能给出数字。

它放弃的东西必须说出来,否则就是偷换:这个替换测不出模型是靠推理还是靠某种我们还没识别出的模式匹配拿到答案的——而这恰好是原问题真正想问的。图灵对自己的替换也承认了同一件事,这就是为什么他说原问题 too meaningless to deserve discussion 而不是说自己解决了它。

迁移图灵用近一半篇幅逐条处理九种反驳。挑你自己现在相信的一个技术判断,仿照这个体裁写出最强的三条反驳——要求:每条都必须是你无法立刻驳倒的。

这个任务的难点不在写,在诚实。多数人写出来的「反驳」是自己能一句话打掉的稻草人,那说明还没进入图灵的方法。

判断标准只有一条:写完之后,你对原判断的信心应该下降。如果没有下降,那三条反驳是假的,重写。

图灵自己给了示范——第 9 条超感官知觉那一节,他明确写道这条对自己的论证不利,而他没有删掉它。今天的教材普遍不重印这一节,这件事本身值得想一想:是他错了,还是我们在替他修饰。

继续读什么

按与原文的关系分组,每组内由浅入深。每条都说明为什么值得读——书单不给理由就只是摆设。

上游这篇论文站在谁的肩膀上

  1. On Computable Numbers, with an Application to the EntscheidungsproblemA. M. Turing深入

    图灵 1936 年的论文。本文第 5 节"数字计算机是通用的"这个前提,证明在那里。想知道"通用机"凭什么通用就读它

    站内词条通用机

  2. Computing Machinery and Intelligence 的 Mind 原刊页扫描Mind, Vol. 59, No. 236入门

    本文底本是 OCR 版,有少量字符瑕疵。要引用原文时以原刊扫描为准

下游这个想法后来变成了什么

  1. The Winograd Schema ChallengeHector J. Levesque, Ernest Davis, Leora Morgenstern进阶

    一个替代方案:用需要常识消歧的句子取代自由对话,避免模仿游戏可以被话术绕过的问题。代表了"图灵测验该被什么取代"这条线

    站内词条模仿游戏

反面质疑或限制原文结论的材料

  1. Minds, brains, and programsJohn R. Searle进阶

    中文屋论证的原文。它不否认机器能通过测验,而是主张通过了也不构成理解——正面攻击本文第 6 节第 4 个反驳被图灵驳回的那一步。读完这篇再回看图灵的回应,你会发现两人其实在争"什么算证据"

    站内词条中文屋模仿游戏

  2. Psychologism and BehaviorismNed Block深入

    提出著名的"查表机"反例:一台足够大的机器可以靠预存所有对话通过测验,却显然没有智能。这是对模仿游戏最锋利的技术性反驳

    站内词条模仿游戏

  3. Subcognition and the Limits of the Turing TestRobert M. French深入

    论证模仿游戏实际测的是"是否拥有人类的亚认知联想结构",因此它是一个人类文化成员资格测验,而不是智能测验。对"测的到底是什么"这个问题给出了最好的分析

    站内词条模仿游戏

来源

  1. Computing Machinery and Intelligence (Mind 59: 433-460)Mind