Elea Notes.

经典拆解

计算机器与智能逐节拆解

图灵没有定义"思考",也没给出通过与否的判据。他把一个无法回答的问题换成一个可操作的问题,然后花近一半篇幅逐一处理九种反驳——包括一种今天的教材都不愿重印的。

作者
A. M. Turing(1950)
校验
sha256:3cd7c57944b7b53f18fb2a7c014fe2367f3576696a1d024c840151459da2f24e
底本为 UMBC 镜像 PDF(22 页,91,972 字节,OCR 自 Mind 原刊)。全文英文引文逐条按此底本校对。 该 OCR 有少量字符级瑕疵(如 f/I 混淆、"progratiirne"),凡引用处均已避开受损片段。 上标在抽取中丢失:底本的 109 即原刊的 10 的 9 次方。

怎么读这篇

这篇按原文分节走:每节先给一句话主旨,再逐段讲原文在说什么、 为什么这么写。术语和公式的解释放在正文右侧的边注里,读到哪看到哪。 每节末尾有一道自测题——答不出就说明那节没读懂,回头再看一遍比往下读划算。

适合谁读:高中生起。不需要数学或编程基础。真正的门槛是耐心——图灵的论证方式是穷举反驳,读起来像看一个人独自下完一整盘棋。

哪里真的难,不糊弄你

  • 第 1 节的模仿游戏原始设定是三人游戏、判断男女,机器是第二步才替换 A 的角色。这个双层结构在传播中几乎总被简化掉,而它决定了这个测验测的到底是什么。
  • 第 5 节的通用性论证:数字计算机可以模拟任何离散状态机。这是图灵 1936 年那篇的结论在这里被当作已知前提使用。
  • 第 6 节第 3 条数学反驳引用了哥德尔不完备定理。图灵的回应不是反驳定理,而是指出它同样适用于人——这一步很容易读漏。
  • 那个著名预测有三个参数:五十年、10⁹ 存储、70% 识别率。三者是一个复合命题,拆开单独引用会失真。

读之前:这篇论文的体裁

二十八页,没有一个公式,没有一张表,没有实验数据。它是一篇哲学论文,用的是哲学的方法:提出一个论题,然后穷举反对意见,逐一应对。

它的历史地位常被误述,所以先把三件事说清楚:

  • 图灵没有把这个测验叫做”图灵测验”。这个名字是后人给的。原文的名字是 the imitation game(模仿游戏)。
  • 图灵没有给出任何通过标准。他给的是一个五十年后的经验预测,不是一条判据。这两者的区别在本文第 6 节详述。
  • 图灵没有主张这个测验定义了智能。他明确说原来那个问题”不值得讨论”,换成新问题是为了让讨论可以进行下去。

如果你只从二手材料听说过”图灵测验”,这篇会推翻你至少两个印象。

1. The Imitation Game:三个人,不是两个人

开篇第一句:

I propose to consider the question, “Can machines think?”

我提议考虑这样一个问题:“机器能思考吗?”

然后他立刻拒绝了回答它。因为要回答就得先定义 machine 和 think,而定义会陷入词义之争。他的办法是换一个问题。

原始设定是这样的:

It is played with three people, a man (A), a woman (B), and an interrogator (C) who may be of either sex.

这个游戏由三个人来玩:一个男人(A)、一个女人(B),以及一位性别不限的审问者(C)。

注意这一步:最初的游戏里没有机器。三个人,A 是男人,B 是女人,C 是审问者。C 与 A、B 通过打字交流,任务是判断谁是男谁是女。而 A 的目标是让 C 判断错误,B 的目标是帮助 C 判断正确。

机器是在第二步才进场的:

We now ask the question, “What will happen when a machine takes the part of A in this game?” Will the interrogator decide wrongly as often when the game is played like this as he does when the game is played between a man and a woman?

现在我们问这个问题:**当一台机器来扮演 A 的角色时,会发生什么?**审问者判断错误的频率,会和这个游戏在一男一女之间进行时一样高吗?

这个替换带来一个后果,图灵自己点了出来:

The new problem has the advantage of drawing a fairly sharp line between the physical and the intellectual capacities of a man.

这个新问题的好处在于,它在人的体能智能之间划出了一条相当清晰的界线。

打字这个界面把外形、声音、动作全部隔离掉了。机器不需要长得像人,只需要答得像。这是一个刻意的窄化。

图灵还回答了”这种问答形式够不够宽”这个疑虑:

The question and answer method seems to be suitable for introducing almost any one of the fields of human endeavour that we wish to include.

这种一问一答的方式,似乎适合把我们想纳入的几乎任何一个人类活动领域都引进来。

自测原始模仿游戏里,审问者要判断的是什么?

判断谁是男人、谁是女人——不是判断谁是机器。机器的角色是接替那个”假装女人的男人”(A),衡量标准是它骗过审问者的频率是否不低于人类男性做同一件事的频率。

4-5. Digital Computers:为什么只讨论数字计算机就够了

第 4 节介绍数字计算机的三部分:store(存储)、executive unit(运算单元)、control(控制)。1950 年这些词还需要解释,图灵用的类比是办公职员和纸笔。

第 5 节是关键的收缩步骤。图灵论证数字计算机是离散状态机,而任何离散状态机的行为都可以被数字计算机模拟。所以:

This special property of digital computers, that they can mimic any discrete-state machine, is described by saying that they are universal machines.

数字计算机这一特殊性质——它们能模仿任何离散状态机——被表述为:它们是通用机器。

这一步把问题从”某台机器能不能思考”收窄成”数字计算机能不能思考”——因为如果任何离散状态机都能被数字计算机模拟,那么讨论其他构造方式就没有额外收益。

于是原来那个问题被替换成一个具体得多的问题:

Let us fix our attention on one particular digital computer C. Is it true that by modifying this computer to have an adequate storage, suitably increasing its speed of action, and providing it with an appropriate programme, C can be made to play satisfactorily the part of A in the imitation game, the part of B being taken by a man?

让我们把注意力固定在某一台特定的数字计算机 C 上。是否只要改造它、使其拥有足够的存储、适当提高它的运行速度、并为它提供一个合适的程序,C 就能令人满意地扮演模仿游戏里 A 的角色(而 B 由一个人来扮演)?

6. 那个被反复错引的预测

这是全文被引用最多、也被拆解得最不完整的一段。完整的句子是:

I believe that in about fifty years’ time it will be possible, to programme computers, with a storage capacity of about 10⁹, to make them play the imitation game so well that an average interrogator will not have more than 70 per cent chance of making the right identification after five minutes of questioning.

我相信,大约五十年之后,就有可能为存储容量约 10⁹ 的计算机编写程序,使它们把模仿游戏玩得足够好——让一个普通水平的审问者在五分钟提问之后,正确识别的概率不超过 70%

四个条件是一个整体:五十年约 10⁹ 存储平均水平的审问者五分钟提问、正确识别率不超过 70%

紧接着的下一句,才是他对原问题的真正态度:

The original question, “Can machines think?” I believe to be too meaningless to deserve discussion.

我认为,最初那个问题——“机器能思考吗?“——太没有意义,不值得讨论

自测图灵的五十年预测,预测的对象是什么?

不是”机器会通过测验”,而是一个复合的经验命题:约 10⁹ 存储容量的计算机,能让一个普通审问者在五分钟提问后的正确识别率降到 70% 以下。同时他还预测了一件非技术的事——人们谈论”机器思考”时不再会被反驳。

6(续). 九种反驳:论文真正的主体

这一节占全文近一半篇幅。图灵列出九种反对意见并逐一应对。完整清单如下——注意第 9 个,它在今天的教材里几乎总被删掉:

#反驳图灵的回应要点
1The Theological Objection(神学)思考是灵魂的功能,上帝只赋予人类。图灵答:这限制了上帝的全能;造机器不比生孩子更僭越
2The “Heads in the Sand” Objection(把头埋进沙里)机器思考的后果太可怕,希望它不可能。图灵直接指出这不是论证,是安慰
3The Mathematical Objection(数学)引哥德尔与图灵自己的不可判定性结果,指出机器有回答不了的问题。图灵答:人类同样有
4The Argument from Consciousness(意识)机器没有感受,写不出真正的诗。图灵答:这个标准会导致唯我论——你也无法证明别人有意识
5Arguments from Various Disabilities(各种能力缺陷)“机器永远不能 X”。图灵答:这类主张多半来自对少数机器的归纳,样本太小
6Lady Lovelace’s Objection(洛夫莱斯夫人)机器只能做我们命令它做的事,不能 originate anything。图灵答:这假设了机器不会让我们意外,而事实上它经常让我们意外
7Continuity in the Nervous System(神经系统的连续性)大脑不是离散状态机。图灵答:离散机器可以逼近连续系统到审问者分辨不出的程度
8The Argument from Informality of Behaviour(行为无法形式化)人的行为没有规则可循,机器只能守规则。图灵答:混淆了”行为规则”与”行为定律”
9The Argument from Extrasensory Perception(超感官知觉)若心灵感应存在,人类审问者可以靠它作弊

第 9 个值得单独说。图灵写:

Unfortunately the statistical evidence, at least for telepathy, is overwhelming.

遗憾的是,统计证据——至少就心灵感应而言——是压倒性的。

洛夫莱斯那条(第 6 条)值得看原文,因为它今天仍是最常听到的反驳。图灵引用的是 1842 年的原话:

The Analytical Engine has no pretensions to originate anything. It can do whatever we know how to order it to perform

分析机不自称能原创任何东西。它能做的,是我们知道该如何命令它去做的任何事情。

图灵的回应是把它拆成两个不同的主张:机器不能让我们意外(可以经验检验,且是假的),以及机器不能真正创造(这是关于”创造”这个词该怎么用的问题)。

7. Learning Machines:论文的最后一步,也是最被低估的一步

最后一节图灵问:怎么才能造出这样的机器?他的答案不是”写一个足够聪明的程序”。

Instead of trying to produce a programme to simulate the adult mind, why not rather try to produce one which simulates the child’s? If this were then subjected to an appropriate course of education one would obtain the adult brain.

与其试图编写一个模拟成年心智的程序,何不试着做一个模拟儿童心智的?只要再让它接受一段适当的教育过程,就能得到成年人的大脑。

他也预见了这条路的代价:教育过程会引入随机性和错误,而这是必要的。最后一段的开头是那句常被单独引用的:

We may hope that machines will eventually compete with men in all purely intellectual fields.

而全文真正的收尾是一句更克制的话——这才是论文的最后一句:

We can only see a short distance ahead, but we can see plenty there that needs to be done.

我们只能看到前方很短的一段距离,但在那段距离里,要做的事已经够多了

自测图灵建议如何造出能通过模仿游戏的机器?

不是直接编写一个模拟成年心智的程序,而是先造一个模拟儿童心智的系统——机制少、空白多——再让它经历一个适当的教育过程。今天的机器学习范式与这个建议同源。

附:论文没说,但常被说成它说了的

逐条用 grep 在底本里核过:

常见说法底本里的事实
提出了”图灵测验”(Turing test)Turing test 出现 0 次。原文的名字是 the imitation game
给出了通过标准没有任何判据。只有一个五十年后的经验预测,含 10⁹ 存储、五分钟、70% 三个参数
主张通过测验就等于会思考相反:他说 “Can machines think?” 这个问题 too meaningless to deserve discussion
是机器 vs 人、判断谁是机器原始设定是三人游戏,判断男女;机器接替”假装女人的男人”这一角色
提到了图灵机Turing machine 0 次。第 5 节讲的是 discrete-state machine 和 universal machine
提到了人工智能artificial intelligence 0 次——这个词 1955 年才出现
提到了神经网络neural network 0 次。第 7 节讲的是”儿童机器”加教育
提到了算法algorithm 0 次。他用的词是 programme、rule、instruction table
是一篇科幻式的乐观宣言全文近一半篇幅在处理反对意见,其中一条(第 9 条超感官知觉)他自己承认对自己不利
图灵预测 2000 年机器能通过他预测的是”五十年后”(即 2000 年前后)达到 70% 那个具体指标,以及本世纪末语言习惯的改变。两件事常被混为一谈

这篇论文今天该怎么读

三个我认为站得住的判断:

它的方法比它的结论重要。 图灵最有价值的动作不是预测,而是把一个无法回答的问题替换成一个可操作的问题。这个动作本身可以复用到任何”X 是不是真的 Y”的争论上:先问”什么样的观察会让你改变看法”。

它的预测大体落空,但落空的方式很有意思。 五十年后(2000 年)没有系统达到那个指标;而二十多年后的今天,文本对话已经足以让很多人在五分钟内判断不出。真正错的不是时间尺度,是他以为需要 10⁹ 存储就够了——今天的模型参数量比这个高出好几个数量级。

它没有解决的问题至今没解决。 图灵回避了”机器是否真的理解”,理由是这个问题无法操作化。三十年后 Searle 用中文屋直接攻击这个回避(见继续读第一条)。这场争论今天仍在原地:我们能测行为,测不了理解,而两者是否可分离,没有共识。

继续读什么

由浅入深排列。前置知识里站内还没覆盖的部分,先从这里补。

  1. Minds, brains, and programsJohn R. Searle进阶

    中文屋论证的原文。它不否认机器能通过测验,而是主张通过了也不构成理解——正面攻击本文第 6 节第 4 个反驳被图灵驳回的那一步。读完这篇再回看图灵的回应,你会发现两人其实在争"什么算证据"

  2. Psychologism and BehaviorismNed Block深入

    提出著名的"查表机"反例:一台足够大的机器可以靠预存所有对话通过测验,却显然没有智能。这是对模仿游戏最锋利的技术性反驳

  3. Subcognition and the Limits of the Turing TestRobert M. French深入

    论证模仿游戏实际测的是"是否拥有人类的亚认知联想结构",因此它是一个人类文化成员资格测验,而不是智能测验。对"测的到底是什么"这个问题给出了最好的分析

  4. On Computable Numbers, with an Application to the EntscheidungsproblemA. M. Turing深入

    图灵 1936 年的论文。本文第 5 节"数字计算机是通用的"这个前提,证明在那里。想知道"通用机"凭什么通用就读它

  5. Computing Machinery and Intelligence 的 Mind 原刊页扫描Mind, Vol. 59, No. 236入门

    本文底本是 OCR 版,有少量字符瑕疵。要引用原文时以原刊扫描为准

  6. The Winograd Schema ChallengeHector J. Levesque, Ernest Davis, Leora Morgenstern进阶

    一个替代方案:用需要常识消歧的句子取代自由对话,避免模仿游戏可以被话术绕过的问题。代表了"图灵测验该被什么取代"这条线

来源

  1. Computing Machinery and Intelligence (Mind 59: 433-460)Mind