学会圈叉游戏的火柴盒(或,简称:),是人工智能研究者唐纳德·米基与同事罗杰·钱伯斯于1961年设计制造的机械计算机,由304个火柴盒组成。此物可与真人下井字棋,还可根据任意棋局给出下一步落子,并通过强化学习不断改进策略,属于最早出现的人工智能系统。
米基和钱伯斯当时没有计算机可用,便改用火柴盒搭建这台引擎。十五年后,他希望借助早期卷积神经网络进一步展示自己的数学和计算能力。由于当时无法取得可供此类用途使用的计算机设备,他便另辟蹊径,用火柴盒和珠子搭建出一台能够实际运行的机械计算机,以此展示人工智能。米基起初只把搜集火柴盒并逐一设定其对应局面当作消遣,后来才将用作演示工具。1963年,米基完成介绍的论文《游戏学习机械化实验》,这是最早的强化学习循环之一,即算法反复运行,不断剔除失败策略,直至只剩取胜策略。
组成
由304个火柴盒粘合而成,排列方式类似多屉柜。每个火柴盒都有编号,并与一张图表对应。图表绘有不同局面的井字棋棋盘,格内标有不同组合的X、O或留空,剔除仅由旋转或镜像形成的重复局面后,图表共收录304种排列,因此也使用304个火柴盒。每种颜色代表在棋盘某一格落子,因此若某个局面已有棋子占据该格,对应火柴盒内便不会放入代表该格的珠子。内屉前端另装有两片呈“V”字形的卡纸,的第一阶段分为五个环节,分别规定与棋局有关的算法规则,并为后续操作确立依据。
运作
执O先行,因为所有火柴盒所表示的都是X方落子后可能出现的局面。对手或操作者先找到与当前棋局相符的火柴盒,若没有完全相同的图案,也可选用旋转或镜像后相同的局面。例如开局时,应取出代表空棋盘的火柴盒。随后抽出内屉,轻轻摇晃,使珠子滚动。玩家既要阻止对手连成一线,也要设法使自己的棋子连成一线。然而,双方若都采用最优策略,棋局必然以平局告终。经历了以下阶段:起初,他始终采用“变式0”,即在中央格开局。第15局时,已放弃所有不从角格开局的走法。二十余局后,米基改用“变式1”,固定从右下角开局;第60局恢复变式0;接近第80局时改用“变式2”,从上方中央格开局;第110局改用“变式3”,从右上角开局;第135局改用“变式4”,从右侧中央格开局;第190局恢复变式1,第210局又恢复变式0。
“2号”火柴盒内珠子数量的变化如下:1968年,唐纳德·米基与R·A·钱伯斯又以为基础开发(,游戏学习期望极大化引擎)算法,使其学习如何保持小车上的杆子平衡。
引起热烈反响后,米基获邀前往美国海军研究办公室,受托为斯坦福大学使用的IBM计算机编写运行的程序。米基还在 D·马丁协助下,为计算机编写模拟程序。此后,人们多次以实体装置或计算机程序复原。其算法后来演化为克里斯托弗·沃特金斯的Q学习算法。
虽不再作为实用计算机使用,却成为多门神经网络课程的教学演示工具,伦敦大学学院研究员马修·斯克罗格斯也曾公开演示这套装置。斯克罗格斯制作的复原品曾亮相2019年英国皇家科学院圣诞讲座以及2023年播出的一期《》。
还见于1963年的短篇小说《》,以及托马斯·J·瑞安1977年的小说《》。
参考文献
来源
- , Michie and R. A Chambers' paper on the AI implications of BOXES and MENACE.
- , a book on the "Boxes" algorithm employed by MENACE.
外部链接
- [https://www.mscroggs.co.uk/menace/ Online simulation of MENACE]
评论 (0)