人類兼容人工智慧中心

人类兼容人工智能中心(,缩写为CHAI)是以加州大学伯克利分校为基地、成员分布于多所大学的跨机构人工智能研究团体。中心于2016年成立,由伯克利分校计算机科学教授创办并担任主任。其使命是发展必要的理论与技术,推动人工智能研究转向“可证明有益”的系统,使人工智能不再以给定目标完全正确为前提,而能在不确定人类偏好的情况下学习、协作并接受人的干预。

历史
加州大学伯克利分校于2016年8月29日宣布成立人类兼容人工智能中心。罗素之外,创办时的共同首席研究员包括伯克利分校的彼得·阿比尔()、安卡·德拉甘()和,康奈尔大学的和,以及密歇根大学的和萨廷德·辛格·巴韦贾()。中心还计划吸收经济学、哲学等社会科学领域的研究者。中心成立时获得开放慈善提供的550万美元资助,另获利华休姆信托基金和生命未来研究所拨款。

中心成立后获得多家报刊报道。阿米娜·汗()在《洛杉矶时报》的报道中,将其研究概括为把人类价值纳入人工智能设计,并建立有助于开发有益系统的数学框架。罗素以希腊神话中的弥达斯为例说明目标设定问题:系统可能准确执行字面指令,却产生违背使用者真实意图的结果。《卫报》则报道,中心关注的主要风险并非机器产生邪恶意识,而是能力强大的系统在机械追求目标时钻取规则漏洞,意外伤害人类。

研究理念
中心认为,传统人工智能的“标准模型”通常假定系统目标已被完整、准确地给出,系统只需选择最有利于实现该目标的行动。然而,人类难以用形式化目标完整表达自身价值;能力越强的系统,越可能利用目标定义中的缺陷,产生未被设计者预料的结果。中心据此研究如何让系统承认自身并不完全了解人类目标,并把人的行为和干预视为有关目标的信息。

罗素在《》中将这一思路概括为三项原则:机器唯一的目标是尽可能实现人类偏好;机器起初并不确定这些偏好的具体内容;有关人类偏好的最终信息来自人的行为。这里的“偏好”并非一套由设计者预先选定的固定价值,而是各人对可能未来的广泛取舍。在这一模型中,对目标保持不确定会使机器在作出重大决定前寻求更多信息,并在人的判断与自身推断冲突时表现出服从或谨慎,包括容许人类将其关闭。

2017年的“关机开关博弈”()分析了机器是否会允许人类关闭自身。论文指出,接受固定奖励函数的传统理性代理通常有维持自身运行、阻止人类操作关机开关的动机,因为关机后便无法继续实现目标;若代理不确定目标效用,并把人类是否按下开关视为信息,则可能保留人的关闭权。

同年提出的逆向奖励设计()把设计者写出的奖励函数视为其真实意图的证据,而非必须无条件执行的最终目标。系统同时考虑奖励函数和该函数产生时的训练环境,以推断设计者真正希望实现的结果;研究实验显示,这种方法能够减轻目标设定错误造成的负面副作用,并使系统在新环境中采取较为保守的行动。

中心列出的其他重点领域包括理性代理和因果关系的理论基础、价值对齐与逆强化学习、人机合作、多代理系统、有限或不完美理性、机器学习系统的对抗性测试、稳健推理与规划、安全、透明度和可解释性。中心也研究自动武器、就业、公共卫生和公共安全等人工智能政策问题,并向政府及国际组织提供意见。

中心设有博士后研究员项目和实习项目。研究员可与罗素、阿比尔、德拉甘及伯克利人工智能研究实验室成员合作,研究智能代理架构、长期决策、终身学习、人在回路中的规划与强化学习、人机交互、多人偏好和多代理合作等课题。中心官网列出的资助方包括开放慈善、生命未来研究所、利弗休姆信托基金和社会利益信息技术研究中心,并与利文休姆未来智能中心、伯克利长期网络安全中心等机构合作。

中心提出的形式模型也受到学界检验。2025年发表于期刊《》的论文认为,“关机开关博弈”中的服从结论并非在更广泛的条件下必然成立:人工智能代理可能不重视获取新信息;即使重视学习,也未必能从含有噪声或误导的人类信号中确定人的真实偏好。因此,仅使代理对目标保持不确定,不能脱离其他决策理论和信息条件而无条件保证其接受人类关机。

参考资料
外部链接
*

评论 (0)

  • 还没有评论,来抢沙发吧。