人工智慧安全中心

人工智能安全中心(,缩写CAIS)是设于美国旧金山的非营利人工智能安全研究和倡议组织,宗旨是降低人工智能造成的社会规模风险。该中心从事技术和概念研究,为学术界提供计算资源,举办研究竞赛、研讨会和培训项目,并向企业和政府提供政策建议。该中心由机器学习研究者丹·亨德里克斯()领导,因2023年发布“人工智能灭绝风险声明”而广受关注。声明主张将降低人工智能导致灭绝的风险列为全球优先事项,与防范流行病和核战争并列。

历史与组织
2022年初,在加利福尼亚大学伯克利分校就读的安迪·邹()与亨德里克斯、奥利弗·张()共同创建人工智能安全中心。亨德里克斯毕业于芝加哥大学,后在加利福尼亚大学伯克利分校取得机器学习博士学位。他在完成博士学业前后参与创办该中心,并担任执行与研究主任。2023年7月,《波士顿环球报》报道该中心成立约一年,已获得可观资助;亨德里克斯除发表人工智能风险论文外,还参与过ChatGPT的红队测试,并向企业负责人和政策制定者提供建议。

该中心将工作分为研究、学科建设和倡议三部分。研究工作包括识别和消除人工智能的危险行为,研究欺骗、操纵及其他不道德行为,提高模型的可靠性和安全性;学科建设包括提供计算基础设施、举办跨学科研究项目、竞赛和研讨会,并制作教育资料;倡议工作则包括普及人工智能风险知识,向政府提供技术意见,以及建议企业建立重视安全的组织制度。

2023年,亨德里克斯、曼塔斯·马泽卡()和托马斯·伍德赛德()发表《灾难性人工智能风险概述》(),将相关风险分为四类:个人或组织蓄意利用人工智能造成伤害的“恶意使用”;竞争迫使企业或国家仓促部署不安全系统的“人工智能竞赛”;人为失误和复杂组织结构增加事故概率的“组织风险”;以及难以控制、行为偏离人类意图的“失控人工智能”。

同年,该中心研究人员与卡内基梅隆大学研究人员合作,开发自动生成对抗性后缀的方法。这些后缀附加在用户问题后,可绕过经过安全训练的语言模型,使模型回应原本会拒绝的有害请求。研究团队在开源模型上生成后缀后,发现攻击能够转移至ChatGPT、Bard和Claude等未公开模型;论文发表前,团队已将初步结果通知OpenAI、Google、Meta和安特罗匹克。《匹兹堡邮报》将这项研究形容为利用一串自动生成的字符突破聊天机器人安全限制,并指出研究者希望借此揭示现有防护机制的不足。中心此后建立由80块NVIDIA A100图形处理器组成的计算集群,免费供机器学习安全研究人员使用,以降低独立研究者使用大型模型的成本。

2024年,中心推出教材及在线课程《人工智能安全、伦理与社会》(),以非技术方式介绍人工智能原理、社会规模风险及其治理方法。亨德里克斯撰写的图书版于2025年由CRC Press出版,内容涵盖恶意使用、人工智能竞赛、组织风险、失控人工智能、安全工程、伦理和治理。

人工智能灭绝风险声明
2023年5月30日,人工智能安全中心发布一句话的公开声明:
{{quote|降低人工智能导致灭绝的风险,应与防范流行病和核战争等社会规模风险一样,成为全球优先事项。

声明有意写得简短,以凝聚对风险来源、严重程度和应对方法看法不同的人士。亨德里克斯表示,不同领域的研究者都可能认同人工智能风险应列为全球优先事项,无须先就每项风险或解决方案达成一致。这份声明没有提出暂停人工智能研发或具体监管方案,与同年3月由未来生命研究所发布、主张暂停训练比GPT-4更强系统六个月的公开信不同。

政策倡议
人工智能安全中心向政策制定者提供人工智能安全技术意见,与其关联的政治倡议组织“人工智能安全中心行动基金”()则从事游说和立法倡议。2024年,该组织参与推动加利福尼亚州参议员提出的SB 1047法案。法案要求达到一定规模的人工智能模型开发者采取安全保障措施,并赋予州总检察长相应执法权。

亨德里克斯支持该法案,认为在风险完全显现前建立预防制度优于拖延立法;科技企业和行业团体则担忧法案限制创新、增加合规成本,或将尚未发生的灾难情景作为监管依据。法案经州议会通过后,于2024年9月遭州长加文·纽森否决。纽森认为法案主要按照模型训练成本和计算规模设定监管门槛,没有充分考虑系统是否用于高风险环境及其实际用途。

评价与批评
灭绝风险声明使人工智能灾难风险进入主流公共讨论,但也引发对风险优先次序和科技企业动机的争论。《洛杉矶时报》报道,一些评论者担忧人工智能企业高管参与警示活动,可能借严格而复杂的监管巩固大型企业地位,或使政策讨论偏离虚假信息、偏见、劳动影响等已经出现的问题。

2024年,地理学者杰茜卡·麦克莱恩()批评声明将注意力集中于未来且来源不明的灭绝风险,没有充分讨论人工智能基础设施已经造成的环境和社会损害,也淡化了企业和政府对现有问题的责任。另一项研究将人工智能安全中心的公开声明、竞赛和研讨会置于人工智能安全学科建设的整体脉络中。该研究指出,公平、问责与透明度会议组织者曾以公开信回应相关灭绝风险倡议,强调已经得到实证证实的人工智能伤害;作者同时担忧人工智能安全团体拥有较多资金和政策渠道,可能使现有危害在公共政策中进一步边缘化。

亨德里克斯回应称,人工智能灭绝风险并不排斥对偏见、虚假信息、恶意使用、网络攻击和武器化等当前问题的关注,社会可以同时管理近期和长期风险,不应将两者视为非此即彼。
参考资料
外部链接
*

评论 (0)

  • 还没有评论,来抢沙发吧。