人工智能安全(英语:Artificial Intelligence Safety,简称AI安全)是一门跨学科的研究领域,其核心关切在于如何防范人工智能系统可能引发的事故、滥用或其他形式的危害。随着人工智能技术的迅速发展,尤其是在通用性日益增强的大规模模型相继问世之后,人类对其潜在风险的忧虑已不再局限于技术失灵或误用,而逐步延伸至更深远的存在层面——即某些极端情境下,人工智能或许会对人类文明构成生存性威胁,甚至带来不可逆的崩溃。
围绕这一关切,AI安全的研究大致可归纳为三个相互关联的方向。其一是“对齐”问题,即如何确保人工智能系统的行为始终契合设计者或使用者的真实意图与价值取向,避免因指令理解偏差或目标设定失当而产生意料之外的后果。其二是风险监控,强调在系统实际运行过程中,持续捕捉异常状态、识别潜在故障,并及时发现系统被恶意利用的苗头。其三是鲁棒性,旨在增强系统在面对错误输入、环境突变或蓄意攻击时的稳定性和抗干扰能力,从而在不确定的现实条件下依然维持安全运行。
该领域通常把风险区分为两类:一类是恶意行为者刻意利用人工智能造成的误用,另一类是系统在无人违规操作的情况下自行偏离设计者意图所导致的事故
对抗鲁棒性
人工智能系统通常容易受到对抗样本的攻击,即攻击者故意设计旨在导致模型出错的输入样本
}}
评论 (0)