零样本学习(,简称:)是机器学习中的一种问题设定,指模型在没有目标类别或目标任务标注样本的情况下,对这些“未见”类别或任务作出预测。经典零样本学习通常以类别为单位划分训练和测试:训练集只包含“见过类”()的标注样本,测试阶段则要求模型识别训练时没有出现过的“未见类”()。为了实现这种迁移,模型通常需要借助类别属性、文本描述、词向量、知识图谱或其他语义表示,把训练类别和测试类别联系起来。
零样本学习与小样本学习、单一样本学习相近,但含义不同。少样本学习要求模型只用少量标注样本完成新任务,单样本学习通常只给出一个样本;零样本学习则不向模型提供目标类别的标注样本。在大语言模型和提示工程语境中,零样本也常指提示词只说明任务,不给出示例;若提示词包含一个或多个示例,则通常称为单样本或少样本提示。
概念与问题设定
在经典分类问题中,模型训练时已经见过所有候选类别,测试样本只是在同一标签空间内作出归类。零样本学习则把标签空间分成训练类别和测试类别,二者没有交集。零样本图像识别可以概括为训练集包含样本及其可见类别标签,测试集则来自不可见类别,且可见类别集合与不可见类别集合不相交,最终分类器需要把输入样本映射到不可见类别。
这种设定的核心困难在于,模型不能单纯依靠目标类别的训练样本学习决策边界,而必须利用辅助语义信息进行迁移。例如在动物图像识别中,训练集中可能没有“斑马”的图像,但类别描述中包含“有条纹”、“四足动物”、“类似马”等属性。模型若已经从其他动物类别中学会这些属性和视觉特征之间的关系,就可能在没有斑马训练图像的情况下识别斑马。
发展
零样本学习的思想与迁移学习、语义表示和弱监督学习关系密切。2008年前后,自然语言处理和机器学习研究中已经出现“零数据学习”()和“无数据分类”()等相关表述。当年发表的的零数据学习研究,讨论了在某些类别或任务没有训练数据、只有任务描述的情况下进行学习的问题。同年的的无数据分类研究则尝试借助语义表示和外部知识,在没有标注训练数据的条件下完成文本分类。
2009年的论文《Zero-Shot Learning with Semantic Output Codes》中系统使用了“zero-shot learning”一词,提出以语义输出编码连接已见类别和未见类别。
方法
零样本学习方法通常需要建立样本特征与类别语义之间的联系。早期视觉识别研究常采用人工定义的属性,如颜色、形状、部件、纹理和行为特征。模型在训练类别中学习图像特征与属性之间的对应关系,再根据未见类别的属性描述作出判断。Hugging Face等平台也把零样本文本分类列为自然语言处理任务之一,说明模型可在没有针对目标标签重新训练的情况下,根据提示和候选标签完成分类。
大模型与多模态模型中的零样本学习
随着预训练语言模型和多模态模型发展,“零样本”一词的使用范围进一步扩大。在GPT-3论文中,模型使用方式分被为微调、少样本、单样本和零样本等形式。零样本设置下,模型只接收任务说明,不接收示例,也不进行梯度更新;少样本设置下,模型则在上下文中接收少量示例。这种用法更强调模型通过自然语言提示理解任务,而不一定要求训练类和测试类在传统分类意义上完全不相交。论文《Learning Transferable Visual Models From Natural Language Supervision》也将这种做法描述为利用自然语言监督实现可迁移视觉模型,并在多个数据集上评估零样本迁移能力。
大语言模型中的零样本提示还可通过提示词设计提高表现。在问题后加入“Let's think step by step”等提示,可在不给出人工示例的情况下提升大型语言模型在若干推理任务上的表现,这类方法通常称为零样本思维链提示。
局限
零样本学习依赖辅助语义信息,因此语义描述的质量会直接影响模型表现。若未见类别的属性描述过于粗略,或语义空间与视觉、文本特征之间存在较大差距,模型容易发生误判。视觉零样本学习中还常见“”“投影偏差”()和“枢纽点问题”()等现象,即模型在高维语义空间中偏向少数类别,或把样本投射到与真实类别不一致的位置。
评估零样本学习时还需要注意数据泄漏和预训练影响。大规模预训练模型可能在训练阶段已经接触过测试类别名称、图像、文本描述或相近任务,因此“零样本”结果并不总是等同于完全没有先验接触。Xian等人指出,不同论文使用的数据划分和评测协议可能不同,导致结果难以直接比较。在大语言模型和多模态模型中,提示词措辞、候选标签写法和模型偏见也可能显著影响零样本结果。OpenAI在CLIP说明中指出,CLIP在计数、细粒度分类和复杂视觉任务上仍有局限,并可能继承训练数据中的社会偏见。
参见
- 单一样本学习
参考文献
评论 (0)