小样本学习

小样本学习(,简称:)是机器学习中研究如何让模型在只有少量标注样本的条件下学习新类别、新任务或新概念的方法与问题设置。与依赖大规模标注数据的常规监督学习不同,小样本学习试图利用先验知识、预训练表征、任务间共性或元学习机制,使模型能在有限数据下保持泛化能力。该领域与元学习、迁移学习、表征学习、贝叶斯推断和深度学习关系密切,并在计算机视觉、自然语言处理、医学影像、音频分析、机器人学习和大型语言模型提示学习等领域得到应用。

定义与问题形式
小样本学习的核心困难在于训练样本过少,经验风险最小化得到的模型容易过拟合,难以可靠估计目标任务中的数据分布。已有综述通常把小样本学习理解为在少量带监督信息的样本上完成快速泛化的问题,其基本思路是把来自相似任务、相似类别或大规模预训练过程的先验知识转移到新任务中。

小样本学习与单样本学习(one-shot learning)和零样本学习(zero-shot learning)相邻。单样本学习通常指每个新类别只有一个有标签样本;零样本学习则不提供目标类别的标注样本,而依赖文本描述、属性、语义嵌入或其他外部知识完成识别。在大型语言模型语境中,小样本学习还常指模型在推理时通过提示词中的少量示例理解任务,而不再进行梯度更新或重新训练。

发展
小样本学习的动机部分来自人类学习能力。人类可以在很少示例下掌握新概念,并把既有经验用于新情境。早期计算机视觉研究已尝试用贝叶斯方法和知识迁移解决少量图像样本下的物体类别识别问题。李飞飞、和于2006年在《IEEE TPAMI》发表的单样本物体类别学习研究,是该方向的重要早期工作之一。

2010年代中后期,深度学习推动小样本学习进入以元学习和深度表征为核心的新阶段。匹配网络把小支持集和未标注样本映射到标签预测中,通过注意力与记忆机制解决单样本任务;原型网络把每个类别表示为嵌入空间中的原型,并通过距离完成分类;模型无关元学习(MAML)则学习一种适合快速微调的初始参数,使模型在少量样本和少数梯度更新后适应新任务。

随着生成式人工智能和大型语言模型的发展,小样本学习的含义进一步扩展。GPT-3论文把“few-shot”用于描述一种不更新模型参数、仅在提示词中给出少量任务示例的使用方式,并指出扩大语言模型规模可以提升任务无关的小样本表现。

方法
小样本学习方法大体可以按先验知识的使用方式分为基于数据、基于模型和基于算法三类。基于数据的方法通过数据增强、生成模型、半监督学习、自监督学习或外部数据扩充监督信息;基于模型的方法通过结构设计、参数共享、记忆模块或嵌入空间约束缩小假设空间;基于算法的方法则调整搜索或优化过程,使模型能更快找到适合新任务的假设。

基于优化的元学习方法把“如何快速学习”本身作为训练目标。MAML不限制具体模型结构,只要求模型可用梯度下降训练;其目标是在大量任务上学习一组初始参数,使模型遇到新任务时只需少量样本和少量梯度更新即可取得较好表现。

应用
在计算机视觉中,小样本学习用于物体识别、细粒度分类、目标检测、医学影像和遥感影像等任务。医学场景中,罕见疾病、新发疾病和隐私限制会导致标注数据稀缺,因此小样本学习常与迁移学习、解释性模型和专家标注流程结合。加拿大国家研究委员会的COVID-Net项目使用X光、CT和超声影像开发COVID-19诊断与预后辅助工具,其目标之一是利用小样本学习和元学习建立风险分层与诊断模型。《多伦多星报》2023年的报道也把医学影像中的小样本人工智能与COVID-19、结核、乳腺癌和前列腺癌等诊断场景联系起来,强调在样本有限时减少训练数据需求和提供可解释诊断依据的重要性。

在音频和声音分析中,小样本学习用于语音识别、声音分类、声音事件检测、异常声音检测、语音克隆和生物声学识别等任务。音频数据常受采集成本、隐私、环境噪声和类别长尾分布限制,少量目标样本的快速适配能力因而具有实际价值。在工业监测、城市声音感知和环境声学中,小样本学习也可以降低新设备、新场景和新故障类型的标注成本。在人工智能研究生态中,小样本学习也与深度学习机构、产业实验室和高校合作相关;Google Canada 2022年在蒙特利尔开设新办公室并承诺投入275万美元支持魁北克科技生态,其中包括向Mila提供150万美元用于人工智能研究。

局限与研究方向
小样本学习并不能消除数据需求,而是把数据需求从目标任务转移到先验知识、预训练任务、元训练任务或外部知识上。模型在训练类别和测试类别相似时表现较好,但在跨领域、跨模态或分布差异较大的任务中可能显著退化。支持集样本过少时,样本质量、标注噪声和类别代表性会对结果产生很大影响;少数异常样本可能导致模型原型、距离度量或微调方向偏离真实分布。

该领域的评估也存在争议。固定数据集上的高准确率不一定代表真实世界泛化能力,任务构造、类别划分、预训练数据重叠和超参数选择都可能影响比较结果。Meta-Dataset等较复杂基准试图缓解这一问题,但也表明现有方法在跨数据集泛化中仍有明显局限。此外,小样本模型常涉及黑箱深度网络、复杂元训练过程或大型预训练模型,解释性、可复现性、计算成本和安全性仍是持续研究方向。
参考资料

评论 (0)

  • 还没有评论,来抢沙发吧。