Few-shot 示例的选择与顺序为什么会影响结果?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
回答重点是示例同时定义任务和输出分布。选择时保证标签正确、与当前输入相关,并覆盖不同边界;不要只塞多个几乎相同的例子。顺序会产生近因与标签分布偏差,因此应尝试多种排列。追问 Token 预算时,说明增加示例可能挤掉真正的输入和证据。
可以这样答:
Few-shot 示例不仅展示格式,也在上下文中定义任务边界。应优先选择标签可靠、与当前输入相关且覆盖不同错误类型的示例,避免多个近重复样本。模型对示例顺序和标签分布敏感,同一组示例换序后结果可能变化,因此需要做多排列测试。示例越多并非越好,它们会占用上下文,也可能诱导模型机械照抄表面模式。
核心回答
Few-shot 示例既在说明任务,也会改变模型对标签、格式、语言风格和局部分布的判断。相关但多样的示例通常比随机示例有效;类别不平衡、错误答案、与查询冲突的格式会产生偏置。Transformer 对位置敏感,同一批示例换顺序也可能改变输出,尤其当模型偏向靠近问题的示例或标签先验时,因此示例集合和顺序都应作为可评测配置。
展开说明
自动选择可按 Embedding 相似度召回,再做多样性、标签覆盖和长度约束;仅选最相似项会堆积近重复示例。研究表明 Prompt 的示例顺序可能造成很大方差,不能只报告一次排列的最好结果。示例还会占据上下文,过多时可能把关键指令挤远或引入相互矛盾的模式。
工程实践
建立零样本、固定 Few-shot、动态检索 Few-shot 三个基线;在多种随机顺序和真实输入切片上报告均值与最差值。示例只能来自允许的训练/知识池,不能按测试标签挑选;对动态示例做去重、敏感信息过滤和 Prompt Injection 检查,并记录示例 ID 方便复现。
常见追问
- 最相似的 k 个示例为什么可能不好? 它们可能高度重复、覆盖同一标签或包含相同错误,缺乏对决策边界的展示。
- 示例一般放在指令前还是后? 没有跨模型通用答案,应遵循 Chat Template 并实测;关键是角色边界清楚、格式一致且不让示例改写系统规则。
- 怎样降低顺序敏感性? 使用更明确的标签定义、平衡示例、测试多种排列,必要时对多 Prompt 结果集成或做校准。
一句话复习
Few-shot 既定义任务又塑造局部分布;按相关性、多样性和标签覆盖选例,并把顺序方差纳入评测。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。