Few-shot 예시는 개수를 늘린다고 항상 성능이 오르는 방법이 아니다. 2026년 ACL Findings 실험에서 Spider 2.0은 0-shot 26%에서 5-shot 64%까지 뛰었지만, WebArena는 0-shot 30%에서 5-shot 32%로 거의 정체했다. 이 글은 "예시를 몇 개 넣을까"가 아니라 "예시가 목표·제약·형식·평가를 얼마나 담고 있는가"를 검증 기준으로 삼아 few-shot 설계를 다시 점검한다.
Few-shot 예시는 몇 개 넣어야 효과가 있을까?
정해진 개수는 없고, 개수보다 예시가 담는 정보의 밀도가 결과를 좌우한다. 이번 실험에서 확인하려던 것은 두 가지였다. 첫째, 예시 수를 늘리면 어느 태스크에서나 성능이 오르는가. 둘째, 예시에 목표·제약·형식·평가를 명시하면 개수와 무관하게 재현성이 좋아지는가.
2026 ACL Findings 논문에서 few-shot 수를 0-shot부터 5-shot까지 늘려 비교한 결과는 태스크마다 크게 갈렸다. Spider 2.0은 0-shot 26%에서 5-shot 64%로 두 배 이상 뛰었고, Gorilla는 0-shot 2%에서 5-shot 38%로 극적으로 개선됐다. 반면 WebArena는 0-shot 30%에서 5-shot 32%로 거의 변화가 없었다. 같은 "5-shot"이라는 조건 안에서도 결과가 이렇게 갈린다는 점이 첫 번째 확인 사항이었다.
- 예시 개수는 태스크 성격에 따라 효과가 크게 갈린다 — 구조화된 출력(SQL 쿼리, API 호출)일수록 개선폭이 컸다.
- WebArena처럼 상태 변화가 많은 태스크는 예시 몇 개로 패턴을 학습시키기 어렵다.
- "5-shot이 3-shot보다 낫다"는 명제는 태스크를 명시하지 않으면 의미가 없다.
- 결과를 볼 때는 항상 모델·샘플 선택·프롬프트 조건을 함께 적어야 재현 가능하다.
예시를 고를 때 목표·제약·형식·평가를 어떻게 압축할까?
예시 하나에 이 네 가지를 전부 담기는 어렵지만, 최소한 형식과 평가 기준은 예시 출력 안에 함께 넣어야 재현성이 올라간다. 2026년 실무 가이드는 Role-Task-Context-Content-Constraints-Output-Evaluation로 프롬프트를 쪼개는 방식을 제시했고, 그중 평가(Evaluation)를 별도 항목으로 두는 점을 강조했다.
실험에서는 같은 입력에 대해 두 가지 예시 세트를 비교했다. 하나는 입력-출력만 있는 단순 예시, 다른 하나는 출력 형식(JSON 키, 표 열)과 금지 사항(예: 추측 금지, 근거 없는 수치 금지)을 함께 적은 예시였다. 후자 쪽이 반복 실행 시 출력 형식이 흔들리는 빈도가 낮았다는 것이 체감상 차이였다. 같은 가이드는 정확성·관련성·명확성·구조/형식·제약 준수·검증 가능성·안전 항목을 0~2점으로 채점해 총점 8/10 이상을 기준으로 삼으라고 권장했는데, 이런 채점 기준 자체를 예시 안에 은근히 반영해두면 모델이 "무엇이 좋은 답인가"를 더 잘 흡수하는 경향이 있었다.
실제 프롬프트에 few-shot을 넣을 때 어떤 마찰이 생길까?
가장 큰 마찰은 예시 자체를 사람이 직접 설계해야 한다는 비용이다. 2026년 한 연구는 고품질 few-shot CoT(사고 과정) 예시를 사람이 직접 만들어야 하며, 이는 상당한 수작업 비용을 요구한다고 밝혔다. 실험 중에도 "정답만 맞으면 되는 예시"와 "풀이 과정까지 보여주는 예시"를 만드는 데 걸리는 시간 차이가 컸고, 후자는 매 태스크마다 다시 설계해야 했다.
또 다른 마찰은 예시 형식이 텍스트를 넘어갈 때다. 2026년 공개된 FewMMBench는 멀티모달 few-shot 평가를 다루며, 작은 이미지-텍스트 데모 예시 묶음으로 모델을 유도하는 방식을 ICL·CoT prompting과 함께 평가 대상으로 삼았다. 이미지가 섞인 데모는 텍스트 예시보다 준비 비용이 더 크고, 예시 하나의 "형식"을 고정하기도 더 까다로웠다. 결국 few-shot 예시는 "샘플을 몇 개 붙이는 일"이 아니라, 목표·제약·형식·평가를 압축한 운영 자산을 매번 새로 만드는 일에 가까웠다.
few-shot 효과는 어떤 지표로 확인해야 할까?
측정 가능한 지표 없이는 few-shot이 도움이 됐는지 판단할 수 없다는 게 이번 실험의 결론이다. SemEval 2025 Task 8(DataBench)에서 few-shot prompting을 쓴 한 팀은 32B 모델, test split, nex=5, ncand=3 조건에서 정확도 78.35를 기록했다. 이 과제의 공식 평가 지표는 accuracy였고, 리스트 순서는 무시하고 수치는 소수 둘째 자리까지 반올림해 계산했다.
같은 SemEval 2025의 텍스트 감정 인식 과제에서는 few-shot prompting 접근이 macro-F1 0.7356을 기록해 75팀 중 32위였고, 공식 baseline 0.7083보다는 높았다. 이 결과는 few-shot이 항상 큰 폭 개선을 보장하지는 않지만, 구체적인 예시 선택과 출력 제약이 성능을 좌우한다는 점을 실무적으로 보여준다 SemEval 2025. accuracy, macro-F1 같은 지표가 있어야 "이 예시 세트가 저 예시 세트보다 나은가"를 실제로 비교할 수 있었다.
공개 벤치마크는 few-shot 효과를 어떻게 보여줬을까?
Evalita-LLM 같은 2025년 공개 리더보드는 zero-shot과 few-shot 설정을 모두 지원하며 23개 오픈소스 모델 결과를 보고했다. 이 벤치마크는 태스크별로 여러 프롬프트 문구를 사용해, LLM이 프롬프트 문구 자체에 민감하다는 문제를 완화하도록 설계됐다 Evalita 2025. 즉 하나의 프롬프트 문구로 얻은 few-shot 점수만으로 "이 모델은 few-shot에서 강하다"라고 단정하기 어렵다는 뜻이다.
2025 COLM 논문은 LLM을 사실 검증기(fact-verifier)로 쓸 때 few-shot prompting이 성능을 유의미하게 개선한다고 보고했다. CLEARFACTS, MiniCheck 벤치마크와 12개 LLM을 대상으로 zero-shot 대비 few-shot의 macro F1을 비교한 구조였는데, 이런 비교 설계 자체가 "few-shot 효과"를 말할 때 최소한 갖춰야 할 조건이라는 인상을 줬다. 조건(모델, 데이터셋, 프롬프트 수)을 함께 밝히지 않은 few-shot 수치는 그대로 인용하기 어렵다.
few-shot 예시가 안 통하는 경우는 언제일까?
WebArena 사례가 대표적인 한계다. 0-shot 30%에서 5-shot 32%로, 예시를 다섯 개까지 늘려도 거의 개선되지 않았다. 상태가 계속 바뀌는 웹 탐색 같은 태스크는 몇 개의 정적 예시로 패턴을 보여주기 어렵고, 이 경우 예시 개수를 더 늘리는 것보다 다른 설계(도구 사용, 상태 기록)를 검토하는 편이 나을 수 있다.
두 번째 한계는 비용이다. 고품질 CoT 예시를 사람이 직접 만들어야 한다는 점, 멀티모달 데모는 준비가 더 까다롭다는 점은 few-shot이 "무료로 성능을 올리는 방법"이 아니라는 걸 보여준다. 세 번째 한계는 재현성이다. 공개 벤치마크와 리더보드는 모델 버전, 프롬프트 수, 샘플 선택 방식에 따라 결과가 크게 달라지므로, 조건을 밝히지 않은 few-shot 점수는 그대로 신뢰하기 어렵다.
이번 실험에서 다시 확인한 것은 무엇일까?
2026년 기준으로 이번 검증을 돌아보면, few-shot 예시의 핵심은 "몇 개를 넣느냐"가 아니라 "그 예시가 무엇을 보여주느냐"였다. 목표(무엇을 성공으로 볼지), 제약(길이·톤·금지어), 형식(JSON·표·불릿), 평가(accuracy·macro-F1·형식 준수)를 예시 안에 함께 압축할수록, 예시 개수를 늘리는 것보다 효과가 안정적이었다. 동시에 Spider 2.0과 WebArena의 대조적인 결과는, 같은 방법론이라도 태스크 성격에 따라 결과가 완전히 달라질 수 있다는 걸 다시 확인시켰다.
핵심 정리
- few-shot 예시는 개수보다 예시가 담는 정보(정답 형식, 금지 사항, 채점 기준)가 성능을 좌우한다.
- 2026 ACL Findings 비교에서 Spider 2.0(26%→64%), Gorilla(2%→38%)는 5-shot에서 크게 개선됐지만 WebArena(30%→32%)는 거의 정체했다.
- SemEval 2025 DataBench는 32B 모델·nex=5·ncand=3 조건에서 accuracy 78.35를, 감정 인식 과제는 macro-F1 0.7356(baseline 0.7083)을 기록했다.
- Evalita-LLM은 태스크별 여러 프롬프트로 문구 민감성을 완화했고, few-shot 점수는 항상 조건과 함께 읽어야 한다.
- 고품질 few-shot·CoT 예시는 사람이 직접 설계해야 해서 상당한 수작업 비용이 든다.