본문 바로가기
AI/AI 최신 기술

When2Think, 쉬운 질문까지 길게 답하는 AI를 어떻게 멈출까

by 고돌한 AI 2026. 9. 20.
반응형
When2Think 추론 예산 배분을 표현한 AI 최신 기술 대표 이미지

When2Think, 쉬운 질문까지 길게 답하는 AI를 어떻게 멈출까

When2Think의 답은 모든 추론을 짧게 자르는 것이 아닙니다. 쉬운 문제에는 바로 답하고, 어려운 문제에는 더 많은 계산을 배분하도록 문제별 보상을 다르게 주는 방식입니다. 핵심은 추론 압축이 아니라 추론 예산 배분입니다.

30초 요약

  • When2Think는 하나의 모델이 NoThink와 Think를 문제에 맞춰 고르게 학습합니다.
  • 참조 모델의 정답률과 응답 길이를 문제별 난이도·예산의 대리값으로 씁니다.
  • 정답인 응답에만 효율 보상을 더해, 쉬운 문제의 장황함과 어려운 문제의 성급함을 함께 줄이려 합니다.
  • 공개된 결과는 1.5B 수학 추론 모델과 수학 벤치마크 중심입니다. 일반 업무 성능으로 곧장 확대하면 안 됩니다.

When2Think는 무엇을 바꾸나요?

추론 모델에게 모든 질문을 오래 생각하라고 시키면, 1+1 같은 입력에도 회의부터 여는 일이 생깁니다. 반대로 토큰 수를 일괄 제한하면 어려운 문제에서 필요한 계산까지 잘릴 수 있습니다.

When2Think는 이 문제를 ‘얼마나 줄일까’가 아니라 ‘이 입력에 계산을 얼마나 배정할까’로 바꿉니다. 쉬운 문제는 빠른 직접 답변인 System 1, 어려운 문제는 단계적 추론인 System 2에 가깝게 처리하도록 학습합니다.

여기서 System 1과 System 2는 사람의 사고를 그대로 복제했다는 뜻이 아닙니다. 논문이 NoThink와 Think라는 두 생성 모드를 설명하기 위해 빌려온 개념적 구분입니다.

문제별 난이도는 어떻게 가늠하나요?

학습 전, 참조 정책이 각 문제를 여러 번 풀게 합니다. 이때 문제별 정답률과 평균 생성 토큰 수를 미리 계산해 저장합니다.

정답률은 난이도의 대리값, 평균 길이는 예상 추론 비용의 기준으로 쓰입니다. 시험 전에 각 문제에 ‘평소 얼마나 잘 맞히는지’와 ‘보통 얼마나 오래 걸리는지’를 적은 작은 표를 만들어 두는 셈입니다.

난이도는 질문 문장만 보고 붙인 고정 등급이 아닙니다. 해당 모델이 그 문제를 얼마나 잘 풀고 얼마나 길게 답했는지가 함께 반영됩니다. 같은 문제라도 기준 모델이 달라지면 통계와 배분 전략이 달라질 수 있습니다.

Think와 NoThink는 어떻게 학습되나요?

학습 중에는 첫 모드 토큰을 Think 또는 NoThink로 고릅니다. Think면 명시적 추론을 거쳐 답하고, NoThink면 긴 숙고 구간을 건너뛰고 바로 답을 생성합니다.

처음부터 한쪽 모드만 고집하지 않도록 두 모드를 고르게 탐색한 뒤, 중요도 샘플링으로 실제 정책과의 차이를 보정합니다. 먼저 두 문을 모두 열어 보고, 어느 문이 적절했는지를 보상으로 학습하는 구조입니다.

핵심 장치는 IDAC(Instance-level Difficulty-Aware Control, 문제별 난이도 인식 제어)입니다. 정답을 맞힌 응답에 효율 보상을 주되, 쉬운 문제에서 기준 길이를 넘긴 긴 추론에는 더 강한 감쇠를 적용합니다. 어려운 문제에는 더 긴 추론 여지를 남깁니다.

보상은 BWS(Batch-Wise Standardized Advantage, 배치 단위 표준화 이점)로 바뀌어 학습에 들어갑니다. 논문은 이 방식이 별도의 학습된 평가 모델이나 critic 없이도 문제 간 난이도 신호를 보존하며 학습을 안정화한다고 설명합니다.

참조 통계에서 Think와 NoThink 경로로 나뉘고 정답을 검증하는 When2Think 작동 흐름

입력과 출력은 어떻게 달라질까요?

아래는 논문의 작동 원리를 풀어 쓴 문서 기반 예상 예시입니다. When2Think 공식 구현을 실행해 얻은 출력은 아닙니다.

입력 A: 17 + 25는?
예상 모드: NoThink
예상 출력: 42

입력 B: 여러 조건이 얽힌 경시대회 수학 문제
예상 모드: Think
예상 출력: 필요한 중간 계산을 거친 뒤 최종 답

단순 분류기라면 A는 짧게, B는 길게 보내는 데서 끝날 수 있습니다. When2Think는 Think 여부뿐 아니라 Think를 선택한 뒤의 추론 길이까지 보상으로 조절하려는 점이 다릅니다.

사용자가 프롬프트마다 모드를 수동 지정하는 기술도 아닙니다. 학습된 정책이 입력과 자체 능력에 맞춰 모드를 고르는 사후학습 프레임워크입니다.

논문 결과는 어디까지 믿어야 하나요?

저자들은 R1-distill-1.5B 계열 모델을 DeepScaleR 수학 데이터로 학습하고 여러 수학 벤치마크에서 평가했습니다. AIME24에서는 기반 모델 대비 Pass@3가 46.0%에서 56.0%로 10.0%포인트 증가했고, 평균 생성 토큰은 14,195개에서 10,236개로 27.9% 줄었다고 보고했습니다.

AIME25에서는 Pass@3 40.0%, 평균 9,549토큰이 보고됐습니다. MATH-500에서는 난이도 Level 1에서 Think 비율이 약 0.2였고 Level 5에서는 0.7을 넘어서, 문제 난이도가 높아질수록 명시적 추론을 더 자주 선택하는 경향을 보였습니다.

이 수치는 단순히 ‘짧게 답해서 싸졌다’는 결과가 아닙니다. 어려운 문제에 필요한 추론을 남기면서 정확도와 생성량의 균형을 옮겼다는 것이 논문의 주장입니다.

쉬운 문제와 어려운 문제에 서로 다른 추론 길이를 배분하는 개발 화면

다만 논문 v1의 저자 실험 결과입니다. 이 글을 작성한 2026년 9월 20일 기준 arXiv 제출일은 2026년 9월 17일이며, 별도 재현 실험이나 정식 동료심사 상태는 확인하지 못했습니다.

언제 쓸 만하고, 언제 아직 이른가요?

검증 가능한 정답이 있고 입력별 난이도 차이가 큰 작업에 잘 맞습니다. 수학 문제처럼 답을 자동으로 채점할 수 있고, 쉬운 문제와 어려운 문제가 섞여 들어오는 환경이 대표적입니다.

반면 창작 글쓰기나 모호한 상담처럼 정답 검증기가 약한 작업에는 같은 보상 설계를 바로 옮기기 어렵습니다. 참조 통계를 미리 계산하는 비용도 들며, 기준 모델의 오답이나 길이 습관이 난이도 추정에 섞일 수 있습니다.

가장 큰 경계는 실험 범위입니다. 1.5B 수학 추론 모델에서 나온 성과를 일반 대화, 코딩 에이전트, 의료·법률 답변의 품질 향상으로 확대할 근거는 아직 부족합니다.

공식 저장소나 모델 카드가 확인되기 전에는 설치 튜토리얼보다 논문의 제어 구조를 이해하는 편이 낫습니다. 공개 구현이 나오면 참조 통계 생성 비용, 모드 토큰 형식, 재현 가능한 체크포인트부터 확인해야 합니다.

지금의 실용적 결론은 ‘무조건 덜 생각하기’가 아니라 ‘검증 가능한 문제에서 필요한 만큼 생각하도록 학습하기’입니다.

작업 환경을 함께 정리한다면

논문과 실험 로그를 오가며 입력을 반복한다면 멀티페어링 키보드가 기기 전환을 줄이는 데 직접 연결됩니다. 아래 제품은 멀티페어링 기능이 상품명에 명시된 사무용 무선 키보드라는 기준으로 골랐으며, 직접 사용한 제품은 아닙니다.

추천 상품 이미지
본문 기반 추천 상품아이리버 멀티페어링 인체공학 무선키보드, 화이트,…검색 상위 노출과 본문 관련성 기준쿠팡에서 상품 보기 →

노트북 화면과 논문을 나란히 볼 때는 높이 조절 거치대가 화면 배치와 책상 공간 확보를 돕습니다. 아래 제품은 3단 접이식·높이 조절 규격이 상품명에서 확인된 거치대이며, 노트북 크기와 하중 호환 여부는 구매 페이지에서 다시 확인해야 합니다.

추천 상품 이미지
본문 기반 추천 상품마글론 노트북 거치대 3단 접이식 높이조절, 실버, 1개검색 상위 노출과 본문 관련성 기준쿠팡에서 상품 보기 →

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

출처

  • When2Think arXiv 초록 및 서지 정보: https://arxiv.org/abs/2609.19671
  • When2Think 논문 HTML 본문: https://arxiv.org/html/2609.19671
  • 비교한 선행 연구 Thinkless 논문: https://arxiv.org/html/2505.13379
  • Thinkless 공식 GitHub 저장소: https://github.com/VainF/Thinkless

핵심 정리: 다섯 가지 질문과 답

Q. When2Think는 답변을 무조건 짧게 만드나요?

아닙니다. 쉬운 문제에는 짧은 답을 장려하지만, 어려운 문제에는 더 긴 추론을 남기도록 학습합니다.

Q. 문제 난이도는 무엇으로 판단하나요?

참조 정책이 문제별로 보인 정답률과 평균 생성 길이를 미리 계산해 난이도와 예상 비용의 대리값으로 사용합니다.

Q. Thinkless와 가장 큰 차이는 무엇인가요?

둘 다 혼합 추론을 다루지만, When2Think는 문제별 참조 통계와 IDAC 보상으로 모드 선택뿐 아니라 추론 깊이까지 조절하는 데 초점을 둡니다.

Q. 논문의 토큰 감소율을 API 비용 절감률로 봐도 되나요?

안 됩니다. 27.9%는 AIME24의 해당 실험 설정에서 생성 토큰이 줄어든 비율이며, 실제 서비스 비용은 모델·입력·인프라에 따라 달라집니다.

Q. 지금 바로 설치해 볼 수 있나요?

2026년 9월 20일 확인 기준 공식 When2Think 저장소와 모델 카드가 확인되지 않았습니다. 논문 구조를 먼저 살펴보고 공식 구현과 라이선스가 공개된 뒤 재현하는 편이 안전합니다.

반응형

댓글