링크가 복사되었습니다!

추론 혁명: AI, '말하기' 전에 '생각하기'

AI는 더 이상 다음 단어를 예측하는 데 그치지 않습니다. 이 심층 분석에서는 OpenAI의 o1 및 Google의 Gemini 1.5 Pro와 같은 CoT(Chain of Thought) 모델을 사용하여 패턴 매칭에서 진정한 추론으로의 구조적 변화를 살펴봅니다.

🌐
기계 번역

이 기사는 영어 원문에서 자동 번역되었습니다. 영어 원문 읽기

사고 사슬 신경 경로가 순차적으로 켜지는 디지털 두뇌 시각화

주요 내용

  • 변화: 업계는 AI 모델의 “시스템 1” 사고(빠르고 직관적인 패턴 일치)에서 “시스템 2” 사고(느리고 의도적인 추론)로 이동했습니다.
  • 테스트 시간 컴퓨팅: 새로운 확장 법칙은 더 이상 데이터 크기 교육에만 국한되지 않습니다. 이는 답변 생성 동안 모델이 소비하는 컴퓨팅 양에 관한 것입니다.
  • 플레이어: OpenAI의 o1과 Google의 Gemini 1.5 Pro가 이 분야를 주도하고 있지만 근본적으로 다른 아키텍처 접근 방식을 사용합니다.

지난 5년 동안 더 나은 AI를 위한 비결은 간단했습니다. 더 크게 만드세요.

더 많은 매개변수, 더 많은 훈련 데이터, 더 많은 GPU. 이러한 무차별적인 접근 방식으로 GPT-4와 Claude 3이 탄생했습니다. 그러나 2025년에는 “확장 법칙”(AI가 더 많은 데이터로 얼마나 더 똑똑해질지 예측하는 수학적 곡선)이 평평해지기 시작했습니다. 들판이 벽에 부딪치고 있었습니다. 그 모델은 환각 기계였는데, 자신감 있게 들리는 데는 탁월했지만 논리에는 형편없었습니다.

그런 다음 “추론 혁명”이 일어났습니다.

모델을 더 크게 만드는 것이 아니었습니다. 그것은 대답하는 방법을 바꾸는 것이었습니다. 통계적으로 가능한 첫 번째 토큰을 흐리게 하는 대신 OpenAI의 o1 및 Google의 Gemini 1.5 Pro와 같은 새로운 모델은 최종 답을 제시하기 전에 잠시 멈추고 “생각”(숨겨진 생각의 사슬 생성)하고 자체 수정하도록 훈련되었습니다.

스케일링의 법칙 절벽

이러한 변화가 지금 발생한 이유를 이해하려면 2024년의 “확장 법칙 절벽”을 살펴봐야 합니다.

Advertisement

10년 동안 Kaplan 확장 법칙(Jared Kaplan의 2020년 논문에서 이름을 따옴)은 다음과 같이 사실이었습니다. 성능 = (데이터 세트 크기)^α * (컴퓨팅)^β. 기본적으로 데이터와 GPU를 두 배로 늘리면 오류율이 예상대로 감소합니다.

2024년 후반이 되자 이 곡선은 평평해지기 시작했습니다.

  • 데이터 부족: 교육 실행 시 고품질 인터넷이 부족합니다. 회사들은 이미 Wikipedia, Reddit, arXiv 및 존재하는 모든 디지털화된 책을 스크랩했습니다. 나머지 데이터(합성 데이터 또는 품질이 낮은 소셜 미디어)는 AI 생성 슬롭에 대해 훈련된 AI가 더 멍청해지는 “모델 붕괴”를 생성했습니다.
  • 수익률 감소: 이전 버전보다 2%만 향상된 모델을 훈련하는 데 10억 달러의 비용이 들었습니다. 경제가 무너지고있었습니다.

업계는 실존적 위기에 직면했습니다. 모델을 더 크게 만들어 더 똑똑하게 만들 수 없다면 이 분야는 어떻게 진행됩니까?

답은 사전 교육(지식 주입) 최적화를 중단하고 사후 교육(해당 지식에 대한 추론) 최적화를 시작하는 것이었습니다. 10초 동안 “생각”하는 작은 모델이 즉각적으로 대답하는 대규모 모델보다 성능이 뛰어난 것으로 나타났습니다.

기술적 변화: 훈련에서 추론으로

이것이 획기적인 이유를 이해하려면 컴퓨팅에 대해 이야기할 필요가 있습니다.

사전 훈련과 추론

전통적으로 계산 비용의 99.9%는 사전 학습(모델 교육) 중에 발생했습니다. 추론(귀하의 질문에 대한 답변)은 저렴하고 빠릅니다.

새로운 “시스템 2” 모델은 이러한 논리를 뒤집습니다. **“테스트 시간 컴퓨팅”**이라는 개념을 도입합니다.

  • 기존 방식: 질문 -> [즉석 통계 추측] -> 답변
  • 새로운 방식: 질문 -> [추론 1단계] -> [비판] -> [추론 2단계] -> [검증] -> 답변

예를 들어 OpenAI의 o1은 어려운 수학 문제를 해결하기 위해 수천 개의 내부 “생각”을 생성합니다. 접근을 시도하고, 막다른 골목임을 깨닫고, 되돌아가서 다시 시도할 수도 있습니다. 이 모든 것이 사용자에게 단어 하나를 보여주기 전에 이루어집니다. 이 내부 독백(생각의 사슬)을 통해 모델은 표준 LLM을 방해하는 문제를 통해 “추론”할 수 있습니다.

블랙박스 내부: “생각” 토큰의 작동 방식

당신이 o1에게 질문을 하면, 그것은 그냥 조용히 앉아있지 않습니다. 내부적으로는 “숨겨진 생각 사슬”(CoT) 토큰을 생성하고 있습니다.

  1. 세대: 모델이 문제를 세분화합니다. “1단계: 사용자의 의도를 명확히 하기 위해 변수를 정의합니다.”
  2. 비평: 자체 단계를 검토합니다. 모델은 잠재적인 모호함이나 사용자 의도 불일치를 표시합니다.
  3. 세분화: 단계를 다시 생성합니다. “수정된 1단계: Python의 asyncio 라이브러리를 사용하세요.”

이러한 토큰은 사용자에게 숨겨져 있지만(주로 경쟁자가 추론 데이터를 훔치는 것을 방지하기 위해) 실제 계산입니다.

Advertisement

결정적으로 **강화 학습(RL)**은 이 행동을 훈련하는 데 사용됩니다. 훈련하는 동안 모델에는 어려운 수학 문제가 주어집니다. 정답을 얻으면 거기까지 이어진 전체 생각의 사슬이 보상을 받습니다. 실패하면 체인에 페널티가 적용됩니다. 수십억 주기에 걸쳐 모델은 어떤 사고 패턴(문제 분석, 극단적 사례 확인)이 정답으로 이어지는지를 “학습”합니다.

사례 연구: o1 대 Gemini 1.5 Pro

OpenAI가 ‘추론’ 과대 광고 열차를 시작한 반면, Google은 대규모 맥락을 포함하는 다른 게임을 진행해 왔습니다.

OpenAI o1: 깊은 사상가

  • 전략: 추론을 위한 강화 학습. 이 모델은 특히 올바른 사고 사슬을 생성하기 위해 훈련 중에 보상을 받았습니다.
  • 강점: 수학, 코딩, 논리. 이는 인간 수학자처럼 행동하여 작업을 단계별로 확인하기 때문에 AIME(수학 대회)와 같은 벤치마크를 지배합니다.
  • 약점: 느립니다. 이러한 “생각 시간”은 복잡한 코딩 작업에는 필요하지만 일반적으로 챗봇에서는 허용되지 않는 대기 시간을 생성합니다.

Google Gemini 1.5 Pro: 컨텍스트의 왕

  • 전략: 광범위한 상황 창(2백만 개 이상의 토큰) + 상황 내 학습.
  • 강점: 정보 종합. Gemini 1.5 Pro는 단지 깊이 “생각”하는 것이 아닙니다. 그것은 넓게 “읽혀진다”. 전체 코드베이스, 영화 또는 도서 라이브러리를 단기 메모리에 로드하고 해당 특정 데이터를 추론할 수 있습니다.
  • 뉘앙스: 최근 연구에 따르면 Gemini는 검색 및 합성에 탁월하지만 CoT(생각의 사슬)를 사용하라는 명시적인 메시지가 표시되지 않는 한 o1이 깨뜨릴 수 있는 “순수 논리” 퍼즐로 어려움을 겪는 경우가 있습니다.

사고의 비용

이 혁명에는 가격표가 함께 제공됩니다.

GPT-4 시대에는 가격이 간단했습니다. 입력 토큰(저렴함) + 출력 토큰(비쌈). 추론 모델에는 추론 토큰이라는 새로운 숨겨진 비용이 있습니다.

  • 표준 프롬프트: “프랑스의 수도는 무엇입니까?” -> 5개의 토큰이 출력됩니다. 비용: 마이크로 페니.
  • 추론 프롬프트: “통행료를 피하고 트럭 50대를 위한 물류 경로를 계획합니다.” -> 모델은 퍼즐을 풀기 위해 5,000개의 “생각” 토큰을 생성할 수 있지만 최종 계획의 토큰은 100개만 출력합니다.

당신은 생각에 대한 비용을 지불합니다. 이는 AI의 경제학을 변화시킵니다. 잘못된 모델을 사용하면 간단한 작업(챗봇, 요약)의 ​​비용이 더 많이 들지만, 처음으로 불가능한 작업(복잡한 앱 코딩, 법적 증거 자료 제출)이 가능해집니다.

시장에는 분기점이 있습니다.

  1. 빠른 모델(GPT-4o mini, Gemini Flash): UI 상호 작용을 위한 저렴하고 즉각적인 “시스템 1” 사상가입니다.
  2. 심층 모델(o1, Claude 3.5 Opus): 고가치 작업을 위한 비싸고 느린 “시스템 2” 사상가.

5분 벽을 깨다

이것이 당신에게 왜 중요합니까?

왜냐하면 순수 생성 AI(“시스템 1” 유형)에는 한계가 있었기 때문입니다. 코드를 작성하거나 의학적 조언을 제공하는 것은 그것이 언제 잘못되었는지 알지 못하기 때문에 결코 완전히 신뢰할 수 없습니다. 단지 추측일 뿐입니다.

추론 모델은 5분 작업(그리고 결국 5시간 작업)의 잠금을 해제합니다.

  • 2023: “피보나치 수를 계산하는 Python 함수를 작성하세요.” (성공)
  • 2025: “이 특정 앱 아키텍처에 대한 Python 백엔드를 작성하고, 보안 결함이 있는지 감사하고, 테스트 제품군을 작성합니다.” (o1/Gemini에서도 가능)

추론 시 더 많은 컴퓨팅을 소비함으로써 속도와 안정성이 절충됩니다. 암기에 의존하는 AI에서 연역에 의존하는 AI로 변화가 일어나고 있습니다.

미래: 에이전트 워크플로

이것이 진정한 에이전트의 전조입니다. 웹 탐색이나 파일 작성과 같은 작업을 수행하는 에이전트는 작업을 수행하기 전에 해당 작업의 결과에 대해 추론해야 합니다.

표준 LLM은 이에 대해 너무 충동적이었습니다. 확률 분포에 따르면 그들은 파일을 삭제할 것입니다. “생각”하고 스스로 수정하는 능력을 갖춘 추론 모델은 감독 없이 몇 시간 동안 작동할 수 있는 안전하고 자율적인 에이전트에 필요한 누락된 뇌 세포입니다.

그 결과는 단지 더 나은 챗봇이 아닙니다. 말하기 전에 실제로 생각하는 사람은 디지털 직원입니다.

출처 (3)

Advertisement

🦋 Bluesky 토론

Bluesky에서 토론하기

게시물 검색 중...