🤖 NEXIS LAB (메인)

AI는 왜 같은 질문에 매번 다른 답을 할까 — 온도의 비밀

똑같은 질문을 두 번 던지면 AI는 다른 답을 내놓는다. 버그가 아니라, 설계다.

같은 질문, 다른 답

챗GPT에게 똑같은 질문을 두 번 던져 보라. 답이 미묘하게, 때로는 완전히 달라진다. 버그가 아니다. 애초에 그렇게 설계돼 있다. AI는 답을 '알아내는' 게 아니라, 매번 새로 '뽑는다'.

이 뽑기의 정체를 알면, AI가 왜 어떤 때는 창의적이고 어떤 때는 엉뚱한 헛소리를 하는지, 그리고 왜 코딩할 땐 설정을 다르게 하라고 하는지가 한번에 이해된다.


AI는 답을 고르지 않고, 확률로 굴린다

언어 모델은 다음에 올 단어를 예측할 때 정답 하나를 계산하지 않는다. 어휘 전체에 대해 확률 분포를 만든다. 예를 들어 "오늘 날씨가 참 ___"라는 문장 뒤에, 모델은 후보 단어마다 원점수를 매긴다. 이 점수를 로짓(logit)이라 부른다.

이 로짓을 소프트맥스(softmax)라는 함수에 통과시키면, 전부 더해 1이 되는 확률로 바뀐다. 한 교육 자료의 예시를 보면 "좋다"에 약 46퍼센트, "덥다"에 약 28퍼센트, "흐리다"에 약 10퍼센트… 이런 식으로 확률이 매겨진다. 그다음 AI는 이 분포에서 단어 하나를 샘플링한다. 마치 주사위를 굴리듯. 그래서 같은 질문에도 매번 다른 단어가 튀어나온다.


온도 — 무작위성을 조절하는 다이얼

여기서 온도(temperature)가 등장한다. 온도는 이 확률 분포의 모양을 바꾸는 다이얼이다. 방식은 간단하다. 각 로짓을 온도 값으로 나눈 뒤 소프트맥스를 취한다.

온도를 1보다 낮추면 분포가 뾰족해진다. 높은 확률 단어는 더 확실해지고, 낮은 확률 단어는 더 억눌린다. 온도를 0에 가깝게 두면, 모델은 매번 가장 확률 높은 단어만 고른다. 이를 탐욕적 디코딩(greedy decoding)이라 하며, 결과는 사실상 결정론적이다. 같은 입력엔 같은 출력.

반대로 온도를 1보다 높이면 분포가 평평해진다. 평소라면 뽑히지 않을 단어에도 기회가 생긴다. 결과는 더 창의적이고 다양해지지만, 너무 높이면 문맥과 어긋난 헛소리가 섞이기 시작한다.


그럼 왜 항상 온도 0으로 두지 않을까

늘 가장 확률 높은 단어만 고르면 안전할 것 같지만, 실제로는 그렇지 않다. 2019년 Ari Holtzman 연구진의 논문 「The Curious Case of Neural Text Degeneration」은 뜻밖의 사실을 보고했다. 확률을 극대화하는 방식으로만 문장을 만들면, 글이 오히려 밋밋해지고 같은 표현을 병적으로 반복한다는 것이다.

원인은 '신뢰할 수 없는 꼬리(unreliable tail)'였다. 수만 개의 낮은 확률 단어들이 개별로는 미미해도 뭉치면 무시 못 할 확률 덩어리가 되어, 이따금 엉뚱한 단어가 튀어나온다.

이 연구진이 내놓은 해법이 top-p 샘플링, 또는 핵 샘플링(nucleus sampling)이다. 확률을 높은 순으로 더해 가다가 누적이 일정 비율, 예컨대 상위 90퍼센트에 닿으면 거기까지만 후보로 삼고 나머지 꼬리는 잘라낸다. 온도가 분포의 뾰족함을 조절한다면, top-p는 후보 단어의 개수 자체를 상황에 맞게 늘였다 줄인다.


창의성과 정확성의 저울

그래서 실무에서는 용도에 따라 온도를 다르게 쓴다. 코드나 수학 문제처럼 정답이 하나인 작업엔 온도를 낮춰 흔들림을 줄인다. 흥미롭게도 2024년의 한 연구는, 온도를 0에서 1까지 올려도 문제풀이 정확도 자체에는 통계적으로 유의한 차이가 없었다고 보고했다 — 온도를 높이면 답이 부정확해진다는 통념과는 다른 결과다. 다만 다양성이 커지는 만큼 엉뚱한 방향으로 새는 위험도 함께 커지므로, 정답이 하나인 작업에서는 여전히 낮은 온도가 무난하게 쓰인다. 반대로 브레인스토밍이나 소설처럼 다양성이 필요한 작업엔 온도를 올린다. 같은 AI라도 어떤 설정으로 부르느냐에 따라 성격이 달라지는 셈이다.


한 줄로 정리하면

AI가 같은 질문에 다른 답을 하는 건 고장이 아니라, 확률 분포에서 매번 새로 뽑기 때문이다. 온도와 top-p는 그 뽑기의 무작위성을 조절하는 손잡이다. AI의 대답은 계산된 정답이 아니라, 잘 조율된 주사위의 결과다.


출처

#AI#LLM#온도#temperature#샘플링#top-p#nucleus-sampling#소프트맥스#확률분포

NEXIS LAB (메인)의 다른 글