[태그:] 토큰

  • AI는 왜 같은 질문에도 다른 답을 할까? 생성형 AI의 답변이 달라지는 이유

    생성형 AI를 사용하다 보면 한 가지 궁금한 점이 생깁니다.

    “어제와 똑같은 질문을 했는데 왜 오늘은 다른 답변을 하지?”

    분명 같은 질문을 입력했는데 표현이 달라지거나, 설명의 순서가 달라지고, 때로는 추천하는 방법까지 달라지는 경우가 있습니다.

    처음에는 AI가 정확한 답을 기억하지 못하거나 이전 답변을 잊어버린 것처럼 느껴질 수도 있습니다. 하지만 생성형 AI의 답변이 달라지는 이유는 단순히 ‘기억력이 부족해서’라고 설명할 수 없습니다.

    생성형 AI는 질문에 대한 하나의 완성된 문장을 데이터베이스에서 찾아 그대로 보여주는 방식으로만 작동하지 않기 때문입니다.

    그렇다면 AI는 왜 같은 질문에도 다른 답변을 만들어내는 것일까요?

    먼저 일상적인 상황을 통해 이 현상을 쉽게 이해해보겠습니다.


    먼저 생각해보면 쉬운 실생활 예시

    친구에게 어느 날 이렇게 물어봤다고 가정해보겠습니다.

    “오늘 저녁 뭐 먹을까?”

    친구는 첫 번째에는

    “비도 오는데 따뜻한 국밥 먹자.”

    라고 대답할 수 있습니다.

    그런데 며칠 뒤 같은 질문을 했을 때는

    “오늘은 치킨 먹자.”

    라고 할 수도 있습니다.

    또 다른 날에는

    “어제 많이 먹었으니까 오늘은 김밥처럼 간단하게 먹자.”

    라고 대답할 수도 있습니다.

    질문은 비슷한데 답변은 매번 달라졌습니다.

    그렇다고 친구가 앞뒤가 맞지 않는 대답을 한 것은 아닙니다. 그때의 상황이나 대화의 맥락, 고려하고 있는 선택지에 따라 다른 답을 선택했기 때문입니다.

    생성형 AI도 결과가 만들어지는 과정에서 이와 비슷하게 여러 가능한 표현과 단어 가운데 다음에 이어질 가능성이 높은 선택지를 바탕으로 답변을 생성합니다.

    NIST의 생성형 AI 위험관리 자료에서도 대규모 언어 모델(LLM)이 문장이나 구문에서 다음 토큰 또는 단어를 예측하는 방식으로 텍스트를 생성한다고 설명합니다.

    물론 여기에는 중요한 차이가 있습니다.

    AI가 사람처럼 생각하거나 감정을 느끼면서 답을 선택한다는 의미는 아닙니다.

    위의 친구 사례는 생성형 AI의 작동 원리를 쉽게 이해하기 위한 비유입니다. 실제 AI에서는 입력된 질문뿐만 아니라 대화의 문맥, 사용되는 모델, 생성 설정 등 여러 요소가 결과에 영향을 줄 수 있습니다.

    그렇다면 AI는 구체적으로 어떻게 여러 단어 가운데 하나를 선택하면서 문장을 만들어내는 것일까요?

    이를 이해하려면 먼저 토큰과 확률적인 생성이라는 개념을 살펴볼 필요가 있습니다.


    1. 생성형 AI는 정해진 문장을 그대로 꺼내오는 방식으로 답하지 않습니다

    생성형 AI를 검색창이나 데이터베이스처럼 생각하면 답변이 달라지는 현상을 이해하기 어렵습니다.

    일반적인 검색에서는 사용자가 입력한 검색어와 관련된 정보를 찾아 결과를 보여주는 방식이 중심입니다.

    반면 대규모 언어 모델은 입력된 문장을 바탕으로 다음에 어떤 토큰이 이어질 가능성이 높은지를 계산하면서 새로운 문장을 생성합니다.

    여기서 토큰(Token)은 AI가 텍스트를 처리할 때 사용하는 작은 단위라고 이해하면 쉽습니다.

    예를 들어 사람이 문장을 읽을 때는 하나의 문장 전체를 자연스럽게 이해하지만, 언어 모델은 텍스트를 일정한 단위로 나누어 처리합니다.

    따라서 AI에게

    “오늘 날씨가”

    라는 문장이 입력되었다면 뒤에

    “좋다”

    “춥다”

    “덥다”

    등 다양한 표현이 이어질 가능성을 계산할 수 있습니다.

    물론 실제 모델의 계산은 이보다 훨씬 복잡합니다.

    중요한 것은 AI가 완성된 답변을 미리 하나 가지고 있다가 그대로 꺼내는 것이 아니라, 앞에서 생성된 내용과 입력된 문맥을 바탕으로 다음에 올 토큰을 차례대로 생성한다는 점입니다.

    NIST 역시 LLM의 텍스트 생성이 다음 토큰 또는 단어에 대한 통계적 예측과 관련되어 있다고 설명합니다.


    2. 그렇다면 왜 선택이 매번 달라질까요?

    여기서 중요한 개념이 샘플링(Sampling)입니다.

    AI가 다음에 올 수 있는 단어를 하나만 알고 있는 것이 아니라 여러 가능성을 계산한다고 생각해보겠습니다.

    예를 들어 다음과 같은 문장이 있다고 가정해보겠습니다.

    “오늘 저녁에는 ___을 먹었습니다.”

    AI가 다음에 올 수 있는 단어를 계산했을 때

    • 김치찌개
    • 비빔밥
    • 라면
    • 국밥

    등 여러 후보가 존재할 수 있습니다.

    이때 생성 시스템은 여러 후보 가운데 하나를 선택하면서 문장을 이어갈 수 있습니다.

    따라서 동일한 질문이라고 하더라도 생성 과정에서 선택되는 토큰이 달라지면 최종적으로 만들어지는 문장도 달라질 수 있습니다.

    이를 쉽게 표현하면 다음과 같습니다.

    질문 입력 → 가능한 다음 토큰 계산 → 하나의 토큰 선택 → 다음 토큰 계산 → 반복 → 완성된 답변

    즉, 생성형 AI의 답변은 한 번에 완성되는 것이 아니라 여러 단계의 토큰 생성 과정을 거쳐 만들어집니다.


    3. Temperature는 답변의 변화에 어떤 영향을 줄까요?

    생성형 AI의 답변이 달라지는 이유를 설명할 때 자주 등장하는 것이 Temperature(온도)입니다.

    Temperature는 모델이 후보를 선택하는 과정에서 출력의 다양성이나 무작위성에 영향을 줄 수 있는 생성 설정입니다.

    일반적으로 낮은 Temperature에서는 상대적으로 예측 가능하고 일관된 답변이 만들어지는 경향이 있고, 높은 Temperature에서는 다양한 표현이나 선택이 나타날 가능성이 커질 수 있습니다.

    예를 들어 같은 질문에 대해 낮은 설정에서는

    “운동을 꾸준히 하는 것이 좋습니다.”

    처럼 비교적 단순하고 직접적인 답변이 나올 수 있다면, 더 높은 설정에서는

    “무리하지 않는 범위에서 매일 조금씩 몸을 움직이는 습관을 만들어보는 것도 좋습니다.”

    처럼 표현이나 전개가 다양해질 수 있습니다.

    다만 여기서 중요한 점이 있습니다.

    Temperature가 모든 답변 차이의 원인은 아닙니다.

    실제 생성형 AI의 결과에는 모델의 종류와 버전, 대화 문맥, 시스템 지침, 검색이나 도구 사용 여부, 생성 설정 등 여러 요소가 영향을 줄 수 있습니다.

    또한 일반 사용자가 이용하는 모든 AI 서비스에서 Temperature 설정을 직접 조절할 수 있는 것도 아닙니다.

    따라서

    “AI가 같은 질문에 다른 답을 하는 이유는 Temperature 때문이다.”

    라고 단순하게 설명하는 것은 정확하지 않습니다.

    보다 정확하게는 Temperature는 답변의 변화를 설명하는 중요한 요소 중 하나이지만, 모든 답변 차이를 Temperature 하나만으로 설명할 수 있는 것은 아닙니다.


    4. 대화의 문맥이 달라지면 답변도 달라질 수 있습니다

    같은 질문을 입력했다고 생각해보겠습니다.

    “주말에 어디 갈까?”

    처음에는 AI가

    “서울 근교 여행지를 추천해드릴게요.”

    라고 답할 수 있습니다.

    그런데 앞선 대화에서 사용자가

    “이번 주말에는 비가 온다고 하던데.”

    라고 이야기했다면 답변은 달라질 수 있습니다.

    “그렇다면 실내에서 즐길 수 있는 장소를 찾아보는 것이 좋겠습니다.”

    이번에는

    “아이들과 함께 갈 예정이야.”

    라는 정보까지 추가했다면 다시 달라질 수 있습니다.

    “아이들과 함께라면 아쿠아리움이나 어린이 체험시설을 고려해볼 수 있습니다.”

    질문 자체는 크게 달라지지 않았습니다.

    하지만 AI가 참고하는 대화 문맥(Context)이 달라졌습니다.

    이처럼 생성형 AI에서는 현재 입력된 질문만 보는 것이 아니라 대화에 포함된 앞선 정보가 결과에 영향을 줄 수 있습니다.

    그래서 같은 문장을 입력했더라도 어떤 대화의 흐름에서 입력했는지에 따라 답변이 달라질 수 있습니다.


    5. 질문을 조금만 바꿔도 답변이 달라집니다

    이번에는 질문 자체를 조금씩 바꿔보겠습니다.

    “김치찌개 끓이는 방법 알려줘.”

    라고 질문하면 일반적인 조리법을 설명할 수 있습니다.

    하지만

    “자취생이 쉽게 김치찌개 끓이는 방법 알려줘.”

    라고 하면 재료를 줄이고 조리 과정을 간단하게 설명할 가능성이 높습니다.

    “돼지고기 없이 김치찌개 끓이는 방법 알려줘.”

    라고 질문하면 돼지고기를 사용하지 않는 대체 방법을 중심으로 답할 수 있습니다.

    그리고

    “10분 안에 김치찌개 만드는 방법 알려줘.”

    라고 하면 조리 시간을 줄이는 방법을 중심으로 답변이 구성될 수 있습니다.

    질문의 핵심 주제는 모두 김치찌개입니다.

    하지만 질문에 포함된 조건과 목적이 달라졌기 때문에 생성되는 답변도 달라지는 것입니다.

    따라서 AI의 답변이 달라지는 현상을 단순히 ‘AI가 랜덤으로 대답하기 때문’이라고 설명해서는 안 됩니다.


    6. 사용하는 AI 모델이 다르면 답변도 달라집니다

    같은 질문을 ChatGPT와 다른 생성형 AI 서비스에 입력했는데 서로 다른 답변을 받은 경험이 있을 수도 있습니다.

    이 역시 자연스러운 현상입니다.

    AI 서비스마다 사용하는 모델의 구조와 학습 과정, 학습 데이터, 시스템 지침, 업데이트 방식 등이 다를 수 있기 때문입니다.

    같은 질문을 입력하더라도 서로 다른 모델은 질문을 처리하고 다음 토큰의 가능성을 계산하는 방식이 다를 수 있습니다.

    따라서

    같은 질문 = 모든 AI가 같은 답변

    이라는 공식은 성립하지 않습니다.

    오히려 서로 다른 모델이 같은 질문을 어떻게 해석하고 어떤 정보를 중요하게 다루는지 비교해보면 각 모델의 특징을 파악하는 데 도움이 될 수 있습니다.


    7. 답변이 달라졌다고 해서 반드시 틀린 것은 아닙니다

    여기서 중요한 부분이 하나 있습니다.

    AI가 같은 질문에 다른 답변을 했다고 해서 둘 중 하나가 반드시 틀렸다는 의미는 아닙니다.

    예를 들어

    “운동을 시작하려면 어떻게 해야 하나요?”

    라는 질문에

    첫 번째 답변이

    “걷기부터 시작해보세요.”

    라고 했고,

    두 번째 답변이

    “가벼운 근력운동부터 시작해보세요.”

    라고 했다고 가정해보겠습니다.

    두 답변은 서로 다르지만 반드시 하나가 잘못된 것은 아닙니다.

    질문에 여러 가지 합리적인 답변이 존재할 수 있기 때문입니다.

    특히 추천, 아이디어, 글쓰기, 여행 계획, 식사 메뉴처럼 정답이 하나로 정해지지 않은 질문에서는 답변의 다양성이 오히려 장점이 될 수도 있습니다.


    8. 하지만 ‘답변의 다양성’과 ‘AI 환각’은 구분해야 합니다

    AI의 답변이 달라지는 현상을 이해할 때 반드시 구분해야 하는 것이 있습니다.

    바로 환각(Hallucination) 또는 컨퍼뷸레이션(Confabulation)입니다.

    단순히 표현이나 추천 내용이 달라지는 것과 사실이 아닌 정보를 사실처럼 제시하는 것은 전혀 다른 문제입니다.

    예를 들어

    “여행할 만한 국내 도시를 추천해줘.”

    라는 질문에

    “부산을 추천합니다.”

    라고 답했다가 다른 경우에는

    “강릉을 추천합니다.”

    라고 답하는 것은 답변의 다양성에 해당할 수 있습니다.

    하지만 존재하지 않는 관광지나 실제로 확인되지 않은 통계를 만들어내면서 그것을 사실처럼 설명한다면 이야기가 달라집니다.

    NIST는 생성형 AI가 사실과 다른 내용을 자신 있게 제시하거나, 입력된 내용과 다르거나 이전 답변과 모순되는 내용을 생성하는 현상을 ‘confabulation’으로 설명합니다.

    따라서 AI를 사용할 때는

    “답변이 달라졌다”

    “답변이 사실과 다르다”

    를 구분할 필요가 있습니다.


    9. 그래서 중요한 것은 ‘답변이 같으냐’보다 ‘답변을 검증할 수 있느냐’입니다

    생성형 AI를 사용할 때 모든 질문에 똑같은 답변이 나오기를 기대하는 것은 현실적이지 않습니다.

    오히려 중요한 것은 필요한 상황에서 답변의 근거와 사실관계를 확인하는 습관입니다.

    특히 다음과 같은 정보는 별도의 확인이 필요합니다.

    • 현재 가격
    • 주식이나 금융 관련 정보
    • 법률 및 정책
    • 의료 정보
    • 통계 수치
    • 기업의 최신 실적
    • 최신 제품 사양
    • 현재 진행 중인 사건
    • 인물 및 기관에 관한 사실관계

    이런 정보는 시간이 지나면서 바뀔 수 있기 때문에 AI의 답변만 그대로 믿기보다는 공식 기관이나 기업의 자료 등 신뢰할 수 있는 출처를 함께 확인하는 것이 좋습니다.

    AI가 아무리 자연스럽게 설명하더라도 자연스러운 문장과 사실의 정확성은 같은 의미가 아니기 때문입니다.


    10. 직접 실험해보면 더 쉽게 이해할 수 있습니다

    생성형 AI의 답변이 달라지는 이유를 이해하고 싶다면 직접 간단한 실험을 해볼 수 있습니다.

    먼저 AI에게 다음 질문을 입력해봅니다.

    “서울에서 하루 동안 여행한다면 어디를 가면 좋을까?”

    답변을 확인한 뒤 같은 질문을 다시 입력해봅니다.

    이번에는 답변의 내용과 표현을 비교해봅니다.

    그다음 질문을 조금 바꿔봅니다.

    “서울에서 하루 동안 여행한다면 혼자 가기 좋은 곳을 추천해줘.”

    또는

    “서울에서 하루 동안 여행한다면 비 오는 날에도 갈 수 있는 곳을 추천해줘.”

    라고 입력해봅니다.

    그러면 질문에 추가된 조건에 따라 답변의 방향이 달라지는 것을 확인할 수 있습니다.

    이번에는 새로운 대화를 시작해서 같은 질문을 입력해보는 것도 좋습니다.

    이를 통해 질문의 문맥과 조건, 생성 과정에 따라 AI의 답변이 달라질 수 있다는 사실을 직접 확인할 수 있습니다.


    11. AI에게 더 일관된 답변을 받고 싶다면 어떻게 해야 할까?

    AI의 답변을 최대한 일정한 방향으로 유지하고 싶다면 질문을 구체적으로 작성하는 것이 도움이 됩니다.

    예를 들어

    “AI에 대해 설명해줘.”

    보다는

    “생성형 AI를 처음 접하는 사람을 대상으로, 전문용어를 최소화하고 5개의 핵심 항목으로 나누어 설명해줘.”

    라고 요청하는 편이 훨씬 명확합니다.

    또한 다음과 같은 조건을 함께 제시할 수 있습니다.

    • 답변 대상
    • 원하는 분량
    • 설명 수준
    • 답변 형식
    • 반드시 포함할 내용
    • 제외할 내용
    • 비교 기준
    • 최신 정보가 필요한지 여부

    이렇게 하면 AI가 답변을 생성할 때 고려해야 할 조건이 명확해집니다.

    다만 조건을 자세하게 입력한다고 해서 모든 상황에서 완전히 동일한 답변이 보장되는 것은 아닙니다.

    생성형 AI의 답변에는 여러 생성 요소가 함께 작용하기 때문입니다.


    12. 그렇다면 AI의 ‘다른 답변’은 단점일까요?

    반드시 그렇지는 않습니다.

    같은 질문에 항상 똑같은 답변만 나온다면 오히려 생성형 AI를 활용할 수 있는 범위가 좁아질 수도 있습니다.

    예를 들어 블로그 글의 제목을 추천받거나 새로운 아이디어를 찾을 때는 다양한 결과가 나오는 것이 도움이 될 수 있습니다.

    첫 번째 요청에서는

    “AI 시대에 달라지는 직업”

    이라는 아이디어가 나왔는데,

    두 번째 요청에서는

    “생성형 AI가 바꾸는 사무직 업무”

    라는 다른 방향의 아이디어가 나올 수도 있습니다.

    이처럼 답변의 다양성은 아이디어를 확장하거나 여러 관점을 비교할 때 유용하게 활용할 수 있습니다.

    반대로 정확한 숫자나 최신 정책처럼 사실 확인이 중요한 영역에서는 다양한 답변보다 정확성과 검증 가능성이 훨씬 중요합니다.

    결국 중요한 것은 AI가 항상 같은 답을 하도록 만드는 것이 아니라, 어떤 질문에서는 다양성을 활용하고 어떤 질문에서는 반드시 사실을 검증해야 하는지를 구분하는 것입니다.


    13. 같은 질문에 다른 답이 나오는 이유를 정리하면

    지금까지 살펴본 내용을 간단하게 정리하면 다음과 같습니다.

    원인답변이 달라지는 이유
    토큰 생성AI가 문장을 토큰 단위로 순차적으로 생성
    샘플링여러 가능한 후보 가운데 다른 선택이 이루어질 수 있음
    Temperature생성 결과의 다양성과 선택 특성에 영향을 줄 수 있음
    대화 문맥이전 대화 내용이 현재 답변에 영향을 줄 수 있음
    질문의 차이작은 조건 변화도 답변의 방향을 바꿀 수 있음
    모델 차이서로 다른 모델은 다른 방식으로 입력을 처리할 수 있음
    시스템 설정서비스의 지침이나 생성 환경 등이 결과에 영향을 줄 수 있음
    최신 정보·도구 사용검색이나 외부 도구 사용 여부 등에 따라 결과가 달라질 수 있음

    따라서 생성형 AI의 답변을 이해하는 가장 좋은 방법은 “AI가 정답 문장을 저장해 놓고 꺼내주는 기계가 아니다”라는 사실에서 출발하는 것입니다.


    14. 생성형 AI를 잘 사용하려면 ‘답변의 생성 과정’을 이해해야 합니다

    생성형 AI가 같은 질문에 다른 답을 하는 현상은 처음에는 이상하게 느껴질 수 있습니다.

    하지만 AI가 질문을 입력받고 여러 가능성을 바탕으로 토큰을 순차적으로 생성한다는 기본 원리를 이해하면 훨씬 자연스럽게 받아들일 수 있습니다.

    실생활에서 친구에게

    “오늘 뭐 먹을까?”

    라고 물었을 때 상황에 따라 국밥을 추천하기도 하고 치킨을 추천하기도 하는 것처럼, 생성형 AI 역시 입력된 정보와 문맥, 모델과 생성 환경 등에 따라 결과가 달라질 수 있습니다.

    다만 AI와 사람의 사고 과정이 같다는 의미는 아닙니다.

    사람의 선택과 비슷한 모습으로 비유할 수는 있지만, AI는 언어 모델의 계산과 생성 과정을 통해 답변을 만들어냅니다.

    이 차이를 이해하는 것이 중요합니다.

    그래야 AI의 답변이 조금 달라졌을 때 무조건 오류라고 판단하지 않을 수 있고, 반대로 AI가 매우 확신에 찬 표현을 사용한다고 해서 그것을 무조건 사실이라고 믿지도 않게 됩니다.

    결국 생성형 AI를 잘 활용하기 위해 필요한 것은 AI가 항상 같은 답을 하도록 만드는 것보다, 왜 답변이 달라질 수 있는지 이해하고 결과를 적절하게 검증하는 능력입니다.

    AI가 만들어주는 답변을 그대로 받아들이는 사용자와 AI의 생성 원리를 이해하고 결과를 판단하는 사용자의 활용 방식에는 분명한 차이가 생길 수 있습니다.

    생성형 AI가 일상적인 도구를 넘어 업무와 학습, 콘텐츠 제작에 점점 더 많이 활용되는 지금, AI가 답을 만드는 방식을 이해하는 것 자체가 중요한 AI 활용 능력 중 하나라고 할 수 있습니다.


    참고자료