Oct 09, 26 | Page 12

B-4 2026 년 10 월 9 일- 2026 년 10 월 15 일 재정 / 교육

AI 답변 제대로 가려내고 있나

AI 추론 능력 완전하지 않아 오류 생겨

< 김선영 기자 > 주요 기술 기업들은 검색 엔진에 AI( 인공 지능) 를 적극적으로 도입하고 있다. 구글은 현재 검색 결과의 일반적인 링크 목록 상단 에 텍스트 요약 형태의 ' AI 개요( AI Overviews)' 를 제공하고 있다. 퍼플렉시티( Perplexity) 와 같은 신생 검색 엔진들도 자체적 인 AI 생성 요약 기능을 앞세워 기존 검색 엔 진에 도전장을 내밀고 있다. 이런 요약 기능이 주는 편리함 덕분에 관련 도구들이 큰 인기를 끌고 있다. AI가 단 몇 초 만에 가장 핵심적인 정보를 제공할 수 있는 데, 굳이 여러 웹사이트를 일일이 뒤져볼 필 요가 있을까? AI 도구는 정보를 얻는 더 원활 하고 신속한 경로를 제공하는 듯하다. 하지만 동시에 사람들을 잘못된 길로 이끌거나 유해 한 거짓 정보에 노출시킬 위험도 있다.
연구 결과, 가장 정확도가 높은 AI 모델이 라도 전체 주장의 25 % 에서 환각( 사실과 다른 정보를 생성하는 현상)' 을 일으키는 것으로 나타났다. AI가 사람들의 사고방식에 영향을 미칠 수 있다는 연구 결과가 있는 만큼, 이런 환각 발생률은 우려되는 대목이다.
사실과 다른 정보 제공하는 언어 모델 언어 모델이 환각 현상을 보이는 이유는 인 터넷상의 방대한 텍스트 데이터를 기반으로 통계적 패턴을 학습하고 작동하기 때문이다. 즉, 이들의 정보가 반드시 현실 세계의 사실 에 근거한 것은 아니라는 뜻이다. 또한 상식 이나 진지한 표현과 풍자적인 표현을 구별하 는 능력 등 인간이 가진 다른 역량도 부족하 다. 대부분의 거대 언어 모델과 마찬가지로, 구글의 모델도 레딧을 포함한 수많은 인터넷 출처에서 수집한 정보로 학습되었을 가능성 이 크다. 그 결과 모델은 해당 사용자의 농담 을 진지한 조언으로 잘못 해석하는 사례가 종 종 있다. AI 가 만들어낸 잘못된 정보( 환각) 중 일부 는 실제 피해를 초래할 수도 있다. AI 검색 엔 진과 챗봇이 이미 거짓으로 판명된 인종차별 적 사이비 과학을 사실인 양 인용한 사례가 반복적으로 발견되고 있다. 퍼플렉시티 AI 가 캘리포니아의 한 경찰관을 저지르지도 않은 범죄의 범인으로 지목하기도 했다. 구글 검색창에 " 청소년에게 적절하지 않은 과도한 스크린 타임( 화면 시청 시간) 은 어느 정도인가?" 라는 간단한 질문을 입력해 보면, 구글은 오랫동안 해왔던 방식대로 관련 링크 를 나열하는 대신, AI 가 생성한 답변을 제시 한다. AI 에이전트는 구체적인 수치를 언급 한 뒤 답변을 좀 더 심화해 설명했는데, 단순 히 시간의 양보다는 활동의 질과 균형이 더 중요할 수 있다. 그리고 ' 과도한 ' 시간의 기준 은 해당 청소년의 수면, 운동, 학업 부담, 기분 상태 등에 따라 달라질 수 있다.
" 매일 아스피린을 복용해야 할까?" 라는 질 문으로 다시 검색해 보면, 이번에는 AI 가 의 학적 정보를 제공하고 위험 요소를 경고했고, 나이와 병력을 입력하면 더 맞춤화된 조언을 제공하겠다고 제안했다. 모두 훌륭한 답변이지만, 흥미로웠던 점은 이 답변들이 서로 다른 성격을 띠고 있었다는 것이다. AI 답변에 관한 논의는 주로 정확성, 즉 시스템이 올바른 답을 내놓았는지에 초점 을 맞춰 왔다. 정확성도 중요하지만, 그것은 여러 평가 기준 중 하나일 뿐이다. 답변 유형 에 따라 사용자가 판단해야 할 요소도 달라지 기 때문이다.
AI 답변을 ' 사실적( factual)', ' 해석적( interpretive)', ' 구성적( constructive)', ' 전략 적( strategic)' 이라는 네 가지 유형으로 분류 하는 것이 사실 여부 판단에 유용할 수 있다. 사실적( factual) 주장은 대개 출처를 통해 그 진위 여부를 확인할 수 있다. 해석적( interpretive) 답변은 정확할 수 있지만, 동시에 어 떤 증거를 중요하게 여길지에 대한 선택이 반 영된 결과물이다. 구성적( constructive) 답변 은 논리적으로 타당하더라도 그것을 받아들 이는 사람에게는 적합하지 않을 수 있다. 전 략적( strategic) 문서가 아무리 훌륭하게 작 성되었더라도 그 내용이 사실이 아닐 수도 있 다. 하지만 AI 는 이 네 가지 유형의 답변을 모 두 비슷하게 유창하고 권위 있는 어조로 제시

답변 토대로 추가 질문으로 일관성 점검 잘못된 정보를 제시하는 환각 현상 보여

하기 때문에, 그 차이를 간과하기 쉽다. 이 네 가지 범주가 서로 엄격하게 구분되는 것은 아니다. AI 에이전트의 답변 하나에 여 러 유형이 복합적으로 반영될 수도 있다. 그 럼에도 불구하고, 각 답변 유형을 설명하고, 해당 답변을 바로 사용할 수 있을지 아니면 추가적인 조사가 필요할지 판단하는 지침을 제시하고자 한다.
구글은 어떤 유형의 답변을 제공하고 있을 까? 사실적 답변은 원칙적으로 증거를 통해 확 인할 수 있는 주장을 담고 있다. " 버지니아 대 학교는 언제 설립되었는가?", " 금의 원소 기 호는 무엇인가?" 와 같은 질문이 이에 해당한 다. 사실적 답변을 신뢰하고 사용해도 될지 판단하려면, 적절한 출처를 통해 해당 주장 이 타당한지 확인해야 한다. 답변에 출처가 명시되어 있다면, 단순히 그 답변 자체를 증 거로 받아들이기보다 해당 링크를 직접 확인 해 보아야 한다. 해석이 필요한 답변은 증거를 바탕으로 하 지만, 단 하나의 정해진 결론이 존재하지는 않는다. 청소년에게 적절한 화면 시청 시간은 어느 정도일까? 원격 근무가 생산성을 높일 까? 이에 대한 답은 어떤 증거를 포함하고 무 엇을 배제했는지, 그리고 상반된 견해를 어떻 게 이해하는가에 따라 달라진다. 화면 시청 시간에 대한 질문에 구글은 처음 에 청소년의 경우 2 시간이 한계라고 답했다. 하지만 이어서 소아과 전문 지침은 단순한 시 청 시간보다는 화면 사용의 질과 맥락을 더 중요하게 여긴다는 점을 언급했다. 미국소아 과학회( AAP) 는 청소년에게 권장되는 정확 한 시간은 없고, 오히려 어떤 방식으로 화면 을 사용하는지, 그리고 그로 인해 어떤 활동 이 대체되는지가 중요하다고 강조한다. 수치 로 답할 수 있을 것 같았던 질문이 실제로는 해석이 필요한 문제였던 것이다. 해석이 필요한 답변을 평가할 때는 단순히 사실 여부만 확인해서는 안된다. 시스템이 어 떤 증거를 강조하고 무엇을 생략했는지, 그리 고 타당한 근거를 갖춘 다른 해석이 존재할 수 있는지 자문해 봐야 한다. 검색 엔진에 던 져볼 만한 유용한 후속 질문은 " 다른 결론을 뒷받침하는 가장 강력한 증거는 무엇인가?" 라고 묻는 것이다. 건설적인 답변은 단순히 발견되는 것이 아 니라 만들어지는 것이다. AI 에게 자기소개서 초안 작성, 추도사 작성, 또는 문단 재구성을 요청해 보면 단 하나의 정답이 존재하지 않 는다. 답변의 목적, 대상, 그리고 어조를 고려 해 그 결과를 평가할 수 있다. 문법적으로 완
벽한 추도사라 해도 막상 낭독하는 사람의 평 소 말투와 전혀 어울리지 않거나, 듣는 유가 족에게 별다른 울림을 주지 못할 수도 있다. 고인의 생전 모습을 제대로 담아내지 못할 수 도 있어서 답변을 읽을 때 이런 측면들을 함 께 고려해야 한다.
전략적 질문은 ' 무엇을 해야 할지 ' 를 묻는 질문이다. " 매일 아스피린을 복용해야 할 까?", " 이 집을 사야 할까?" 와 같은 질문이 이 에 해당한다. 이런 질문에 대한 답변은 정보 와 목표, 위험 요소, 상충하는 관계, 그리고 개인적 상황에 대한 판단을 종합해 구성된다 아스피린에 대한 검색 사례는 맥락이 왜 중 요한지를 잘 보여준다. 구글은 위험성을 경고 하고 의료 전문가와 상담할 것을 권장했고, 나이, 심혈관 질환 병력, 출혈 위험 등의 정 보를 제공하면 더 맞춤화된 정보를 주겠다고 제안했다. 이런 신중한 태도는 미국 예방서비스 태스 크포스( USPSTF) 의 지침과 일치한다. 해당 지침은 심장마비 및 뇌졸중 예방을 위한 저 용량 아스피린 복용 여부는 개인별 상황에 맞 춰 결정해야 하며, 심혈관 건강상의 이점과 출혈 위험을 비교 · 검토해야 한다고 명시하 고 있다.
전략적인 답변을 얻으려면, 시스템이 질문 자에게 적합한 조언을 내리기 위해 사전에 알 아야 할 정보가 무엇인지 물어보는 것이다. 사안의 중요성, 대안, 그리고 전문가의 개입 이 필요한지 여부도 고려해야 한다. 아스피린 관련 질문을 예로 들면, " 나이, 병력, 출혈 위 험 등 어떤 세부 정보가 이 조언을 바꿀 수 있 는지, 결정을 내리기 전에 의사와 무엇을 상 의해야 하는지 후속 질문을 던지는 것이다.
답변을 받은 후 던져야 할 첫 번째 질문 평범한 구글 검색으로 첫번째 질문을 시작 할 수 있다. 챗봇을 별도로 실행하는 것이 아 니라 AI 가 생성한 답변이 관련 링크와 함께 제공되면 그 링크를 실제로 열어보는 것이다. 답변은 유용할 수 있고 구글은 맥락을 보충 하고 복잡한 변수를 인정하고, 추가 정보를 제공할 경우 맞춤형 지침을 제시하기도 한다. 하지만 답변 내용 안에서 답변의 성격은 달 라질 수 있다. 의학적 지침의 내용을 전달하는 것과 그것 을 특정 개인에게 어떻게 적용할지 결정하는 것은 별개의 문제이기 때문이다. 사용자로서, 받은 답변을 위해 AI 에이전트 가 어떤 종류의 지적 작업을 수행했는지 파악 해 볼 수 있다. 그 해석이 설득력이 있는지, 혹 은 그 조언이 자신의 상황에 적합한지 따져봐 야 한다. AI 의 답변이 옳은 지 묻기 전에, 더
근본적인 질문을 던져본다. " 이것은 어떤 종 류의 답변인가?" 답변의 유형을 파악하면 다 음에 무엇을 해야 할지 알 수 있다.
확신 수준 표시하기 진실성을 최우선으로 하는 AI 시스템을 구 축하는 것은 어려운 일이지만, 불가능한 것 은 아니다. AI 개발자들이 이 문제에 접근하 는 한 가지 방법은 답변에 대한 확신 수준을 전달하는 모델을 설계하는 것이다. 이는 주로 신뢰도 점수의 형태로 나타나는데, 이는 모델 이 정확한 정보를 제공하고 있을 확률을 나타 내는 수치다. 이런 추정을 위한 일반적인 접근 방식 중 하 나는 모델에게 동일한 질문에 대해 반복적으 로 답변하도록 하는 것이다. 신뢰할 수 있는 모델이라면 같은 질문에 대해 유사한 답변을 내놓아야 한다. AI 가 일관된 답변을 내놓지 못한다면, 이는 정확한 답변에 필요한 정보가 부족하기 때문일 가능성이 크다. 시간이 지남 에 따라 이런 테스트 결과는 특정 주제 영역 에 대한 AI 의 신뢰도 점수로 축적된다. 다른 접근 방식으로는 AI 모델이 자신의 답 변에 대해 어느 정도 확신하는지 직접 밝히도 록 유도하거나 학습시키는 방법이 있다. 하 지만 이는 실질적인 책임성을 보장하지 못한 다. AI 가 스스로 신뢰도를 평가하게 하면, 시 스템이 자체적으로 합격점을 주고 계속해서 잘못되거나 유해한 정보를 제공할 여지가 남 기 때문이다. AI 모델의 답변과 함께 신뢰도 점수를 공개 하면, 사람들은 이런 도구가 제공하는 정보의 진위 여부에 대해 더 비판적으로 생각할 수 있게 된다. 또한 언어 모델이 설정된 기준치 미만의 신뢰도 점수를 받을 경우 정보 제공을 보류하도록 학습시킬 수도 있다. 신뢰도 점수 를 활용해 AI 모델이 더 정확한 답변을 생성 하도록 돕는 방법도 있다. 진정으로 정확한 AI 를 구현하기까지는 아 직 갈 길이 멀다. 이런 접근 방식 대부분은 AI 의 정확성을 올바르게 평가하는 데 필요한 정 보가 위키백과나 기타 온라인 데이터베이스 에 존재한다고 가정한다. 하지만 정확한 정보 를 쉽게 얻기 어려운 경우, 신뢰도 추정치는 오히려 오해를 불러일으킬 수 있다. 이런 상 황에 대비해 구글은 AI 가 생성한 진술을 평 가하기 위한 특수 메커니즘을 개발했다. 환각( hallucination) 현상을 흔히 유발하는 프롬 프트( 질문 / 명령어) 로 구성된 데이터셋을 구 축한 것이다. 그러나 이런 접근 방식은 모두 기본적인 사 실 확인에 초점을 맞추고 있다. 인과 관계나 여러 문장으로 구성된 텍스트를 바탕으로 추 론하는 AI 의 능력 등, 긴 형식의 콘텐츠가 가 진 다른 측면을 평가할 자동화된 방법은 아직 없다. AI 의 이런 요소를 개선하는 도구를 개 발하는 것은, 해당 기술을 신뢰할 수 있는 정 보원으로 만들고 잘못된 정보로 인한 피해를 예방하는 데 있어 핵심적인 단계다.