- 구글이 제미나이 4의 첫 모델 「아르곤」을 공개했어요.
- 모르는 문제에서 아는 척한 비율이 15%로, 비교된 경쟁 모델의 3분의 1도 안 돼요.
- 대신 맞힌 문제는 더 적어요. 아직 보안 전문가들만 먼저 쓰고 있어요.
안녕하세요, 제시예요. AI에게 뭔가를 물었는데 아주 그럴듯한 답이 돌아와서 믿었다가, 나중에 보니 틀린 말이었던 적 있으세요? 이렇게 AI가 모르는 것을 지어내서 말하는 걸 할루시네이션이라고 불러요. 이번 주에 구글이 내놓은 새 AI가 바로 이 지점에서 눈에 띄는 숫자를 받았어요. 내가 AI 답을 얼마나 믿어도 되는지와 바로 이어지는 이야기라, 차근차근 풀어 볼게요.
제미나이 4의 첫 모델, 아르곤이 나왔어요
제미나이는 구글이 만드는 AI의 이름이에요. 휴대폰이나 검색창에서 질문에 답해 주는 그 AI요. 구글은 9월 30일에 그 네 번째 세대의 첫 모델을 공개했고, 이름을 「제미나이 4 아르곤」이라고 붙였어요.
다만 지금 당장 누구나 쓸 수 있는 건 아니에요. 구글은 먼저 정부 기관과 해킹을 막는 보안 담당자들에게만 열었어요. 새 AI가 컴퓨터 취약점을 찾는 실력까지 좋아져서, 나쁜 데 쓰이지 않게 안전장치를 먼저 다듬겠다는 거예요. 개발자와 유료 구독자에게는 그다음에 열리는데, 날짜는 아직 안 나왔어요.
틀리면 감점, 비우면 0점인 시험
이 숫자를 매긴 곳은 AI 모델들을 같은 시험지로 비교하는 독립 평가 회사예요. 이 회사의 지식 시험은 채점 방식이 좀 독특해요.
학교 시험을 떠올려 보면 쉬워요. 보통은 모르는 문제도 일단 아무 번호나 찍는 게 이득이죠. 틀려도 손해가 없으니까요. 그런데 이 시험은 틀린 답에 감점을 주고, 「모르겠어요」라고 비워 두면 0점이에요. 찍는 버릇이 그대로 점수에 드러나게 만든 거예요.
여기서 할루시네이션 비율은 이렇게 셉니다. 맞히지 못한 문제만 따로 모은 다음, 그중에 「모르겠다」고 하지 않고 틀린 답을 지어낸 비율이 얼마인지 봐요.
| 모델 | 맞힌 비율 | 못 맞힌 문제에서 지어낸 비율 |
|---|---|---|
| 제미나이 4 아르곤 (구글) | 50% | 15% |
| GPT-6 아스트라 (오픈AI) | 63% | 51% |
| GPT-6.1 솔 (오픈AI) | 확인 못 함 | 54% |
아르곤은 모르는 문제 열 개 가운데 여덟 개 넘게 「모르겠다」고 답했어요. 비교된 오픈AI 모델들은 절반 넘게 뭔가를 지어냈고요. 평가 회사는 아르곤의 15%가 상위권 모델 가운데 가장 낮다고 밝혔어요.
대신 아는 것 자체는 더 적어요
여기서 오해하기 쉬운 부분이 하나 있어요. 아르곤이 더 똑똑해서 덜 틀린 게 아니에요.
표를 다시 보면 맞힌 비율은 아르곤이 50%, 아스트라가 63%예요. 아는 문제 수만 따지면 아스트라가 더 많이 알아요. 아르곤의 장점은 많이 아는 것이 아니라 자기가 모르는 걸 안다는 것이에요.
반에 친구가 둘 있다고 생각해 볼게요. 한 친구는 아는 게 많지만 모르는 것도 자신 있게 말해요. 다른 친구는 아는 건 조금 적어도 모르면 「그건 잘 모르겠어」라고 말해요. 숙제를 물어볼 때 누가 더 믿음직할까요? 대부분은 뒤엣친구를 고를 거예요. 틀린 답을 믿고 그대로 써 가는 게 제일 곤란하니까요.
우리가 AI 답을 볼 때 달라질 것
아르곤 같은 AI가 널리 쓰이면, AI에게서 「확실하지 않아요」나 「모르겠어요」라는 답을 듣는 일이 늘어날 수 있어요. 처음엔 답답하게 느껴질지도 몰라요. 그런데 그건 고장이 아니라 믿을 수 있는 답과 아닌 답을 AI가 미리 골라 준 것이에요.
그래도 15%가 0%는 아니에요. 모르는 문제 일곱 개 중 한 개꼴로는 여전히 지어내요. 그러니 건강이나 돈, 법처럼 틀리면 곤란한 질문은 지금처럼 출처를 한 번 더 확인하는 습관이 필요해요.
한 가지 더 알아 두면 좋아요. 이 점수는 한 회사의 한 시험에서 나온 숫자예요. 같은 날 다른 평가에서는 아르곤이 코딩이나 실제 업무에서 기대보다 약했다는 말도 나왔어요. 새 모델이 나올 때마다 숫자 하나만 보고 판단하지 말고, 여러 평가가 쌓이는 걸 같이 지켜보면 좋겠어요.
전체 문제로 다시 계산한 숫자 보기
표의 「지어낸 비율」은 못 맞힌 문제 안에서 센 값이에요. 못 맞힌 비율에 지어낸 비율을 곱해 전체 문제로 다시 어림하면, 아르곤은 전체의 약 7~8%에서 틀린 답을 냈고 아스트라는 약 19%에서 틀린 답을 냈어요. 공개된 두 숫자를 곱한 어림값이라 정확한 값은 아니에요.
오래 생각하는 만큼 붙는 비용 보기
평가 회사에 따르면 아르곤은 한 과제를 푸는 데 아스트라보다 두 배 넘게 많은 토큰을 써요. 토큰은 AI가 글을 읽고 쓰는 단위예요. 그만큼 답이 늦어지고 비용이 붙어요. 그래도 할인된 가격을 적용하면 과제 하나를 푸는 비용은 아스트라보다 낮게 나왔다고 해요.
출처: 구글 공식 블로그 「Gemini 4 Argon」(2026-09-30). Artificial Analysis 평가 결과(AA-Omniscience, Intelligence Index) 및 이를 다룬 The Decoder·Startup Fortune·AI Weekly 보도(2026-09-30~10-01). 실무 평가 관련 반응은 The Neuron 9월 30일 정리.
