AI 유령 인용이 한 해 81% 늘었다는데, 왜 AI는 없는 논문을 만들어낼까 — 5만 6천 편 검증이 보여준 것

AI에게 자료를 물어보면 저자·제목·학회까지 갖춘 논문을 알려 주는데, 찾아보면 없는 경우가 있습니다. 이른바 유령 인용입니다. 올해 2월 난카이대와 칭화대 연구팀이 상위 학회 논문 5만 6천 편의 인용 220만 건을 검증한 결과, 2025년 논문의 허위 인용 비율은 1.61%로 2020~2024년 평균 0.89%보다 80.9% 늘었습니다. 이 글은 AI가 왜 없는 논문을 만들어내는지, 모델마다 얼마나 다른지, 그리고 사용자가 어떻게 걸러낼 수 있는지를 정리합니다. 내용은 2026년 9월 6일 기준입니다.

숫자부터 — 5만 6천 편, 220만 건

2월 11일 보도에 따르면 연구팀은 NeurIPS·ICML·IEEE S&P 같은 상위 학회에 2020~2025년 실린 논문 56,381편의 인용 220만 건을 자동 검증하고, 의심 인용 2,530건을 연구자 16명이 한 달간 손으로 다시 확인했습니다.

항목값
2025년 허위 인용률1.61% (2020~2024 평균 0.89%, +80.9%)
환각 인용이 확인된 논문604편 (1.07%)
그중 유령 인용(존재하지 않는 문헌)486편 (0.86%)
모델별 인용 환각률(연구팀 실험)GPT-5 50.92%, 클로드 4 21.84%, 딥시크 14.23%, 훈위안 94.93%

연구팀의 설명은 이렇습니다. “AI 모델들은 실제 저자 이름, 그럴듯한 제목, 유명 학회명을 통계적으로 조합해 겉보기에는 완벽해 보이지만 실제로는 존재하지 않는 참고문헌을 만들어낸다.” 1%대라는 비율이 작아 보일 수 있지만, 논문 100편 중 한 편에 존재하지 않는 근거가 들어 있다는 뜻이고 증가 속도가 문제입니다.

왜 없는 논문을 만들어낼까

언어 모델은 문헌 목록을 검색해서 가져오는 것이 아니라 “이 자리에 올 법한 글자”를 확률로 이어 붙입니다. 학습 데이터에는 수백만 건의 참고문헌 형식이 있으니, “누구누구 et al., 2023, NeurIPS”라는 틀은 완벽하게 배웠습니다. 문제는 그 틀을 채우는 저자·제목·연도 각각이 실제 한 논문에서 함께 온 것인지를 모델이 확인하지 않는다는 점입니다. 자주 등장하는 저자 이름과 자주 등장하는 주제어를 조합하면 통계적으로 가장 그럴듯한 인용이 만들어지고, 그것이 유령 인용입니다.

모델마다 비율이 다른 이유도 여기 있습니다. 검색 도구를 붙이거나, 모르면 모른다고 말하도록 훈련하거나, 인용을 출력할 때 근거를 대조하도록 만들면 비율이 떨어집니다. 표의 편차가 크다는 것은 이 문제가 “언어 모델의 숙명”이 아니라 설계와 훈련으로 줄일 수 있는 것이라는 뜻이기도 합니다. GPT-6 아스트라의 시스템 카드가 사용자가 신고한 오류 사례에서 이전 모델보다 사실 오류가 크게 줄었다고 밝힌 것도 같은 방향입니다. AI가 답을 거부하는 쪽과 지어내는 쪽은 같은 동전의 양면이라, 거부하는 이유와 아첨하는 이유를 같이 보시면 그림이 잡힙니다.

유령 인용을 알아보는 신호

조합된 인용에는 공통된 무늬가 있습니다. 첫째, 저자 조합이 낯설지 않은데 함께 쓴 적이 없는 경우입니다. 같은 분야의 유명 저자 둘이 나란히 붙어 있으면 의심합니다. 둘째, 제목이 주제어를 매끈하게 요약합니다. 실제 논문 제목은 대개 더 구체적이고 어색합니다. 셋째, 학회·연도·페이지가 그럴듯하지만 DOI가 없거나 열리지 않습니다. 넷째, 같은 모델에 다시 물으면 세부 항목이 바뀝니다. 실제 논문은 몇 번을 물어도 같은 답이 나옵니다. 이 네 가지가 겹치면 원문 확인 전까지는 인용으로 쓰지 않는 것이 안전합니다.

정책 쪽의 시선 — 환각을 “관리”한다는 것

한국지능정보사회진흥원은 1월 27일 ‘AI 환각: 위험 관리와 창의적 활용을 위한 정책 대응 전략’ 보고서에서 환각을 없애야 할 결함으로만 보지 않고, 분야별 위험 등급을 5단계로 나눠 차등 규제하고 창작 영역에서는 활용하자는 ‘CURE(통제–활용–규제–평가)’ 틀을 제안했습니다. 의료·법률·행정처럼 없는 근거가 곧 피해가 되는 분야와, 소설 아이디어처럼 “없는 것”이 오히려 쓸모인 분야를 갈라 보자는 것입니다. 유령 인용은 전자의 문제입니다.

사용자가 걸러내는 법

  1. 인용은 반드시 원문을 엽니다. DOI나 학회 사이트에서 실제로 열리는지 확인하기 전까지는 인용이 아니라 후보입니다. 위 연구에서 “자동 검증 뒤 사람이 재검증”한 것이 바로 이 절차입니다.
  2. 검색이 켜진 모드로 묻습니다. 모델이 기억에서 짜내는 대신 실제 문서를 찾아 오게 하면 유령 인용이 크게 줄어듭니다. 대신 검색 결과를 그대로 믿는 다른 문제가 생기니 1번은 여전히 필요합니다.
  3. “없으면 없다고 답하라”를 지시에 넣습니다. 완벽하지 않지만 확실하지 않은 인용을 만들어내는 빈도를 낮춥니다.
  4. 세부 항목을 따로 묻습니다. “이 논문의 DOI는?”, “게재 연도는?”처럼 잘게 물으면 조합된 인용은 항목 사이가 어긋나며 드러납니다.
  5. AI가 쓴 초안에 남은 인용은 워터마크와 별개입니다. 문장이 AI 것인지 검출하는 것과 근거가 진짜인지는 다른 문제라, 워터마크 검출이 증명하는 것과 구분해야 합니다.

자주 묻는 질문

환각률은 대체 몇 퍼센트인가요?

작업과 벤치마크에 따라 요약처럼 쉬운 일에서는 1% 미만, 열린 질문에서는 수십 퍼센트까지 벌어집니다. “환각률 X%”라는 숫자는 무엇을 어떤 기준으로 쟀는지 없이는 의미가 없습니다. 벤치마크가 무엇을 재는지는 AI 벤치마크 글에서 다뤘습니다.

학생 과제나 회사 보고서에도 같은 문제가 있나요?

같습니다. 학회 논문은 검증 도구가 있어 수치가 잡힌 것일 뿐, 검증되지 않는 과제·보고서·기사에는 더 많이 남아 있을 가능성이 큽니다. 제출 전에 인용 목록만이라도 하나씩 열어 보는 습관이 가장 싼 방어입니다.

학회는 어떻게 대응하나요?

연구팀이 쓴 것과 같은 자동 검증 도구를 심사에 넣는 방향이 논의됩니다. 인용 220만 건을 사람이 다 볼 수는 없으니, 기계가 걸러 낸 뒤 사람이 확인하는 2단계가 현실적인 답입니다.

최신 모델은 나아졌나요?

위 표는 2025~2026년 초 모델 기준입니다. 9월에 나온 최신 모델들은 사실 오류가 줄었다고 각 사가 밝혔지만, 인용 환각률을 같은 방식으로 잰 공개 수치는 아직 없습니다.

정리

유령 인용은 모델이 거짓말을 하려는 게 아니라 “그럴듯한 조합”을 만드는 방식 자체에서 나옵니다. 2025년 논문의 허위 인용이 한 해 81% 늘었다는 수치는 사용자가 확인 절차를 건너뛰고 있다는 신호입니다. 원문을 열어 보는 한 단계가 해법이고, 그 단계를 기계가 돕게 만드는 것이 다음 과제입니다.

참고: 지디넷코리아(2026-02-11, 난카이대·칭화대 연구), 한국지능정보사회진흥원 보고서(2026-01-27) (2026년 9월 6일 확인)

이 갈래에서 이어 읽기