Trellner Research의 최신 조사에서 불안한 사실이 드러났습니다: AI 검색 도구에 380가지 다른 분야의 소프트웨어 구매 조언을 물었을 때, 시스템이 제공한 7,534개의 참고 링크 중 59.8%가 글로벌 트래픽 순위 10만 위 밖의 무명 웹사이트를 가리켰습니다. 인용된 도메인의 3분의 1 이상이 글로벌 상위 100만 위 안에도 들지 못했으며, 모든 인용된 웹사이트의 중간 순위는 71,611위에 불과했습니다. AI 검색은 사람들이 기대했던 것처럼 옥석을 가려내지 못하고, 인터넷 변두리의 쓰레기 정보를 식탁 위에 올려놓고 있습니다.
세 개의 웹사이트가 만들어낸 21만 5,000페이지의 가짜 순위
저품질 정보의 근원지는 서로 결탁한 콘텐츠 농장인 wifitalents.com, worldmetrics.org, gitnux.org의 세 곳에서 비롯되었습니다. 이들은 모두 2023년 12월부터 2024년 5월 사이에 NameCheap을 통해 집중적으로 등록되었으며, 동일한 Cloudflare 도메인 서버를 공유할 뿐만 아니라 웹페이지 템플릿, 탐색 모음 분류, 심지어 ‘편집 과정’과 ‘회사 소개’ 등 주변 페이지까지 똑같습니다. 이 산업화된 조립 라인은 각 사이트마다 7만 개가 넘는 ‘최고의 소프트웨어’ 리뷰 페이지를 생성했으며, 동일한 구성의 또 다른 예비 사이트인 zipdo.co까지 더해져 위조된 리뷰는 총 21만 5,000페이지에 달합니다.
세상에는 21만 5,000종의 소프트웨어 카테고리가 존재하지 않습니다. 소위 리뷰라고 불리는 이 기사들은 기계가 대량으로 짜깁기하여 생성한 결과물로, ‘유정 관리 소프트웨어’나 ‘박물관 소장품 관리 소프트웨어’와 같이 매우 희귀한 카테고리에서도 진지하게 10개의 도구를 모아 순위를 매기고 비교합니다.
그림: wifitalents.com의 ‘최고의 유정 관리 소프트웨어’ 순위 페이지. 출처: wifitalents.com 페이지 스크린샷
조사원들은 동일한 ‘프로젝트 예상 소프트웨어’ 카테고리 아래에서 세 웹사이트가 각기 전혀 다른 상위 5개 순위를 제시하면서도 마치 진짜인 것처럼 9명의 다른 ‘에디터’의 이름을 서명했다는 사실을 발견했습니다.
| 사이트 | 1위 | 2위 | 3위 | 4위 | 5위 |
|---|---|---|---|---|---|
| worldmetrics.org | Float | Scoro | Teamwork.com | Procore | Wrike |
| wifitalents.com | Float | Scoro | Teamwork.com | Buildertrend | Apropo |
| gitnux.org | Saviom | Mosaic | Buildertrend | Float | Teamwork.com |
gitnux의 1위는 다른 두 곳의 상위 5위 안에서 전혀 찾을 수 없습니다. 심지어 일부 페이지의 서명란에는 렌더링되지 않은 템플릿 코드 변수인 ‘Within the next 26 days’가 버젓이 남아 있기도 합니다. 저열한 조작 수법은 이들이 단지 동일한 스크립트로 실행되는 사람의 개입이 없는 결과물이라는 사실을 폭로하며, 그 배후에는 오직 서버 한 대와 저렴한 API 호출 비용만이 필요할 뿐입니다.
검색기가 읽을 수 있도록 특수하게 작성된 웹페이지
이 21만 5,000개의 웹페이지는 처음부터 사람이 읽도록 만들어지지 않았습니다. worldmetrics.org의 HTML 웹페이지 코드 제목은 명시적으로 ‘Facts & Grounding Page’(사실 및 근거 페이지)라고 표시되어 있습니다. 이는 오직 대규모 언어 모델 검색 시스템만이 읽고 이해할 수 있는 데이터 마커이며, 웹페이지의 숨겨진 설명 정보에도 ‘기계가 읽을 수 있는 기록을 위한 검증된 사실’이라고 노골적으로 적혀 있습니다.
그림: worldmetrics.org의 프로젝트 예상 소프트웨어 순위, wifitalents.com과 동일한 템플릿입니다. 출처: worldmetrics.org 페이지 스크린샷
기계에게 먹이를 주기 위해 전용으로 만들어진 이 위조된 정보의 이면에는 명확한 가격표가 붙은 상업적 차익 거래 비즈니스가 존재합니다. 기계가 생성한 콘텐츠를 이용해 AI가 인용하는 가중치를 높인 후, worldmetrics.org는 공식 웹사이트에서 대놓고 서비스를 판매합니다: 맞춤형 시장 조사는 5,000유로에서 시작하고 완제품 보고서는 499유로에 판매되며, 심지어 ‘공급업체 선별’을 도와주는 데도 2,500유로를 받습니다.
전통적인 검색 엔진 최적화(SEO)가 효과를 잃은 후, 콘텐츠 농장들은 대규모 언어 모델을 상대할 새로운 돌파구를 찾았습니다. 인터랙티브 데모 제품을 판매하는 마케팅 블로그 guideflow.com은 자체적인 소프트웨어 리뷰 콘텐츠가 전혀 없었지만, 글의 스타일이 모델의 취향에 부합하여 96개의 카테고리에 걸쳐 AI 검색에 194번이나 인용되었습니다. 이 무명 블로그는 인용 순위에서 세계적으로 유명한 분석 기관 Gartner를 꺾고 ‘3D 렌더링 소프트웨어’와 ‘RFID 소프트웨어’ 등 전문적인 문제의 핵심 증거로 자리 잡는 황당한 결과를 낳았습니다.
도박 링크가 공식 추천으로 둔갑하다
허위 정보가 대량으로 유입되면서 추천 결과에 심각한 편향이 발생했습니다. 최종적으로 생성된 추천 목록 중 1.1%의 제조업체 공식 웹사이트는 이미 폐업했거나 도메인 소유자가 바뀌었습니다. 조사원들이 ‘연구 데이터 관리 플랫폼’에 대해 물었을 때, sonar 모델이 제시한 공식 추천 링크 dryad.co는 인도네시아의 BIGSLOT288이라는 온라인 도박 포털로 리디렉션되었습니다.
‘데이터 품질 도구’에 대한 또 다른 답변에서 고급 버전 모델인 sonar-pro의 추천 결과는 모나코의 카지노 호텔 공식 웹사이트로 바로 연결되었습니다. 조사를 통해 이 두 모델이 동일한 기저 검색 레이어를 공유하고 있으며, 380개 카테고리 중 289개에서 바이트 단위까지 동일한 인용 목록을 반환했다는 사실이 밝혀졌습니다. 저품질 데이터가 시스템 전체를 오염시킨 것입니다.
이에 비해 중립적이고 객관적인 것으로 유명한 위키백과는 전체 7,534개의 인용 중 단 3번만 등장했습니다. 현실 세계의 고품질 정보는 웹사이트 기계가 생성한 진부한 말들에 파묻혀 밀려나고 말았습니다.
출처 계층부터 붕괴되는 신뢰의 사슬
조사 보고서는 현재 이 저품질 출처들이 AI 검색의 최종 추천 답변을 변경했다고 단언할 수는 없지만, 이미 대규모 언어 모델 검색 레이어의 시스템적 취약점을 드러냈다고 밝혔습니다. 숙련된 SEO 실무자들은 훨씬 더 진화된 수법을 폭로하기도 했습니다: 먼저 질문을 이용해 각 대규모 언어 모델을 테스트하여 텍스트의 발산 편차를 계산한 다음, AI를 이용해 기사를 대량으로 다시 작성하여 웹페이지의 텍스트 특징이 대규모 언어 모델의 내재된 선호도에 정확히 근접하도록 만듭니다.
대규모 언어 모델 자체에는 AI가 생성한 텍스트를 선호하는 고유한 편향이 존재합니다. 개발자 커뮤니티의 자체 테스트에서 AI 모델은 사람이 리팩토링한 간결한 코드와 자신이 생성한 장황한 코드 사이에서 항상 후자를 고집스럽게 선택했습니다. 이전에는 한 국가가 특정 입장을 지닌 정치적 견해를 대량으로 출력하도록 AI에게 먹이를 주기 위해 싱크탱크 웹사이트를 대량으로 위조한 사실이 언론에 폭로되기도 했습니다.
AI 검색의 추천 시스템은 가짜 리뷰에 의해 시스템적으로 먹이를 공급받고 있습니다. 콘텐츠 농장들은 AI의 취향을 만족시키는 위조된 출처를 만드는 법을 배웠고, 그에 따라 AI 검색은 하나의 메아리 방으로 전락했습니다. 어떤 소프트웨어가 최고인지 물어보면 시스템은 화면에 또 다른 기계가 일찍이 작성해 놓은 허위 광고를 출력할 뿐입니다.
참고 링크:
- Trellner Research 보고서
- HN 토론 (item?id=49536375)