"실시간 정보를 수집하라고 에이전트를 가동해 뒀더니, 구글 검색 결과 상단에 뜬 광고 블로그나 낚시성 뉴스 기사를 그대로 집어삼키고는 엉뚱한 정보로 허위 리포트를 완성해 놓았습니다."
외부 검색이나 RAG(검색 증강 생성) 기능을 AI 에이전트에 탑재해서 자동화 파이프라인을 운영하다 보면, 개발자의 목을 죄어오는 진짜 문제는 에이전트의 지능 자체보다 '외부에서 흘러들어오는 오염된 데이터(Garbage In, Garbage Out)'라는 것을 깨닫게 됩니다.
에이전트는 사용자가 요구한 정보를 찾기 위해 웹을 검색하지만, 검색 로봇이 긁어오는 텍스트 안에는 노골적인 키워드 도배성 광고, AI 양산형 자극적 낚시글, 심지어 프롬프트 인젝션(Prompt Injection) 공격 코드까지 섞여 있기 마련이죠. 오늘은 제가 직접 겪었던 '저품질 검색 데이터 오염 잔혹사'와 이를 완벽하게 차단해 낸 '3단계 지식 클렌징 & 출처 검증 파이프라인' 구축기를 이야기해 볼게요.
1. "광고글을 가져와서 정답이라고 확신한다고?" - 낚시글의 배신
매일 아침 최신 교육 이슈와 기술 동향을 수집하여 독자들에게 브리핑하는 모닝 에이전트를 운용할 때였습니다. 어느 날 아침 도출된 브리핑 리포트를 보고 제 눈을 의심할 수밖에 없었지요. 특정 기술의 장단점을 분석하는 구절 사이에 노골적인 특정 제품 홍보 문구와 협찬 링크 설명이 진실인 것처럼 뻔뻔하게 들어앉아 있었던 것입니다.
알고 보니 검색 노드 에이전트가 웹에서 긁어온 상위 페이지들 중 SEO 꼼수로 도배된 광고성 양산 블로그 글을 분별하지 못하고 컨텍스트 메모리에 그대로 밀어 넣었던 것이었습니다. AI 에이전트가 헛소리를 하는 환각(Hallucination)보다, 외부의 '진짜 헛소리'를 믿고 정답처럼 가공하는 정보 오염이 훨씬 더 치명적이라는 사실을 뼈저리게 느꼈습니다.
2. 시행착오: 프롬프트로 "광고글은 제외해 줘"라고 부탁했더니...
처음에는 단순히 LLM 요약 프롬프트 끝에 "검색 결과 중 신뢰할 수 없는 광고성 글이나 낚시글은 알아서 무시하고 핵심만 요약해"라는 지시문을 덧붙였습니다.
하지만 이미 수만 토큰에 달하는 저품질 웹 페이지 텍스트가 컨텍스트 윈도우에 진입한 상태에서는, 모델이 입력 텍스트 전체의 분위기에 휘둘려 광고 문구와 실제 정보를 명확히 가려내지 못했습니다. 게다가 불필요한 스팸 텍스트를 처리하느라 API 토큰 비용만 4배 이상 폭증했지요. 오염된 물을 LLM이라는 정수기에 바로 붓는 대신, 정수기 입구에 물리적인 대형 필터를 장착해야만 했습니다.
💡 몬이쌤의 생각: 아이들에게 교과서나 검증된 위인전을 읽혀야지, 출처도 불분명한 자극적인 지라시 유인물을 읽게 하면 잘못된 상식이 뼈대로 자리를 잡습니다. 공부를 시작하기 전 아이의 책상 위에 '진짜 유익한 책만 선별해 올리는 작업'이 선행되어야 하는 것과 똑같습니다.
3. 해결책: '3단계 데이터 클렌징 & 도메인 신뢰도 필터' 프로토콜
외부 검색 데이터에 의한 시스템 오염을 근본적으로 방지하기 위해, 저는 수집 노드와 생성 노드 사이에 '3단계 스팸 차단 및 클렌징 레이어'를 전면 배치했습니다.
- 1단계 [도메인 스코어링 & 블랙리스트 필터링]: 수집된 URL의 도메인을 최우선 검증합니다. 정부 기관, 언론사, 공식 문서 도메인에는 높은 점수를 부여하고, 키워드 도배나 양산형 블로그 패턴을 가진 도메인은 사전 블랙리스트 DB를 통해 0.1초 만에 걸러냅니다.
- 2단계 [HTML 노이즈 & 광고 태그 정제(Clean Parsing)]: 웹 페이지의 raw HTML에서 본문 텍스트 외에 사이드바, 댓글, 광고 스크립트, 쿠키 안내문 등을 전용 파서(Parser)로 말끔히 제거하고 '순수 본문 단락'만 추출합니다.
- 3단계 [교차 검증(Cross-Verification) 앵커링]: 단 하나의 출처에서만 나오는 파격적인 수치나 주장은 에이전트가 단정적으로 인용하지 못하도록 막고, 최소 2개 이상의 독립된 출처에서 공통으로 확인된 지식 덩어리(Chunk)만 최종 컨텍스트로 채택합니다.
4. 결과: 리포트 신뢰도 100%, 토큰 비용 65% 절감!
3단계 데이터 클렌징 방어막을 세운 이후, 저품질 웹 스팸이나 낚시성 뉴스 기사에 에이전트가 휘둘리는 현상이 100% 완벽하게 사라졌습니다!
쓸데없는 광고와 노이즈 텍스트를 LLM에 전달하기 전에 미리 쳐내면서, 회당 소비되는 토큰 비용도 65% 이상 크게 줄어들었고, 도출되는 인사이트의 품질은 비할 데 없이 정갈해졌지요.
AI 에이전트를 고도화한다는 것은 단순히 더 크고 똑똑한 LLM을 사 오는 것이 아닙니다. '에이전트의 눈과 귀가 되는 외부 데이터 통로에 맑고 깨끗한 정보만 흐르도록 정수 필터를 단단히 설치하는 것'이 시스템 설계자의 진짜 경쟁력입니다.
여러분의 에이전트도 외부 검색이나 웹 스크래핑을 도입한 뒤 엉뚱한 수치를 말하거나 광고 문구를 읊는다면, 무작정 프롬프트를 고치지 말고 텍스트 클렌징 필터를 붙여보세요. 흠잡을 데 없이 단단하고 신뢰도 높은 자동화 시스템을 완성하시게 될 겁니다.
