[아이뉴스24 정종오 기자] 한국과학기술원(KAIST) 연구팀이 데이터가 계속 바뀌어도 필요한 정보까지 찾아가는 ‘검색 길’을 유지해 AI가 최신 정보를 더 정확하고 빠르게 찾는 기술을 개발했다.
KAIST(총장 배충식) 전산학부 김민수 교수 연구팀이 데이터가 지속적으로 추가되고 삭제되는 환경에서도 높은 검색 정확도를 안정적으로 유지하는 동적 벡터 검색 기술인 ‘콘다(CONDA, Connectivity-Aware Dynamic Index)’를 개발했다.
생성형 AI는 학습이 끝난 뒤 새롭게 등장한 정보를 스스로 알지 못한다. 이를 보완하기 위해 최신 뉴스나 기업 내부 문서 등을 검색해 답변에 활용하는 ‘검색증강생성(RAG, Retrieval-Augmented Generation)’ 기술이 널리 쓰이고 있다.
![데이터가 계속 바뀌어도 필요한 정보까지 찾아가는 ‘검색 길’을 유지해 AI가 최신 정보를 더 정확하고 빠르게 찾는 기술을 개발한 KAIST 김민수 교수(오른쪽)와 이다래 석사과정생. [사진=KAIST]](https://image.inews24.com/v1/62f545f8ee0875.jpg)
RAG가 제대로 작동하려면 수많은 자료 가운데 질문에 필요한 정보를 빠르고 정확하게 찾아내는 검색 기술이 중요하다. 현재 많은 AI 서비스는 문서나 이미지의 의미를 컴퓨터가 계산할 수 있는 숫자 묶음인 ‘벡터(Vector)’로 바꾼 뒤 의미가 비슷한 정보들을 서로 연결해 필요한 자료를 찾는다.
문제는 실제 기업이나 인터넷의 데이터는 계속 변한다는 점이다. 새로운 문서와 뉴스, 상품 정보가 들어오는 동시에 오래된 정보는 수정되거나 삭제된다. 이런 변화가 반복되면 데이터 사이에 만들어 놓은 연결망이 조금씩 끊어지는 ‘연결성 붕괴’가 발생할 수 있다. 필요한 정보가 데이터베이스 안에 있는데도 AI가 그곳까지 찾아가지 못하면서 검색 정확도가 떨어지는 것이다.
연구팀이 개발한 CONDA는 데이터 사이의 거리뿐 아니라 필요한 정보까지 찾아갈 수 있도록 검색 경로가 제대로 연결돼 있는지를 함께 고려한다. 새로운 데이터가 추가되거나 기존 데이터가 삭제돼도 중요한 연결을 유지해 특정 정보가 검색망에서 고립되는 것을 막는 방식이다.
실험 결과 CONDA는 데이터가 쉴 새 없이 추가되고 삭제되는 환경에서도 기존 최신 기술 대비 검색 정확도를 최대 24.5% 높였으며 데이터 처리 속도도 최대 1.90배 향상시켰다.
김민수 교수는 “검색증강생성(RAG)의 중요한 가치는 대규모언어모델(LLM)이 미처 학습하지 못한 최신 정보를 필요한 순간 즉시 찾아 활용할 수 있다는 점”이라며 “이번 연구는 데이터가 끊임없이 변하는 현실 환경에서도 인공지능이 오랜 시간 정확하게 최신 지식을 활용할 수 있는 데이터 인프라를 제시했다는 점에서 의미가 크다”고 말했다.
연구에는 KAIST 전산학부 이다래 석사과정 졸업생이 제1저자로 참여했으며 김민수 교수가 교신저자를 맡았다. 연구 결과(논문명: CONDA: A Connectivity-Aware Dynamic Index for Approximate Nearest Neighbor Search over Evolving Data)는 지난 9월 2일 데이터베이스 분야 국제학술대회인 VLDB 2026에서 발표됐다.
/정종오 기자([email protected])
--comment--
첫 번째 댓글을 작성해 보세요.
댓글 바로가기