💬
중급 자연어처리(NLP) 📄 논문 ⭐⭐⭐☆☆

DenseOn과 LateOn: 다국어, 긴 문맥, 코드 검색을 위한 완전 개방형 밀집 및 지연 상호작용 모델

DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search

💡 이 연구는 검색 모델 훈련의 재현성 문제를 해결하기 위해, 방대한 공개 데이터를 활용하여 다국어 검색에 최적화된 두 가지 새로운 개방형 모델(DenseOn, LateOn)을 개발하고 공개했습니다. 특히, 지연 상호작용 모델이 번역 학습 데이터에 없는 언어에도 더 잘 일반화됨을 발견했습니다.

핵심 요약

  • 무엇을 · 이 연구는 최신 검색 모델들이 비공개 훈련 데이터에 의존하여 재현성 문제가 발생하는 점을 지적하며, 이를 해결하기 위한 완전 개방형 검색 모델 훈련 방법을 제시합니다. 영어 데이터를 기반으로 다국어 검색으로 확장하는 방식을 탐구합니다.
  • 어떻게 · 연구팀은 34개의 공개 소스에서 6억 6천 5백만 개의 영어 대조 학습 쌍을 재구성하고, 188만 개의 미세 조정 쌍을 구축했습니다. 이를 통해 1억 4천 9백만 개의 매개변수를 가진 두 모델(DenseOn, LateOn)을 훈련했습니다. 이후 검증된 영어 데이터를 8개 언어로 번역하여 28억 개의 다국어 쌍을 만들고, 이를 이용해 3억 7백만 개의 매개변수를 가진 다국어 모델(mDenseOn, mLateOn)을 훈련했습니다.
  • 결과 · DenseOn과 LateOn은 BEIR 벤치마크에서 각각 56.20과 57.22의 평균 nDCG@10을 달성하여 해당 크기 클래스에서 새로운 최고 성능을 기록했습니다. 다국어 모델의 경우, 밀집 모델은 영어 및 번역된 언어에서 강했지만 번역 학습 데이터 외의 언어에서는 성능이 저하된 반면, 지연 상호작용 모델은 보지 못한 언어와 스크립트에 더 잘 일반화되는 경향을 보였습니다. 이는 토큰 수준 매칭이 번역 학습을 다국어 일반화 전략으로 전환시킨다는 것을 시사합니다.

왜 중요한가

최신 검색 모델의 훈련 데이터가 비공개인 경우가 많아 연구 재현성과 접근성이 떨어지는 문제를 해결하고, 누구나 활용할 수 있는 개방형 모델과 훈련 방법을 제공하여 검색 기술 발전에 기여합니다.

실생활·산업 영향

이 모델들은 다국어 환경에서의 정보 검색, 긴 문맥 검색, 코드 검색 등 다양한 실제 응용 분야에서 활용될 수 있습니다. 특히, 공개된 모델과 데이터셋, 코드는 연구자와 개발자들이 검색 시스템을 구축하고 개선하는 데 중요한 기반 자료가 될 것입니다.

한계·주의

밀집 모델의 경우 번역 학습 데이터에 포함되지 않은 언어에서는 성능이 저하될 수 있으며, 지연 상호작용 모델이 더 나은 일반화 능력을 보였지만 여전히 한계가 있을 수 있습니다. 또한, 모델의 크기(149M, 307M 매개변수)가 매우 큰 모델에 비해 제한적일 수 있습니다.

#검색 모델#다국어#오픈소스
arXiv 원문 보기 → Raphaël Sourty, Antoine Chaffin, Paulo Roberto Moura Junior 외 · 2026-07-29 · arXiv:2607.27178
이 요약이 유용했나요?

※ 이 요약은 AI 보조로 생성하고 사람이 검수했습니다. 난이도·실생활 영향·톤은 본 사이트의 편집 의견이며, 정확한 내용은 반드시 원문(arXiv)을 확인하세요. 번역은 AI 기반으로 오역 가능성이 있습니다. 출처: arXiv (2607.27178).

← 테크랩 전체 보기