📷
중급 컴퓨터비전 📄 논문 ⭐⭐⭐☆☆

ReToken: 시각 검색을 위한 비전-언어 모델 개선의 핵심 토큰

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

💡 ReToken은 하나의 학습 가능한 임베딩으로, 방대한 시각 정보 속에서 관련성 높은 토큰만 효율적으로 선택하여 비전-언어 모델의 검색 성능을 크게 향상시키는 기술입니다.

핵심 요약

  • 무엇을 · 이 연구는 'ReToken'이라는 새로운 접근 방식을 제안합니다. ReToken은 단일 학습 가능한 임베딩으로, 비전-언어 모델이 방대한 시각 정보(토큰) 중에서 질의와 관련된 핵심 정보만을 효율적으로 찾아내도록 돕습니다.
  • 어떻게 · ReToken은 미리 채워진 시각적 KV(Key-Value) 캐시에서 질의와 관련된 소수의 시각 토큰을 명시적인 검색 대상으로 선택하도록 훈련됩니다. 이는 작은 이미지-질의응답 데이터셋으로 훈련되었음에도 불구하고 효과를 보였습니다.
  • 결과 · ReToken은 이미지 및 비디오 벤치마크에서 일관된 성능 향상을 보였습니다. Visual Haystacks 벤치마크에서는 Qwen3VL-8B 모델의 성능을 13.4점, InternVL3.5 모델을 12.4점 향상시켰습니다. 또한, LVBench에서는 Qwen3VL-8B 모델에 8.0점의 제로샷 성능 향상을 가져왔습니다. 가벼운 설계 덕분에 훈련과 긴 비디오 추론 모두 단일 H100 GPU에서 가능합니다.

왜 중요한가

기존 비전-언어 모델은 방대한 시각적 맥락(많은 토큰)을 처리할 때 성능이 저하되고, 모든 토큰을 동시에 처리하는 것은 GPU 메모리 제약으로 인해 계산적으로 어렵다는 문제가 있었습니다. ReToken은 이러한 문제를 해결하여 모델의 효율성과 성능을 동시에 개선합니다.

실생활·산업 영향

이 기술은 대량의 시각 정보 속에서 특정 객체나 정보를 찾아야 하는 시각 검색 시스템, 자율 주행, 보안 감시, 의료 영상 분석 등 다양한 분야에서 모델의 정확도와 효율성을 높이는 데 기여할 수 있습니다.

한계·주의

초록에 명시된 한계점은 없지만, 작은 이미지-질의응답 데이터셋으로 훈련되었다는 점은 더 다양한 데이터셋에서의 일반화 성능에 대한 추가 검증이 필요할 수 있음을 시사합니다.

#비전-언어 모델#시각 검색#토큰 효율성
arXiv 원문 보기 → Yao Xiao, Reuben Tan, Zhen Zhu 외 · 2026-07-30 · arXiv:2607.28627
이 요약이 유용했나요?

※ 이 요약은 AI 보조로 생성하고 사람이 검수했습니다. 난이도·실생활 영향·톤은 본 사이트의 편집 의견이며, 정확한 내용은 반드시 원문(arXiv)을 확인하세요. 번역은 AI 기반으로 오역 가능성이 있습니다. 출처: arXiv (2607.28627).

← 테크랩 전체 보기