💬
중급 자연어처리(NLP) 📄 논문 ⭐⭐⭐☆☆

TokTier: 에이전트형 LLM 서비스를 위한 정확하고 상태 저장형 토큰화

TokTier: Exact Stateful Tokenization for Agentic LLM Serving

💡 이 논문은 LLM(대규모 언어 모델)이 에이전트처럼 작동할 때 발생하는 비효율적인 토큰화 문제를 해결하는 'TokTier'라는 새로운 시스템을 제안합니다. TokTier는 기존 토큰화 방식보다 훨씬 빠르고 정확하게 텍스트를 처리하여 LLM 서비스의 응답 속도를 크게 향상시킵니다.

핵심 요약

  • 무엇을 · LLM 서비스에서 에이전트가 긴 대화 기록을 반복적으로 제출할 때 발생하는 비효율적인 토큰화 문제를 해결하기 위한 'TokTier'라는 상태 저장형 토큰화 서비스를 개발했습니다.
  • 어떻게 · TokTier는 요청 텍스트의 전체 참조 토큰화와 항상 동일한 토큰 ID를 생성하는 계약을 따릅니다. 세션이 이어질 때는 추가된 부분 주변의 작은 영역만 재토큰화하고, 재사용 가능한 접두사가 없는 호출의 경우 GPU를 사용하여 정확한 사전 토큰화 및 BPE(바이트 쌍 인코딩)를 수행합니다. 또한, 실시간 트래픽을 검증하는 샘플링된 섀도우 검증기를 운영합니다.
  • 결과 · TokTier는 10만~3백만 문자 범위에서 증분 복구에 0.5~1.1ms가 소요되어 기존 방식보다 최대 437배 빠르며, 가장 강력한 캐시 기반 방식보다도 1백만 문자에서 2.1배 빠릅니다. GPU를 사용한 전체 토큰화는 1백만 문자 요청을 0.87ms 만에 처리하여 기존 CPU 방식보다 최대 491배, 가장 빠른 CPU 방식보다 23.4배 빠릅니다. vLLM과 함께 사용할 경우, 첫 토큰까지의 중간 응답 시간이 16~34% 감소하고 P99(상위 1%) 응답 시간은 23% 감소했습니다. 4개의 복구 코어와 1개의 GPU로 초당 1,821개의 요청을 처리할 수 있으며, 이는 16코어 무상태 프론트엔드가 포화되는 속도보다 훨씬 빠릅니다.

왜 중요한가

현재 LLM 서비스는 에이전트가 작은 도구 결과를 얻을 때마다 긴 대화 기록을 다시 제출하는 방식으로 인해 토큰화 과정에서 상당한 지연이 발생합니다. 이 지연은 '첫 토큰까지의 시간'의 최대 64%를 차지할 정도로 심각합니다. TokTier는 이 문제를 해결하여 LLM 기반 에이전트의 응답성과 효율성을 크게 향상시킬 수 있습니다.

실생활·산업 영향

TokTier는 대규모 언어 모델을 사용하는 챗봇, 코딩 에이전트, 자동화 시스템 등 다양한 에이전트형 LLM 서비스의 성능을 획기적으로 개선할 수 있습니다. 사용자들은 더 빠르고 원활한 상호작용을 경험하게 될 것이며, 서비스 제공자들은 더 적은 자원으로 더 많은 요청을 처리할 수 있게 되어 운영 비용을 절감할 수 있습니다.

한계·주의

초록에는 TokTier의 구체적인 한계점이 명시되어 있지 않습니다. 다만, '실패 시 창을 넓히거나 전체 토큰화로 폴백'한다는 설명으로 미루어 볼 때, 특정 복잡한 시나리오에서는 증분 토큰화가 불가능하여 전체 토큰화로 돌아갈 수 있음을 암시합니다.

#LLM 서빙#토큰화#에이전트
arXiv 원문 보기 → Zhenyu Zhang, Zhichao Cao · 2026-07-31 · arXiv:2607.29678
이 요약이 유용했나요?

※ 이 요약은 AI 보조로 생성하고 사람이 검수했습니다. 난이도·실생활 영향·톤은 본 사이트의 편집 의견이며, 정확한 내용은 반드시 원문(arXiv)을 확인하세요. 번역은 AI 기반으로 오역 가능성이 있습니다. 출처: arXiv (2607.29678).

← 테크랩 전체 보기