Qwen2.5-1M 모델 공개: 100만 토큰 컨텍스트 길이 지원 및 추론 프레임워크 가속화
Qwen은 100만 토큰 컨텍스트 길이를 지원하는 오픈소스 Qwen2.5-1M 모델(7B, 14B)과 vLLM 기반의 추론 프레임워크를 공개했다. 이 모델은 장문 및 단문 컨텍스트 작업에서 우수한 성능을 보이며, 희소 어텐션(sparse attention) 기술을 통해 추론 속도를 최대 6.7배 향상한다.
Qwen이 100만 토큰 컨텍스트 길이를 지원하는 오픈소스 Qwen2.5-1M 모델과 이에 상응하는 추론 프레임워크를 공개했다. 이번 발표에는 Qwen2.5-7B-Instruct-1M과 Qwen2.5-14B-Instruct-1M 두 가지 새로운 체크포인트가 포함되며, 이는 Qwen의 오픈소스 모델 중 처음으로 100만 토큰 컨텍스트를 처리할 수 있게 된 것이다. 함께 공개된 추론 프레임워크는 vLLM을 기반으로 하며, 희소 어텐션(sparse attention) 방식을 통합하여 100만 토큰 입력 처리 속도를 3배에서 7배까지 가속화한다. 개발자들은 허깅페이스(Huggingface)와 모델스코프(Modelscope) 데모를 통해 Qwen2.5-1M 모델을 온라인으로 경험할 수 있다.
Qwen은 두 달 전 Qwen2.5-Turbo 모델을 100만 토큰 컨텍스트 길이로 업그레이드한 바 있으며, 이번 오픈소스 모델 출시는 이러한 장문 컨텍스트 처리 역량을 개발자 커뮤니티에 확장하는 의미를 지닌다. 장문 컨텍스트 모델은 방대한 양의 정보를 처리하고 이해하는 데 필수적이며, 이는 복잡한 문서 분석, 긴 대화 요약, 코드 생성 등 다양한 고급 AI 애플리케이션의 기반이 된다. Qwen은 장문 컨텍스트 모델의 성능과 효율성을 동시에 개선하여 실용적인 가치를 제공하고, 제한된 자원 환경에서도 효과적으로 배포될 수 있도록 하는 것을 목표로 한다.
Qwen2.5-1M 시리즈 모델은 장문 및 단문 컨텍스트 작업 모두에서 뛰어난 성능을 보인다. 100만 토큰 컨텍스트 길이의 패스키 검색(Passkey Retrieval) 작업에서 모델은 숨겨진 정보를 정확하게 검색하며, 7B 모델에서만 미미한 오류가 관찰되었다. RULER, LV-Eval, LongbenchChat과 같은 복잡한 장문 컨텍스트 이해 작업에서는 128K 버전 모델보다 월등히 우수한 성능을 나타내며, 특히 64K를 초과하는 시퀀스에서 그 차이가 두드러진다. Qwen2.5-14B-Instruct-1M 모델은 Qwen2.5-Turbo를 능가할 뿐만 아니라 여러 데이터셋에서 GPT-4o-mini보다 지속적으로 우수한 성능을 보여, 장문 컨텍스트 작업에서 강력한 오픈소스 대안을 제시한다. 단문 컨텍스트 작업에서는 Qwen2.5-7B-Instruct-1M과 Qwen2.5-14B-Instruct-1M 모두 128K 버전과 유사한 성능을 유지하여, 장문 시퀀스 처리 능력 추가로 인해 기본 기능이 저하되지 않았음을 확인한다. 또한, Qwen2.5-14B-Instruct-1M과 Qwen2.5-Turbo는 GPT-4o-mini와 유사한 단문 작업 성능을 보이면서도 8배 더 긴 컨텍스트 길이를 지원한다.
Qwen2.5-1M 모델 구축에는 여러 핵심 기술이 적용되었다. 장문 컨텍스트 훈련은 점진적 접근 방식을 사용하여 여러 단계에 걸쳐 컨텍스트 길이를 확장한다. 4K 토큰 컨텍스트 길이의 Qwen2.5 사전 훈련 체크포인트에서 시작하여, 사전 훈련 단계에서는 RoPE(Rotary Positional Embedding) 베이스를 10,000에서 10,000,000으로 높이는 조정된 기본 주파수(Adjusted Base Frequency)를 사용하여 컨텍스트 길이를 4K에서 256K 토큰으로 점진적으로 늘린다. 지도 미세 조정(Supervised Fine-tuning)은 단문(최대 32K) 및 장문(최대 256K) 지침을 혼합하여 단문 시퀀스 성능을 유지하면서 장문 컨텍스트 작업 성능을 향상한다. 최종적으로 훈련된 모델은 256K 토큰까지 처리할 수 있다. 256K 토큰으로 훈련된 모델을 100만 토큰으로 확장하기 위해 길이 외삽(Length Extrapolation) 기술이 사용된다. 특히 듀얼 청크 어텐션(Dual Chunk Attention, DCA)은 훈련 중 보지 못한 쿼리와 키 사이의 큰 상대적 위치 거리를 재매핑하여 이 문제를 해결한다. DCA는 32K 토큰으로만 훈련된 모델도 100만 토큰 컨텍스트의 패스키 검색 작업에서 거의 완벽한 정확도를 달성하게 한다.
추론 속도 향상을 위해 MInference 기반의 희소 어텐션(Sparse Attention) 메커니즘이 도입되었다. 이 메커니즘은 프리필(prefill) 단계를 가속화하며, 여러 개선 사항을 포함한다. 청크 프리필(Chunked Prefill)과의 통합은 100만 토큰 시퀀스 처리 시 발생하는 MLP 레이어 활성화 메모리 오버헤드를 크게 줄인다. 예를 들어, Qwen2.5-7B 모델의 경우 71GB의 VRAM 사용량을 32,768 토큰의 청크 길이로 처리함으로써 96.7% 감소시킨다. 길이 외삽 기술과의 통합은 추론 효율성과 정확도를 동시에 높인다. 또한, 장문 시퀀스에 대한 희소성 정제(Sparsity Refinement)는 100만 토큰 시퀀스에 특화된 최적의 희소화 구성을 찾아 희소 어텐션으로 인한 정확도 손실을 줄인다. 이러한 최적화는 커널 효율성 향상 및 동적 청크 파이프라인 병렬 처리와 같은 추가 개선 사항과 함께 전체 프레임워크의 잠재력을 최대한 발휘하게 한다. 결과적으로, 100만 토큰 길이 시퀀스에 대해 모델 크기 및 GPU 장치에 따라 프리필 속도가 3.2배에서 6.7배까지 가속화된다.
개발자들은 Qwen2.5-1M 모델을 로컬 환경에 배포하여 100만 토큰에 달하는 장문 컨텍스트를 처리하는 대규모 언어 모델을 직접 활용할 수 있다. 이는 복잡한 데이터 처리, 고급 챗봇 개발, 정보 검색 시스템 구축 등 다양한 애플리케이션에서 새로운 가능성을 제공한다. 오픈소스 추론 프레임워크는 vLLM 기반으로 제공되어 개발자들이 효율적으로 모델을 배포하고 관리할 수 있도록 지원한다. 또한, OpenAI 호환 API 서비스를 통해 기존 OpenAI API를 사용하는 애플리케이션과의 통합이 용이하며, Curl 또는 Python 클라이언트를 사용하여 모델과 상호작용할 수 있다. Qwen-Agent와 같은 프레임워크를 활용하면 PDF 파일 읽기 등 더욱 전문화된 작업을 수행할 수 있어 개발 유연성이 높아진다.
Qwen2.5-1M 모델을 로컬에 배포하기 위해서는 특정 시스템 요구 사항을 충족해야 한다. 최적의 성능을 위해서는 Ampere 또는 Hopper 아키텍처를 지원하는 GPU 사용이 권장된다. CUDA 버전은 12.1 또는 12.3, Python 버전은 3.9 이상 3.12 이하여야 한다. 100만 토큰 시퀀스 처리를 위한 VRAM 요구 사항은 Qwen2.5-7B-Instruct-1M의 경우 최소 120GB(총 GPU), Qwen2.5-14B-Instruct-1M의 경우 최소 320GB(총 GPU)로 높다. VRAM이 부족한 경우에도 단문 작업에는 모델을 사용할 수 있다. vLLM 저장소는 QwenLM의 커스텀 브랜치(`dev/dual-chunk-attn`)를 클론하여 수동으로 설치해야 하며, 이는 현재 메인 vLLM 프로젝트에 병합 작업 중이다. `vllm serve` 명령 실행 시 `--tensor-parallel-size`는 사용 중인 GPU 수에 맞춰 설정해야 하며, 7B 모델은 최대 4개, 14B 모델은 최대 8개의 GPU를 지원한다. `--max-model-len`은 최대 입력 시퀀스 길이를 정의하며, 메모리 부족 문제 발생 시 이 값을 줄일 수 있다. `--max-num-batched-tokens`는 청크 프리필의 청크 크기를 설정하며, 131072가 최적의 성능을 위해 권장된다. Qwen은 장문 컨텍스트 모델이 여전히 개선의 여지가 많다고 밝히며, 단문 및 장문 컨텍스트 작업 모두에서 탁월한 성능을 발휘하고 제한된 자원 환경에서도 효과적으로 배포될 수 있는 모델을 구축하기 위해 효율적인 훈련 방법, 모델 아키텍처 및 추론 방법에 대한 연구를 지속할 계획이다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen2.5-1M: Deploy Your Own Qwen with Context Length up to 1M Tokens
원문 발행: 2025-01-27 01:00:03
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 엔비디아, 추가 훈련 없는 표 데이터 파운데이션 모델 쿠모 태뷸러 공개 · Hugging Face Blog · 2026-09-30
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.