release
DeepSeek-V2 공개
(2년 전)
학습 비용과 추론 메모리를 줄인 혼합 전문가 언어 모델 DeepSeek-V2 공개.
관련 항목
상세 내용
전체 2,360억 개 중 토큰당 210억 개의 매개변수만 활성화하는 DeepSeekMoE 적용. 긴 문맥 처리의 KV 캐시를 압축하는 MLA 도입. 8.1조 개 토큰 사전학습 및 최대 128K 문맥 지원. V3와 R1의 효율성을 가능하게 한 핵심 아키텍처 확립.
학습 비용과 추론 메모리를 줄인 혼합 전문가 언어 모델 DeepSeek-V2 공개.
전체 2,360억 개 중 토큰당 210억 개의 매개변수만 활성화하는 DeepSeekMoE 적용. 긴 문맥 처리의 KV 캐시를 압축하는 MLA 도입. 8.1조 개 토큰 사전학습 및 최대 128K 문맥 지원. V3와 R1의 효율성을 가능하게 한 핵심 아키텍처 확립.