본문 바로가기
release

DeepSeek-V2 공개

(2년 전)

학습 비용과 추론 메모리를 줄인 혼합 전문가 언어 모델 DeepSeek-V2 공개.

관련 항목

상세 내용

전체 2,360억 개 중 토큰당 210억 개의 매개변수만 활성화하는 DeepSeekMoE 적용. 긴 문맥 처리의 KV 캐시를 압축하는 MLA 도입. 8.1조 개 토큰 사전학습 및 최대 128K 문맥 지원. V3와 R1의 효율성을 가능하게 한 핵심 아키텍처 확립.

관련 링크