release
DeepSeek-V3 공개
(2년 전)
전체 6,710억 개 중 토큰당 370억 개의 매개변수를 활성화하는 차세대 MoE 모델 DeepSeek-V3 공개.
관련 항목
상세 내용
V2의 MLA와 DeepSeekMoE 계승. 보조 손실 없는 부하 균형·다중 토큰 예측·FP8 혼합정밀도 학습 도입. 14.8조 개 토큰 및 278만8천 H800 GPU 시간 규모의 학습. 비용 수치는 완성 모델의 공식 학습 기준이며 선행 연구·실험·장비 취득비는 제외.
모델 가중치와 기술 보고서 동시 제공. 외부 검증 기반 마련과 R1 기반 모델 확립. 딥시크가 세계적 관심을 받는 전환점 형성.