release
추론 모델 DeepSeek-R1 공개
(1년 전)
강화학습 중심 추론 모델 DeepSeek-R1, 실험 모델 R1-Zero, 여섯 종의 경량 증류 모델 공개.
관련 항목
상세 내용
R1-Zero에서 지도 미세조정 없이 대규모 강화학습만으로 자기검증·반성·장기 추론 행동 유도. 정식 R1에서 추론 과정의 가독성과 안정성 개선. 수학·코딩·자연어 추론에서 폐쇄형 선도 모델과 경쟁 가능한 수준으로 보고.
코드와 모델 가중치를 MIT 라이선스로 배포. 출력물을 다른 모델의 미세조정과 증류에 사용 가능. 낮은 API 가격과 공개 가중치를 통한 고성능 추론 모델의 직접 실행·분석 범위 확대.