-
DeepSeek는 왜 유명해졌나? 557.6만 달러의 범위부터 봤습니다AI Agent 2026. 8. 24. 15:34728x90반응형

V3 보고서의 557.6만 달러 환산 범위와 빠진 비용을 구분한 도식입니다. 557.6만 달러.
이 숫자가 걸려서 DeepSeek-V3 기술 보고서 표 1의 세 행을 다시 더했습니다. 합계는 맞았습니다. 이 표가 세는 범위는 DeepSeek 전체 개발비가 아니라 V3의 공식 학습 실행이었습니다.
12월 26일에는 V3 보고서가 나왔습니다. 1월 15일 무료 앱이 열렸고 닷새 뒤에는 R1과 공개 가중치·증류 모델이 공개됐습니다. 1월 27일에는 앱 순위와 금융시장 반응이 뒤따랐습니다. 날짜의 순서는 확인되지만 각 사건의 기여율은 아직 모릅니다.
이 글은 2026년 8월 23일까지 공개된 자료를 기준으로 씁니다. 제가 직접 확인한 것은 V3와 R1 비용의 산술이며 모델 성능은 재현하지 않았습니다.
557.6만 달러가 세는 범위
GPU시간은 Graphics Processing Unit(GPU) 한 장을 한 시간 쓴 양입니다. V3 보고서는 NVIDIA H800 한 장을 한 시간 쓰는 단가를 2달러로 가정했습니다.
단계 H800 GPU시간 시간당 2달러 환산 사전학습 2,664,000 $5,328,000 문맥 확장 119,000 $238,000 후처리 5,000 $10,000 합계 2,788,000 $5,576,000 표에 들어 있는 것은 V3의 공식 학습 실행입니다. 선행 연구와 구조·알고리즘·데이터를 바꿔 본 실험은 이 계산에서 빠졌습니다. 인건비, 데이터 수집·정제 비용, 실패한 실행, 장비와 네트워크 구입비, 전력, 서비스 운영비도 이 표로는 알 수 없습니다. GPU시간에 가정 단가를 곱한 값이므로 실제 청구서도 아닙니다.
R1에는 별도의 좁은 장부가 있습니다. 2025년 9월 Nature 보충자료는 V3-Base 위에서 R1-Zero에 10만 1천, 지도 미세조정 데이터 생성에 5천, R1에 4만 1천 GPU시간을 썼다고 적었습니다. 합계 14만 7천 시간에 같은 단가를 적용하면 29만 4천 달러입니다. 이 값에도 V3-Base 학습, 선행 A100 실험, 인력과 인프라 비용은 들어 있지 않습니다.
32일 동안 열린 경로
V3 공개일부터 미국 iOS 무료 앱 1위까지 32일이 걸렸습니다. 날짜를 놓고 보면 무엇이 먼저 나왔는지는 분명합니다.
날짜 실제 사건 확인된 변화 2024-12-26 V3 공개 효율과 학습 비용을 담은 기술 보고서 공개 2025-01-10 Similarweb이 앱 이용 가능 상태를 관측 분석업체가 먼저 관측한 날짜 2025-01-15 무료 앱 공식 공지 API 키나 GPU 없이 체험 가능 2025-01-20 R1·R1-Zero·증류 모델 공개 추론 모델, MIT 가중치, API와 로컬 모델 공개 2025-01-27 미국 iOS 무료 앱 1위 소비자 앱 순위와 금융시장 반응으로 확산 무료 앱은 일반 사용자가 바로 써볼 수 있게 했습니다. OpenAI 호환 Application Programming Interface(API)가 있어 개발자는 기존 도구에서 API 주소와 모델만 바꿔 호출할 수 있었습니다. 1.5B부터 70B까지의 증류 모델은 로컬에서도 돌릴 수 있었습니다.
1월 27일에는 기술 뉴스가 시장 뉴스로 번졌습니다. Reuters 보도에 따르면 NVIDIA 주가는 약 17% 하락했고 시가총액은 약 5,930억 달러 줄었습니다. Sensor Tower는 출시 뒤 첫 19일 다운로드를 2,300만 건 이상으로 추정했습니다.
앱 순위와 다운로드는 사용자 확산을 보여주지만 모델 정확도를 재지는 않습니다. 같은 시기 Similarweb 자료에서는 ChatGPT의 웹·모바일 이용 규모가 훨씬 컸습니다. 스토어 추천과 새 중국 AI에 대한 호기심, 금융·지정학 뉴스도 영향을 줬을 수 있습니다. 어느 요인이 얼마나 기여했는지는 공개 자료로 나눌 수 없습니다.
R1보다 먼저 쌓인 것
High-Flyer 공식 연혁에는 2015년 이후 머신러닝 모델 운영과 Fire-Flyer 클러스터, 저장·통신·스케줄링 도구가 기록돼 있습니다. HAI-LLM도 분산학습 스택과 GPU 확장을 설명합니다. 최신 전체 인원과 GPU 총수는 공개되지 않았지만 R1 이전부터 계산 인프라를 운영했다는 기록은 남아 있습니다.
공개 저장소에서 확인되는 DeepSeek의 초기 흔적은 2023년입니다. DeepSeek-Coder는 11월 2일, DeepSeek-LLM은 11월 29일에 첫 커밋이 남아 있습니다. 저장소 커밋은 공개 시점의 하한이며 조직의 실제 시작일을 확정하는 기록은 아닙니다.
2024년 1월 DeepSeekMoE가 희소 전문가 구조를 공개했습니다. 다음 달 DeepSeekMath에서는 Group Relative Policy Optimization(GRPO)이 나왔습니다. 5월 DeepSeek-V2는 Multi-head Latent Attention(MLA)과 DeepSeekMoE를 한 모델에 묶었습니다. Multi-Token Prediction(MTP)은 별도 연구진이 먼저 제안했습니다. 이 기술들은 R1 공개 전에 이미 논문으로 나와 있었습니다.
V2와 V3는 비용을 어디로 옮겼나
V3는 전체 671B 파라미터 가운데 토큰마다 37B만 활성화합니다. 매번 모든 계산 경로를 쓰지 않으므로, 어떤 경로를 고르고 토큰을 어디로 보낼지가 중요해집니다.

V3는 계산·메모리·통신 비용을 없애지 않고 routing, projection, scaling, topology 의존성으로 옮겼습니다. 일부 expert만 계산합니다
Mixture of Experts(MoE)는 입력을 변환하는 Feed-Forward Network(FFN)를 여러 expert로 나누고 입력마다 일부만 고릅니다. V3에는 모든 token이 쓰는 shared expert 1개와 routed expert 256개가 있고 token마다 routed expert 8개를 선택합니다. 37B active는 토큰 하나가 통과하는 활성량입니다. 37B짜리 dense 모델과 같은 뜻은 아닙니다. (DeepSeekMoE, V3 보고서)
선택된 expert가 여러 GPU에 흩어져 있어 토큰을 주고받는 all-to-all 통신과 부하 조절이 필요합니다. V3는 한 expert로 요청이 몰리면 다음 선택에서 그 expert의 점수를 낮추는 bias를 썼습니다. 실제 출력 가중치는 이 bias를 빼고 원래 적합도(affinity)로 계산했습니다. 작은 balance loss와 토큰당 최대 네 node 제한도 남았습니다. 줄어든 계산량만큼 routing과 통신이 새 일이 됐습니다. (Loss-Free Balancing)
KV cache를 작게 보관합니다
모델은 다음 token을 만들 때 이전 attention 값을 다시 씁니다. 이를 모아 둔 Key-Value cache(KV cache)는 문맥과 동시 요청이 길어질수록 GPU 메모리를 많이 차지합니다.
Multi-head Latent Attention(MLA)은 key와 value를 작은 압축 벡터로 묶습니다. 위치 정보를 넣는 Rotary Position Embedding(RoPE) 성분은 따로 둡니다. 메모리를 덜 쓰는 대신 압축값을 다시 펼치는 계산과 전용 kernel이 필요합니다. (V2 보고서, V3 보고서)
V2는 DeepSeek-67B와 비교해 KV cache가 93.3% 줄고 처리량이 최대 5.76배로 늘었다고 보고했습니다. 이때 8×H800, FP8 weights, 평균 약 6-bit KV 양자화를 함께 썼습니다. MLA만 떼어 모든 환경에 적용할 수 있는 수치는 아닙니다.
MTP는 미래 token도 맞힙니다
Multi-Token Prediction(MTP)은 다음 token과 그 뒤의 token 하나를 함께 맞히도록 학습합니다. 추론할 때는 이 모듈을 빼거나 speculative decoding의 초안 생성에 재사용할 수 있습니다. 공개된 속도 수치는 실행 조건과 독립 재현이 부족해 옮기지 않았습니다.
FP8은 계산량을, DualPipe는 대기 시간을 줄입니다
8-bit floating-point(FP8)는 행렬 계산과 중간값을 더 작은 숫자 형식으로 저장합니다. V3는 activation을 1×128 묶음, weight를 128×128 block으로 나눠 각각의 scale을 잡았습니다. 결과는 128개 원소마다 32-bit floating-point(FP32)로 올려 누적했습니다. 민감한 계산은 bfloat16(BF16)이나 FP32에 남겼습니다. 데이터량은 줄지만 scale과 누적 정밀도, 전용 kernel을 관리해야 합니다. (V3 보고서)
DualPipe는 forward·backward 계산과 expert 통신을 같은 시간대에 배치합니다. 통신은 그대로 남지만 GPU가 기다리는 구간은 줄어듭니다. 이 설계는 2,048대 H800과 당시 네트워크 구성에 맞춰졌습니다. 다른 하드웨어에서도 같은 효과가 난다고 말할 근거는 없습니다. (DualPipe)
R1에서 달라진 학습 단계
R1 공식 저장소와 논문은 R1-Zero와 최종 R1이 모두 V3-Base에서 시작한다고 적습니다.
V3-Base ├─ R1-Zero: SFT를 먼저 넣지 않고 GRPO + 정답/형식 보상 └─ R1: 읽기 쉬운 cold-start CoT로 SFT → reasoning RL → rejection sampling + reasoning/non-reasoning SFT → 두 번째 RL → R1 └─ Qwen/Llama 1.5B–70B로 증류R1-Zero는 Supervised Fine-Tuning(SFT) 없이 Reinforcement Learning(RL)을 먼저 적용했습니다. 수학은 최종 정답, 코드는 compiler/test, 출력 형식은
<think>/<answer>규칙으로 채점했습니다. 자동 채점이 가능한 수학·코드·논리 문제에는 잘 맞지만 글쓰기와 개방형 질문에는 같은 확실성을 주지 못합니다.Proximal Policy Optimization(PPO)은 답의 가치를 추정하는 critic을 따로 둡니다. Group Relative Policy Optimization(GRPO)은 같은 질문에서 나온 여러 답을 비교해 critic을 없앴습니다. critic용 메모리는 줄어듭니다. 대신 여러 답을 만드는 rollout과 정답을 확인하는 verifier 비용이 남습니다.
최종 R1은 풀이 과정을 적은 Chain-of-Thought(CoT) 예시로 cold-start를 거쳤습니다. 이후 단계는 위 코드블록처럼 지도 미세조정과 두 차례 RL을 함께 씁니다. 최종 R1을 SFT 없는 pure RL 모델로 부르면 이 순서와 맞지 않습니다.
R1 저장소의 평가표는 당시 일부 수학·코드·추론 benchmark에서 o1-1217과 비슷한 수치를 보고했습니다. 최대 생성 길이 32,768 tokens, temperature 0.6, top-p 0.95였고 일부 과제에서는 질문당 64개 답을 뽑았습니다. Open-R1이 지적한 sample 수 차이까지 고려하면 동일한 평가 장치에서 독립 재현된 일반 우위로 볼 수 없습니다.
DeepSeek는 R1 가중치를 MIT License로 공개했고 1.5B–70B 증류 모델도 내놨습니다. 약 80만 개의 R1 생성 sample로 Qwen·Llama student를 지도 미세조정했습니다(R1 논문).
지식 증류(Knowledge distillation)는 큰 teacher의 출력을 작은 student가 학습하는 방법입니다. 작은 모델은 R1의 출력을 옮겨 배웠습니다. 같은 능력을 독립적으로 발견했다는 뜻은 아닙니다.
공개 후 100일을 정리한 연구가 확인한 범위는 가중치와 일부 코드·보고서까지입니다. 전체 pre-training data와 training implementation은 공개되지 않았고 Qwen·Llama 원 모델의 라이선스도 남습니다.
2026년 8월 23일에 확인되는 것
기준일에 DeepSeek 공식 공지 목록을 확인했을 때 최신 항목은 8월 21일이었습니다. R1 뒤로 V3.1과 V3.2가 이어졌고 2026년에는 V4 Preview가 나왔습니다. V4-Pro-0813, V4-Flash-0731, Vision 실험 API도 확인됩니다. Vision 모델의 공개 가중치와 라이선스, V4의 장기 독립 우위는 아직 모릅니다.
Hugging Face Open-R1은 R1의 학습·증류 경로를 다시 구성했습니다. MHA2MLA와 TransMLA는 다른 모델을 MLA 계열로 바꾸는 방법을 연구했습니다. 이런 후속 작업은 기술이 퍼졌다는 증거입니다. DeepSeek만의 영향으로 단정할 수는 없습니다.
미국 National Institute of Standards and Technology(NIST)의 2025년 9월 평가는 R1·R1-0528·V3.1만 다뤘습니다. V3.2와 V4는 평가 대상이 아니었습니다. 당시 최상위 미국 모델이 대부분의 benchmark에서 앞섰다는 결과를 V4의 현재 성능으로 옮겨 읽을 수 없습니다.
전체 개발비, 유명세를 만든 각 사건의 기여율, V4의 장기 우위는 공개 자료로 닫히지 않습니다. 다음 DeepSeek 숫자를 볼 때는 먼저 범위를 확인해야 합니다. base model 학습인지 후속 학습인지, GPU시간인지 실제 지출인지, 회사가 보고한 결과인지 같은 조건의 독립 측정인지부터 보면 됩니다.
728x90반응형'AI Agent' 카테고리의 다른 글
DFlash 2 M4 Max 디코딩 실측 — 2.02배, Greedy 5/8 불일치 (0) 2026.08.24 DFlash 1 M4 Max 실측 — 27B 1.83× (0) 2026.08.24 되돌릴 수 없는 일을 맡기기 전에 그은 선 (0) 2026.08.12 인수인계 메모가 요약으로 끝나면 다시 시작 못 한다 (0) 2026.08.11 토큰값보다 무서운 건 다시 시키는 시간 (0) 2026.08.10