DeepSeek
DeepSeek(딥시크, 공식 명칭: 항저우 딥시크 인공지능 기초기술 연구 유한공사, 중국어: 杭州深度求索人工智能基础技术研究有限公司, '심원한 탐구'라는 뜻)는 대규모 언어 모델 및 관련 인공지능 기술을 개발하는 중국의 인공지능 연구 기업이다. 2023년 기업가량원펑(梁文鋒)이 항저우에서 설립하였으며, 그의 양적 투자 헤지펀드인 환팡(幻方量化, High-Flyer)의 지원을 받는다. 이 회사는 2025년 1월 추론 모델 딥시크-R1(DeepSeek-R1)의 출시를 계기로 국제적으로 주목받았으며, 이 모델은 서구 선도 기업들의 최첨단 모델에 필적하는 성능을 보이면서도 훈련 비용이 극히 일부에 불과한 것으로 알려졌다. DeepSeek은 모델을 오픈 웨이트(open weights) 방식으로 공개하는 정책, 효율적인 모델 아키텍처와 훈련 기법의 혁신, 그리고 그 출시가 글로벌 기술 시장과 인공지능 정책 논쟁에 일으킨 커다란 파장으로 널리 알려져 있다.
배경 및 설립
DeepSeek의 뿌리는 2015년량원펑이 공동 창업한 양적 투자 회사 환팡(幻方量化)에 있다. 환팡은 중국 최대 규모의 양적 헤지펀드 중 하나로 성장하였으며, 수십억 달러 규모의 자산을 운용하고 매매 전략에 기계학습을 폭넓게 활용하였다. 2019년경부터 환팡은 컴퓨팅 인프라에 대규모 투자를 진행하였고, 최종적으로 인공지능 연구와 매매 응용을 위해 엔비디아 A100 그래픽처리장치(GPU) 약 1만 장 규모의 클러스터를 확보하였다.
2023년, ChatGPT의 출시 이후 생성형 인공지능이 전 세계적인 관심을 받으면서량원펑은 범용 인공지능(AGI) 연구에 직접 나서기로 결정하였다. DeepSeek은 독립적인 회사로 설립되었으며, 주로 환팡의 자금 지원을 받고량원펑이 회사를 이끌었다. 이 회사는 제품 중심 기업이 아니라 기초 연구 조직으로 자리매김함으로써 많은 중국 기술 기업들과 차별화되었다.량원펑은 DeepSeek의 사명이 AGI를 추구하는 것이며, 회사는 오픈소스 노선을 수용할 의향이 있다고 밝혔다. 그는 모델 웨이트와 기술 보고서의 공유를 경쟁상의 약점이 아니라 글로벌 연구 공동체에 대한 기여로 보았다.
역사적 발전
DeepSeek의 초기 출시물은 특화 분야에 집중되었다. 2023년 11월, 회사는 대규모 프로그래밍 데이터 코퍼스를 바탕으로 처음부터 훈련된 코드 특화 언어 모델 시리즈인 딥시크 코더(DeepSeek Coder)를 선보였다. 이어 2023년 말부터 2024년 초에 걸쳐 범용 언어 모델 계열인 딥시크 LLM(DeepSeek LLM)이 출시되었으며, 그중 670억 파라미터 버전은 신생 소규모 팀도 경쟁력 있는 대형 모델을 훈련할 수 있음을 입증하였다. 2024년 2월에는 수학 특화 모델 딥시크매스(DeepSeekMath)를 공개하였는데, 여기서 도입된 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO) 강화학습 알고리즘은 훗날 회사의 추론 모델에 핵심적인 역할을 하게 되었다.
중요한 기술적 이정표는 2024년 5월 딥시크-V2(DeepSeek-V2)와 함께 도래하였다. 이는 2,360억 파라미터의 전문가 혼합(Mixture-of-Experts) 모델로, 추론 시 메모리 요구량을 획기적으로 줄이는 멀티헤드 잠재 어텐션(Multi-head Latent Attention, MLA) 메커니즘을 도입하였다. 딥시크-V2는 성능뿐만 아니라 공격적인 API 가격 책정으로도 주목을 받았으며, 이는 중국 인공지능 제공업체들 사이에 가격 경쟁을 촉발시켰다. 2024년의 후속 출시로는 딥시크 코더-V2, 비전-언어 모델 딥시크-VL, 그리고 멀티모달 제이너스(Janus) 시리즈 등이 있다.
2024년 12월, DeepSeek은 토큰당 370억 개의 파라미터만을 활성화하는 6,710억 파라미터 규모의 전문가 혼합 모델 딥시크-V3(DeepSeek-V3)를 출시하였다. 동반된 기술 보고서에 따르면 전체 훈련에 약 278만 8천 GPU시간이 소요되었으며, 미국의 반도체 수출 규제 하에 중국 기업들이 이용 가능한 수출 규격 프로세서인 엔비디아 H800 칩을 사용해 약 558만 미국 달러의 비용이 추정되었다. 이 수치는 선행 연구, 인프라, 인건비를 제외한 것이기는 하나, 유사한 최첨단 모델의 보고된 훈련 지출에 비해 극적으로 낮아 인공지능 개발 효율성에 관한 국제적 논쟁을 촉진시켰다.
2025년 1월 20일, DeepSeek은 답변에 앞서 확장된 사고 연쇄(chain of thought)를 생성하도록 주로 강화학습을 통해 훈련된 추론 모델 딥시크-R1(DeepSeek-R1)을 출시하였다. 벤치마크 결과에서 R1은 수학, 코딩, 과학적 추론 과제에서 오픈AI의 o1 모델과 동등하거나 근접하는 성능을 기록하였다. 회사는 동시에 모델 웨이트를 MIT 라이선스로 공개하고 훈련 방법론을 상세히 담은 기술 논문을 발표하였다. 며칠 만에 딥시크 모바일 애플리케이션은 미국 애플 앱스토어에서 무료 다운로드 1위를 차지하였으며, 2025년 1월 27일에는 엔비디아 주가가 약 17% 하락하여 하루 만에 약 6,000억 달러의 시가총액이 증발하였다. 이는 당시 단일 기업으로서의 역대 최대 일간 시가총액 손실이었다. 벤처 캐피탈리스트 마크 앤드리슨은 이 출시를 "인공지능의 스푸트니크 순간"이라고 평했다.
이 돌파구 이후 DeepSeek은 2025년에도 모델 개선을 지속하였다. 딥시크-R1-0528과 딥시크-V3.1, V3.2 시리즈 등의 업데이트 버전을 출시하여 추론 능력, 에이전트 지향 성능, 그리고 희소 어텐션 기법을 포함한 추론 효율성을 한층 더 발전시켰다.
모델 및 제품
DeepSeek의 모델 계열은 다음과 같다.
- 딥시크 LLM: 7B 및 67B 파라미터의 범용 밀집(dense) 언어 모델로, 회사의 사전 훈련 및 정렬(alignment) 기반을 확립하였다.
- 딥시크 코더 / 딥시크 코더-V2: 다국어 프로그래밍 데이터로 훈련된 코드 특화 모델로, 폐쇄형 코딩 어시스턴트와 경쟁할 수 있는 초기 오픈 모델 중 하나이다.
- 딥시크매스: GRPO 알고리즘을 도입한 수학 특화 모델이다.
- 딥시크-V2 및 V2.5: 멀티헤드 잠재 어텐션을 특징으로 하는 전문가 혼합 모델로, 낮은 추론 비용과 API 가격으로 주목받았다.
- 딥시크-V3: FP8 정밀도와 보조 손실 없는(auxiliary-loss-free) 부하 분산으로 훈련된 6,710억 파라미터(토큰당 370억 활성화) MoE 모델로, 오픈 모델의 새로운 효율성 기준을 수립하였다.
- 딥시크-R1 및 R1 업데이트: 대규모 강화학습을 통해 훈련된 추론 모델로, 경량 오픈 모델(Qwen, Llama) 기반의 증류(distilled) 변형 모델을 통해 소비자급 하드웨어에서도 추론 능력을 활용할 수 있게 하였다.
- 딥시크 프로버(DeepSeek-Prover): Lean 프로그래밍 언어로 형식적 정리 증명을 수행하는 모델이다.
- 딥시크-VL 및 제이너스/제이너스-프로: 비전-언어 모델 및 통합 멀티모달 이해-생성 모델이다.
웹 서비스와 모바일 애플리케이션으로 제공되는 딥시크 어시스턴트는 회사의 대표 모델에 대한 대화형 접근을 제공하며, 브랜드의 대외적 인지도의 상당 부분을 차지하고 있다.
기술적 특징
DeepSeek의 연구는 여러 아키텍처 및 엔지니어링 혁신으로 구별된다.
- 전문가 혼합(MoE) 아키텍처: 딥시크MoE는 세분화된 전문가 분할과 공유 전문가를 결합하여 기존 MoE 설계에 비해 파라미터 효율성을 개선하였다.
- 멀티헤드 잠재 어텐션(MLA): 키-값 캐시를 잠재 공간으로 압축함으로써 추론 시 메모리 소비를 크게 줄여 서빙 비용을 낮춘다.
- 멀티 토큰 예측(MTP): 딥시크-V3 훈련에 사용되어 데이터 효율성을 높이고 추론 시 추측 디코딩(speculative decoding)을 가능하게 하였다.
- 추론을 위한 강화학습: 딥시크-R1은 검증 가능한 보상을 이용한 규칙 기반 강화학습(GRPO)을 통해 사고 연쇄 추론이 인간이 레이블링한 추론 사례에 대한 광범위한 지도 미세조정 없이도 창발할 수 있음을 입증하였다.
- 효율적인 훈련 엔지니어링: FP8 혼합 정밀도 훈련, 맞춤형 병렬화 전략, 최적화된 GPU 통신의 활용은 수출 제한을 받는 하드웨어에서의 훈련을 가능하게 하였다.
특징 및 비즈니스 모델
DeepSeek의 가장 두드러진 특성은 오픈소스 공개에 대한 헌신, 이례적으로 낮은 가격 책정, 그리고 연구 중심의 조직 문화이다. 모델 웨이트는 허깅페이스 등의 플랫폼에 관대한 라이선스로 공개되어 전 세계 개발자들이 다운로드, 수정, 배포할 수 있다. 회사의 API 가격은 업계에서 가장 낮은 수준으로, 경우에 따라 유사 제품 대비 한 자릿수나 되지 않는 가격을 제시하여 개발자와 서드파티 인공지능 제공업체들의 도입을 가속화하였다.
대형 기술 복합기업과 달리, DeepSeek은 베이징대학교와 칭화대학교 등 중국 최상위 대학 출신 인재를 중심으로 한 비교적 소규모 연구진으로 운영되며, 젊은 인재, 수평적 관리, 단기 수익화보다 장기 연구를 중시한다. 환팡으로부터의 자금 지원은 재정적 독립성을 제공하여 회사가 기초 AGI 연구에 우선순위를 둘 수 있게 한다.량원펑은 DeepSeek의 접근 방식을 글로벌 인공지능 혁신 생태계의 추종자가 아닌 기여자의 것으로 규정하였다.
영향과 의의
DeepSeek의 부상은 여러 분야에 걸쳐 광범위한 결과를 낳았다.
- 경제적·시장적 영향: 2025년 1월의 시장 반응은 인공지능 인프라 기업들의 기업 가치 평가에 대한 의문을 제기하였으며, 최첨단 수준의 인공지능이 기존 통념보다 훨씬 낮은 비용으로 개발될 수 있음을 입증하였다.
- 기술 정책: 미국의 첨단 칩 수출 통제 하에서 DeepSeek이 거둔 성공은 반도체 규제의 실효성과 중국 인공지능 개발의 속도에 관한 미국 및 동맹국들 내부의 논쟁을 촉발하였다.
- 오픈소스 생태계: 최첨단 수준의 모델을 오픈 웨이트와 상세한 기술 보고서와 함께 공개함으로써, DeepSeek은 추론 모델 기법의 확산을 가속화하고 전 세계 오픈 모델 생태계의 위상을 강화하였다.
- 산업 경쟁: 그 가격 정책과 오픈 공개는 중국内外 인공지능 제공업체들에게 비용 측면에서 압박을 가하였으며, 폐쇄적·독점적 개발 전략에 대한 보다 폭넓은 재고를 촉구하였다.
평가 및 논란
DeepSeek의 급격한 부상은 세간의 주목과 함께 검증의 대상이 되었다. 여러 국가 정부와 공공기관은 데이터 저장 문제, 중국 국가기관의 잠재적 접근 가능성, 사이버보안 위험을 이유로 공식 기기에서 딥시크 애플리케이션의 사용을 제한하거나 금지하였다. 이러한 조치는 오스트레일리아, 대한민국, 이탈리아, 미국의 일부 지역 등 여러 관할권에서 채택되었다. 비판자들은 또한 딥시크 모델이 중국 규제에 부합하는 콘텐츠 필터링을 적용하여 정치적으로 민감한 질문에 답하지 않는 점을 지적하였다. 아울러 일부 업계 인사들은 보고된 훈련 비용 수치의 완전성에 의문을 제기하였으며, 오픈AI는 2025년 초 DeepSeek이 자사 모델의 출력물을 이용했을 가능성이 있으며 이는 서비스 약관 위반에 해당할 수 있다고 주장하였다. 이 주장은 그 자체로 업계의 표준 데이터 관행에 관한 논쟁을 불러일으켰다. DeepSeek과 그 지지자들은 자사의 혁신이 동료 검토를 거친 기술 보고서에 독립적으로 기록되어 있으며, 오픈 공개를 통해 재현 가능하다고 반박하였다.
이러한 논란에도 불구하고, DeepSeek은 아키텍처 혁신과 엔지니어링 효율성이 최첨단 규모의 인공지능 개발 장벽을 상당히 낮출 수 있음을 입증한 2020년대 중반 가장 영향력 있는 인공지능 연구 조직 중 하나로 평가받고 있다.
You May Be Interested In
체스
체스(chess)는 8×8 격자로 배열된 64개의 흑백 격자 무늬 체스판 위에서 두 명의 플레이어가 각각 16개의 기물로 이루어진 부대를 지휘하여, 상대방의 킹을 체크메이트하는 것을 목표로 하는 2인용 전략 보드게임...
클로드(Claude)
클로드(Claude)는 미국 샌프란시스코에 본사를 둔 인공지능 기업 앤스로픽(Anthropic)이 개발한 대규모 언어 모델(LLM) 계열이다. 정보이론의 아버지로 널리 인정받는 수학자 클로드 섀넌(Claude Sha...
캐나다
캐나다(Canada)는 북아메리카에 위치한 주권 국가로, 10개의 주와 3개의 준주로 구성되어 있으며, 대서양에서 태평양에 이르고 북쪽으로는 북극해까지 뻗어 있어 총면적 기준 세계 두 번째로 큰 나라이다. 인구는 약...
소나무속
소나무속(學名: Pinus)은 구과식물의 한 속으로, 소나무과(Pinaceae)에 속하는 침엽수 및 관목류를 통칭하며, 소나무과에서 가장 크고 경제적으로 중요한 속이다. 소나무류는 바늘 모양의 잎이 엽다발(fasci...
Related Articles
Qwen(통의천문)
Qwen(중국어: 通义千问, 병음: Tōngyì Qiānwèn, 국제적으로는 Tongyi Qianwen으로도 알려짐)은 중국 기술 기업 알리바바 그룹(Alibaba Group)의 클라우드 컴퓨팅 자회사인 알리바바 클...
일본 (Japan)
일본(日本, 공식 국명: 일본국/日本国)은 동아시아에 위치한 섬나라로, 태평양 서부에서 일본해를 사이에 두고 아시아 대륙의 동쪽에 자리 잡고 있다. 혼슈(本州), 홋카이도(北海道), 규슈(九州), 시코쿠(四国)의 4...
브라질(Brazil)
브라질(포르투갈어: Brasil)은 정식 국명으로 브라질 연방공화국(포르투갈어: República Federativa do Brasil)이라 하며, 남아메리카와 라틴아메리카 지역에서 가장 큰 나라이다. 면적은 약 8...
보어(Bohr)
보어(Bohr)는 원자 구조와 양자 이론의 이해에 결정적 공헌을 하여 1922년 노벨 물리학상을 수상한 덴마크의 물리학자 닐스 헨리크 다비드 보어(Niels Henrik David Bohr, 1885년 10월 7일~...
Comments (0)
No comments yet. Be the first to comment!