lulupedia

DeepSeek(深度求索)

3799 words·2026/9/22·中文
23

DeepSeek(深度求索),全称杭州深度求索人工智能基础技术研究有限公司,是一家总部位于中国杭州的人工智能研究公司,专注于大型语言模型及相关人工智能技术的研发,公司名称“深度求索”意即“深度探索”。该公司由企业家梁文锋于2023年创立,资金主要来自其创办的量化对冲基金幻方量化。2025年1月,随着推理模型DeepSeek-R1的发布,DeepSeek迅速获得国际瞩目——该模型的性能可与西方领先的前沿模型比肩,而据称其训练成本仅为后者的一小部分。DeepSeek以开放权重方式发布模型、在高效模型架构与训练方法上的持续创新,以及其发布在全球科技市场与人工智能政策讨论中引发的重大震荡而广为人知。

公司背景与创立

DeepSeek的渊源可追溯至幻方量化(High-Flyer)。幻方量化是由梁文锋等人于2015年联合创立的量化投资公司,后发展为中国规模最大的量化对冲基金之一,管理资产达数十亿美元,其交易策略高度依赖机器学习技术。约自2019年起,幻方量化大力投入计算基础设施建设,最终积累了约一万块英伟达A100图形处理器(GPU)的算力集群,用于人工智能研究与交易应用。

2023年,在ChatGPT发布引发全球生成式人工智能热潮之际,梁文锋决定直接投入通用人工智能(AGI)研究。DeepSeek遂作为独立公司成立,资金主要来自幻方量化,由梁文锋出任负责人。与许多中国科技企业不同,DeepSeek将自身定位为从事基础研究的机构,而非以产品为导向的企业。梁文锋表示,DeepSeek的使命是探索通用人工智能,并将坚持开源路线,把模型权重和技术报告的共享视为对全球研究共同体的贡献,而非竞争上的负担。

历史沿革

DeepSeek的早期发布聚焦于特定领域。2023年11月,公司推出DeepSeek Coder,这是一系列基于大规模编程语料从零训练的代码导向语言模型。随后,公司于2023年底至2024年初发布了通用语言模型家族DeepSeek LLM,其670亿参数版本证明了一个新成立的小型团队同样能够训练出具有竞争力的大型模型。2024年2月,DeepSeek发布DeepSeekMath,该模型引入了群组相对策略优化(Group Relative Policy Optimization,GRPO)强化学习算法,这一算法后来成为公司推理模型的核心技术。

2024年5月,DeepSeek迎来重要技术里程碑:发布2360亿参数的混合专家模型DeepSeek-V2。该模型引入了多头潜在注意力机制,可大幅降低推理阶段的内存需求。DeepSeek-V2不仅因性能受到关注,其激进的API定价还引发了中国人工智能服务商之间的价格战。2024年的后续发布包括DeepSeek-Coder-V2、视觉语言模型DeepSeek-VL以及多模态Janus系列。

2024年12月,DeepSeek发布6710亿参数的混合专家模型DeepSeek-V3,该模型在每个词元的推理中仅激活370亿参数。随附的技术报告指出,其完整训练过程消耗约278.8万GPU小时,使用英伟达H800芯片(即美国半导体出口管制下中国企业可获得的合规处理器),估计成本约为558万美元。尽管这一数字未计入前期研究、基础设施与人员成本,但与同类前沿模型已披露的训练开支相比仍显著偏低,从而加剧了国际社会关于人工智能研发效率的讨论。

2025年1月20日,DeepSeek发布推理模型DeepSeek-R1。该模型主要通过强化学习训练,在作答前生成较长的思维链。基准测试结果显示,R1在数学、编程和科学推理任务上的表现达到或接近OpenAI o1模型的水平。公司同时以MIT许可证发布模型权重,并公开详述其训练方法的技术论文。数日之内,DeepSeek移动应用登顶美国苹果App Store免费应用下载榜;2025年1月27日,英伟达股价单日下跌约17%,市值蒸发约6000亿美元,创下当时单一公司股票单日市值损失的历史纪录。风险投资家马克·安德森将此次发布形容为“人工智能的斯普特尼克时刻”。

在此突破之后,DeepSeek于2025年继续迭代其模型,陆续发布DeepSeek-R1-0528以及DeepSeek-V3.1、V3.2系列等更新版本,进一步提升了推理能力、面向智能体任务的性能与推理效率,其中包括稀疏注意力等技术。

主要模型与产品

DeepSeek的主要模型家族包括:

  • DeepSeek LLM:通用稠密语言模型(70亿与670亿参数版本),奠定了公司预训练与对齐技术的基础。
  • DeepSeek Coder / DeepSeek-Coder-V2:基于多语言编程数据训练的代码专用模型,是最早可与闭源编程助手竞争的开放模型之一。
  • DeepSeekMath:聚焦数学领域的模型,引入了GRPO算法。
  • DeepSeek-V2 与 DeepSeek-V2.5:采用多头潜在注意力机制的混合专家模型,以低推理成本和低API定价著称。
  • DeepSeek-V3:6710亿参数的混合专家模型(每词元激活370亿参数),采用FP8精度训练与无辅助损失的负载均衡策略,为开放模型树立了新的效率标杆。
  • DeepSeek-R1 及其后续版本:通过大规模强化学习训练的推理模型,并有基于Qwen、Llama等较小开放模型蒸馏的版本,使推理能力得以在消费级硬件上运行。
  • DeepSeek-Prover:面向Lean编程语言形式化定理证明的模型。
  • DeepSeek-VL 与 Janus / Janus-Pro:视觉语言模型以及统一理解与生成的多模态模型。

DeepSeek助手以网页服务和移动应用形式提供,为用户对接公司的旗舰模型,是DeepSeek品牌公众知名度的主要来源。

技术特点

DeepSeek的研究以多项架构与工程创新著称:

  1. 混合专家架构:DeepSeekMoE采用细粒度专家分割并结合共享专家的设计,相较传统混合专家结构提升了参数效率。
  2. 多头潜在注意力(MLA):通过将键值缓存压缩至潜在空间,大幅降低推理阶段的内存消耗,从而降低服务成本。
  3. 多词元预测(MTP):用于DeepSeek-V3的训练,以提高数据利用效率,并支持推理阶段的投机解码。
  4. 面向推理的强化学习:DeepSeek-R1证明了思维链推理可以通过基于规则、采用可验证奖励的强化学习(GRPO)涌现,而无需在人工标注的推理轨迹上进行大规模监督微调。
  5. 高效训练工程:采用FP8混合精度训练、自定义并行策略和优化的GPU通信,使其能够在受出口管制限制的硬件上完成大规模训练。

特色与经营模式

DeepSeek最鲜明的特征包括对开源发布的坚持、异常低廉的定价以及研究驱动的组织文化。模型权重以宽松许可证发布于Hugging Face等平台,全球开发者均可自由下载、修改和部署。其API价格长期处于行业最低水平,有时甚至比同类产品低一个数量级,从而加速了开发者和第三方人工智能服务商的采用。

与大型科技集团不同,DeepSeek以规模相对较小的研究团队运营,成员多为直接从北京大学、清华大学等中国顶尖高校招募的青年人才。公司强调青年人才、扁平化管理和长期研究,而非短期商业变现。幻方量化的资金支持赋予其财务独立性,使公司得以专注于基础性AGI研究。梁文锋将DeepSeek的定位概括为全球人工智能创新生态的贡献者,而非追随者。

影响与意义

DeepSeek的崛起在多个领域产生了深远影响:

  • 经济与市场层面:2025年1月的市场反应引发了对人工智能基础设施公司估值的质疑,并表明前沿水平的人工智能能够以远低于此前主流假设的成本开发出来。
  • 技术政策层面:DeepSeek在美国先进芯片出口管制下取得成功,在美国及其盟国引发了关于半导体限制措施有效性以及中国人工智能发展速度的辩论。
  • 开源生态层面:通过以开放权重和详尽技术报告的形式发布前沿模型,DeepSeek加速了推理模型技术的扩散,增强了全球开放模型生态的地位。
  • 产业竞争层面:其定价与开放发布策略对中国及国际人工智能服务商的成本形成压力,促使业界更广泛地重新审视封闭的专有开发模式。

争议与评价

DeepSeek的迅速崛起也引发了审视。出于对数据存储、数据可能被中国政府获取以及网络安全风险的担忧,多国政府和公共机构限制或禁止在官方设备上使用DeepSeek应用,采取此类措施的司法辖区包括澳大利亚、韩国、意大利以及美国部分地区。批评者还指出,DeepSeek的模型实施符合中国法规的内容过滤,会拒绝回答政治敏感问题。此外,部分业界人士质疑其披露的训练成本数字不够完整;OpenAI则在2025年初指称DeepSeek可能使用了其模型的输出、或违反了服务条款——这一指控本身也引发了关于行业通行数据实践的争论。DeepSeek及其支持者回应称,其创新均有经公开审视的技术报告独立记录,并可通过其开放发布加以复现。

尽管存在上述争议,DeepSeek仍被广泛视为2020年代中期最具影响力的人工智能研究机构之一。它证明了架构创新与工程效率能够大幅降低前沿规模人工智能开发的门槛,对全球人工智能产业格局与研究范式产生了持久影响。

评论区 (0)

U

还没有评论,来抢沙发!

你感兴趣的百科

相关百科