DeepSeek
DeepSeek (официальное наименование — Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., кит. 杭州深度求索人工智能基础技术研究有限公司, «Ханчжоуская компания фундаментальных исследований технологий искусственного интеллекта DeepSeek»; название 深度求索 буквально переводится как «глубокое исследование», «глубокий поиск») — китайская исследовательская компания в области искусственного интеллекта, специализирующаяся на разработке больших языковых моделей и связанных с ними технологий. Компания была основана в 2023 году в Ханчжоу предпринимателем Лян Вэньфэном при финансовой поддержке принадлежащего ему количественного хедж-фонда High-Flyer. Международную известность DeepSeek приобрела в январе 2025 года после выпуска модели DeepSeek-R1 — «рассуждающей» модели, чьи результаты сравнялись с показателями ведущих западных моделей переднего края при, по имеющимся данным, лишь малой доле затрат на обучение. DeepSeek широко известна публикацией своих моделей с открытыми весами, инновациями в области эффективных архитектур и методов обучения, а также значительными потрясениями, которые её релизы вызвали на мировых технологических рынках и в дискуссиях о политике в сфере ИИ.
Предыстория и основание
Истоки DeepSeek связаны с компанией High-Flyer (幻方量化) — количественной инвестиционной фирмой, сооснователем которой в 2015 году стал Лян Вэньфэн. High-Flyer превратилась в один из крупнейших количественных хедж-фондов Китая, управлявший активами на миллиарды долларов и в значительной степени полагавшийся на машинное обучение при разработке торговых стратегий. Примерно с 2019 года High-Flyer активно инвестировала в вычислительную инфраструктуру и в итоге сформировала кластер примерно из 10 000 графических процессоров NVIDIA A100 для исследований в области ИИ и торговых приложений.
В 2023 году, на фоне мирового интереса к генеративному искусственному интеллекту, вызванного выходом ChatGPT, Лян принял решение непосредственно заняться исследованиями в направлении общего искусственного интеллекта (AGI). DeepSeek была учреждена как независимая компания, финансировавшаяся главным образом за счёт High-Flyer; Лян Вэньфэн возглавил её. В отличие от многих китайских технологических фирм, компания позиционировала себя как организация фундаментальных исследований, а не как предприятие, ориентированное на выпуск коммерческих продуктов. Лян заявлял, что миссия DeepSeek состоит в достижении AGI и что компания намерена следовать открытому пути, рассматривая публикацию весов моделей и технических отчётов как вклад в мировое исследовательское сообщество, а не как конкурентную уязвимость.
История развития
Ранние релизы DeepSeek были сосредоточены на специализированных областях. В ноябре 2023 года компания представила DeepSeek Coder — серию моделей языка, ориентированных на программирование и обученных с нуля на больших корпусах программного кода. За ней последовала DeepSeek LLM — семейство универсальных языковых моделей, выпущенное в конце 2023 — начале 2024 года; версия с 67 миллиардами параметров продемонстрировала, что небольшая недавно созданная команда способна обучать конкурентоспособные крупные модели. В феврале 2024 года была выпущена DeepSeekMath, в которой был представлен алгоритм обучения с подкреплением GRPO (Group Relative Policy Optimization, «групповая относительная оптимизация политики»), впоследствии ставший ключевым для рассуждающих моделей компании.
Значимый технический этап наступил в мае 2024 года с выходом DeepSeek-V2 — модели типа «смесь экспертов» (Mixture-of-Experts, MoE) с 236 миллиардами параметров, в которой был применён механизм Multi-head Latent Attention (MLA), резко сокращающий требования к памяти при выводе. DeepSeek-V2 привлекла внимание не только производительностью, но и агрессивным ценообразованием API, спровоцировавшим ценовую войну среди китайских поставщиков ИИ. В течение 2024 года вышли также DeepSeek-Coder-V2, визуально-языковая модель DeepSeek-VL и мультимодальная серия Janus.
В декабре 2024 года DeepSeek представила DeepSeek-V3 — модель MoE с 671 миллиардом параметров, из которых на каждый токен активируется лишь 37 миллиардов. Согласно сопровождающему техническому отчёту, полный цикл обучения потребовал около 2,788 миллиона часов работы графических процессоров при оценочной стоимости примерно 5,58 миллиона долларов США с использованием чипов NVIDIA H800 — процессоров, доступных китайским компаниям в рамках ограничений на экспорт американских полупроводников. Эта цифра, не учитывавшая предшествующие исследования, инфраструктуру и расходы на персонал, оказалась драматически ниже заявленных расходов на обучение сопоставимых моделей переднего края и обострила международную дискуссию об эффективности разработки ИИ.
20 января 2025 года DeepSeek выпустила DeepSeek-R1 — рассуждающую модель, обученную преимущественно методом обучения с подкреплением формировать развёрнутые цепочки рассуждений перед выдачей ответа. По результатам бенчмарков производительность R1 находилась на уровне модели OpenAI o1 или вблизи него в задачах математики, программирования и научных рассуждений. Одновременно компания опубликовала веса модели под лицензией MIT, а также техническую статью с описанием методологии обучения. В течение нескольких дней мобильное приложение DeepSeek стало самым загружаемым бесплатным приложением в американском App Store, а 27 января 2025 года акции NVIDIA упали примерно на 17 %, что привело к потере около 600 миллиардов долларов рыночной капитализации за один день — крупнейшему на тот момент однодневному падению стоимости одной компании в истории фондового рынка. Венчурный инвестор Марк Андреессен охарактеризовал релиз как «момент Спутника для ИИ».
После этого прорыва DeepSeek в 2025 году продолжила развитие своих моделей, выпустив обновлённые версии, включая DeepSeek-R1-0528, а также серию DeepSeek-V3.1 и V3.2, в которых были дополнительно улучшены рассуждающие способности, показатели в агентских задачах и эффективность вывода, в том числе за счёт методов разреженного внимания.
Модели и продукты
Семейства моделей DeepSeek включают:
- DeepSeek LLM — универсальные плотные (dense) языковые модели (7 и 67 миллиардов параметров), заложившие основы предобучения и выравнивания (alignment) компании.
- DeepSeek Coder / DeepSeek-Coder-V2 — модели, специализирующиеся на программировании и обученные на многоязычных данных исходного кода; одни из первых открытых моделей, конкурентоспособных с закрытыми ассистентами для кодинга.
- DeepSeekMath — математически ориентированная модель, в которой был представлен алгоритм GRPO.
- DeepSeek-V2 и DeepSeek-V2.5 — модели типа «смесь экспертов» с механизмом латентного многоголового внимания, примечательные низкой стоимостью вывода и ценами на API.
- DeepSeek-V3 — MoE-модель с 671 миллиардом параметров (37 миллиардов активируются на токен), обученная с точностью FP8 и балансировкой нагрузки без вспомогательной функции потерь (auxiliary-loss-free), задавшая новый эталон эффективности для открытых моделей.
- DeepSeek-R1 и её обновления — рассуждающие модели, обученные посредством масштабного обучения с подкреплением, с дистиллированными вариантами на основе меньших открытых моделей (Qwen и Llama), сделавшими рассуждающие возможности доступными на потребительском оборудовании.
- DeepSeek-Prover — модели для формального доказательства теорем на языке программирования Lean.
- DeepSeek-VL и Janus / Janus-Pro — визуально-языковые и унифицированные мультимодальные модели понимания и генерации.
Ассистент DeepSeek, доступный как веб-сервис и мобильное приложение, предоставляет диалоговый доступ к флагманским моделям компании и обеспечивает основную часть публичной узнаваемости бренда.
Технические особенности
Исследования DeepSeek отличает ряд архитектурных и инженерных инноваций:
- Архитектуры типа «смесь экспертов» (MoE): DeepSeekMoE применяет мелкозернистое разбиение на экспертов в сочетании с общими экспертами, что повышает эффективность использования параметров по сравнению с классическими MoE-конструкциями.
- Многоголовое латентное внимание (MLA): за счёт сжатия кэша «ключ—значение» в латентном пространстве MLA существенно снижает потребление памяти при выводе, уменьшая затраты на обслуживание моделей.
- Предсказание нескольких токенов (Multi-Token Prediction, MTP): применяется при обучении DeepSeek-V3 для повышения эффективности использования данных и обеспечения спекулятивного декодирования на этапе вывода.
- Обучение с подкреплением для рассуждений: DeepSeek-R1 показала, что цепочечное рассуждение может возникать при обучении с подкреплением на основе правил с проверяемыми вознаграждениями (GRPO), без масштабного дообучения с учителем на размеченных людьми примерах рассуждений.
- Эффективная инженерия обучения: использование смешанной точности FP8, собственные стратегии параллелизма и оптимизированная коммуникация между графическими процессорами позволили вести обучение на оборудовании, подпадающем под экспортные ограничения.
Характерные черты и бизнес-модель
К наиболее отличительным чертам DeepSeek относятся приверженность открытому опубликованию моделей, необычно низкие цены и исследовательская корпоративная культура. Веса моделей публикуются на таких платформах, как Hugging Face, под разрешительными лицензиями, что позволяет разработчикам по всему миру загружать, модифицировать и развёртывать их. Цены на API компании входят в число самых низких в отрасли, порой на порядок уступая сопоставимым предложениям, что ускорило её принятие разработчиками и сторонними поставщиками ИИ-сервисов.
В отличие от крупных технологических конгломератов, DeepSeek работает с относительно небольшой командой исследователей, многие из которых набираются непосредственно из ведущих китайских университетов, включая Пекинский университет и Университет Цинхуа; компания делает ставку на молодых специалистов, плоскую структуру управления и долгосрочные исследования, а не на быструю монетизацию. Финансирование со стороны High-Flyer обеспечивает финансовую независимость, позволяя уделять первостепенное внимание фундаментальным исследованиям в направлении AGI. Лян Вэньфэн определял подход DeepSeek как позицию участника, вносящего вклад в глобальную инновационную экосистему ИИ, а не её последователя.
Влияние и значение
Появление DeepSeek имело далеко идущие последствия в нескольких областях:
- Экономическое и рыночное влияние: реакция рынков в январе 2025 года поставила под вопрос оценки компаний ИИ-инфраструктуры и продемонстрировала, что ИИ уровня переднего края может разрабатываться при существенно меньших затратах, чем предполагалось ранее.
- Технологическая политика: успех DeepSeek в условиях американских экспортных ограничений на передовые чипы стимулировал в США и союзных государствах дискуссию об эффективности полупроводниковых санкций и о темпах развития китайского ИИ.
- Экосистема открытого кода: выпуская модели переднего края с открытыми весами и подробными техническими отчётами, DeepSeek ускорила распространение технологий рассуждающих моделей и укрепила позиции открытых модельных экосистем в мире.
- Отраслевая конкуренция: ценообразование и открытые релизы компании оказали давление на китайских и международных поставщиков ИИ в части затрат и вынудили шире пересмотреть стратегии закрытой, проприетарной разработки.
Восприятие и противоречия
Стремительный взлёт DeepSeek также привлёк пристальное внимание. Ряд правительств и государственных учреждений ограничил или запретил использование приложения DeepSeek на служебных устройствах из-за опасений относительно хранения данных, возможного доступа к ним со стороны китайских государственных органов и рисков кибербезопасности; такие меры были приняты в юрисдикциях, включая Австралию, Южную Корею, Италию и отдельные части США. Критики также отмечали, что модели DeepSeek применяют фильтрацию контента в соответствии с китайским законодательством, отказываясь отвечать на политически чувствительные вопросы. Кроме того, некоторые представители отрасли ставили под сомнение полноту заявленных цифр стоимости обучения, а OpenAI в начале 2025 года утверждала, что DeepSeek могла использовать результаты её моделей, возможно, в нарушение условий обслуживания, — обвинение, которое само по себе вызвало дискуссию об общепринятых в отрасли практиках работы с данными. DeepSeek и её сторонники в ответ указывали, что инновации компании независимо задокументированы в прошедших экспертную проверку технических отчётах и воспроизводимы благодаря её открытым релизам.
Несмотря на эти противоречия, DeepSeek в целом рассматривается как одна из самых влиятельных исследовательских организаций в области искусственного интеллекта середины 2020-х годов, показавшая, что архитектурные инновации и инженерная эффективность способны существенно снизить барьеры для разработки ИИ переднего края.
You May Be Interested In
Токио
Токио (яп. 東京 Тō:кё:, «Восточная столица»), официально — Столичная префектура Токио, — столица и самая населённая префек...
Футбол
Футбол (в ряде англоязычных стран, где распространены иные разновидности игры, — «соккер», англ. soccer; полное название...
Вена
Вена (нем. Wien; австро-бавар. Wean) — столица и крупнейший город Австрии, расположенный на востоке страны на берегах ре...
Бразилия
Бразилия (порт. Brasil), официально Федеративная Республика Бразилия (порт. República Federativa do Brasil), — крупнейше...
Related Articles
Artificial intelligence
OpenAI
OpenAI — американская компания, занимающаяся исследованиями и практическим внедрением искусственного интеллекта; её штаб...
Qwen (Тунъи Цяньвэнь)
Qwen (кит. 通义千问, пиньинь Tōngyì Qiānwèn, палл. «Тунъи Цяньвэнь»), известное на международном уровне также как Tongyi Qia...
Comments (0)
No comments yet. Be the first to comment!