lulupedia

DeepSeek

11009 words·22/09/2026·Português
23

DeepSeek (nome oficial: Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd.; em chinês: 杭州深度求索人工智能基础技术研究有限公司, literalmente "Exploração Profunda") é uma empresa chinesa de pesquisa em inteligência artificial que desenvolve modelos de linguagem de grande escala e tecnologias correlatas de IA. Fundada em 2023 em Hangzhou pelo empreendedor Liang Wenfeng e apoiada financeiramente por seu fundo de hedge quantitativo High-Flyer, a empresa alcançou proeminência internacional em janeiro de 2025 com o lançamento do DeepSeek-R1, um modelo de raciocínio cujo desempenho rivalizou com os principais modelos de fronteira ocidentais, exigindo, segundo relatos, apenas uma fração do custo de treinamento. A DeepSeek é amplamente conhecida por disponibilizar seus modelos como pesos abertos (open weights), por suas inovações em arquitetura e treinamento eficiente de modelos e pelas significativas perturbações que seus lançamentos causaram nos mercados globais de tecnologia e nos debates sobre políticas de IA.

Antecedentes e Fundação

As origens da DeepSeek remontam à High-Flyer (幻方量化), uma empresa de investimentos quantitativos cofundada por Liang Wenfeng em 2015. A High-Flyer tornou-se um dos maiores fundos de hedge quantitativos da China, gerenciando ativos avaliados em bilhões de dólares e dependendo fortemente de aprendizado de máquina para suas estratégias de negociação. A partir de aproximadamente 2019, a High-Flyer investiu pesadamente em infraestrutura de computação, acumulando eventualmente um cluster de cerca de 10.000 unidades de processamento gráfico (GPUs) NVIDIA A100 para pesquisa em IA e aplicações de negociação.

Em 2023, com a inteligência artificial generativa atraindo atenção global após o lançamento do ChatGPT, Liang decidiu dedicar-se diretamente à pesquisa sobre inteligência artificial geral (AGI). A DeepSeek foi estabelecida como uma empresa independente, financiada principalmente pela High-Flyer, com Liang atuando como seu dirigente. A empresa diferenciou-se de muitas empresas tecnológicas chinesas ao se posicionar como uma organização de pesquisa fundamental, em vez de uma empresa orientada a produtos. Liang afirmou que a missão da DeepSeek era buscar a AGI e que a empresa pretendia abraçar o caminho do código aberto, encarando o compartilhamento de pesos de modelos e relatórios técnicos como uma contribuição para a comunidade global de pesquisa, e não como uma desvantagem competitiva.

Desenvolvimento Histórico

Os primeiros lançamentos da DeepSeek concentraram-se em domínios especializados. Em novembro de 2023, a empresa apresentou o DeepSeek Coder, uma série de modelos de linguagem voltados para código, treinados do zero com grandes corpora de dados de programação. Em seguida, foi lançado o DeepSeek LLM, uma família de modelos de linguagem de uso geral divulgada entre o final de 2023 e o início de 2024, cuja versão de 67 bilhões de parâmetros demonstrou que uma equipe pequena e recém-formada poderia treinar modelos de grande escala competitivos. Em fevereiro de 2024, a DeepSeek lançou o DeepSeekMath, que introduziu o algoritmo de aprendizado por reforço Group Relative Policy Optimization (GRPO), que mais tarde se revelaria central para os modelos de raciocínio da empresa.

Um marco técnico significativo chegou em maio de 2024 com o DeepSeek-V2, um modelo Mixture-of-Experts de 236 bilhões de parâmetros que introduziu a Multi-head Latent Attention (MLA), um mecanismo que reduz drasticamente os requisitos de memória durante a inferência. O DeepSeek-V2 atraiu atenção não apenas pelo desempenho, mas também por seus preços agressivos de API, que desencadearam uma guerra de preços entre provedores chineses de IA. Lançamentos sucessivos em 2024 incluíram o DeepSeek-Coder-V2, o modelo de visão-linguagem DeepSeek-VL e a série multimodal Janus.

Em dezembro de 2024, a DeepSeek lançou o DeepSeek-V3, um modelo Mixture-of-Experts de 671 bilhões de parâmetros que ativa apenas 37 bilhões de parâmetros por token. O relatório técnico que o acompanhou declarou que o ciclo completo de treinamento consumiu aproximadamente 2,788 milhões de horas de GPU, a um custo estimado de cerca de 5,58 milhões de dólares norte-americanos, utilizando chips NVIDIA H800 — processadores compatíveis com as restrições de exportação disponíveis para empresas chinesas sob as limitações estadunidenses de semicondutores. Esse valor, embora excluindo pesquisas anteriores, infraestrutura e custos de pessoal, era dramaticamente inferior aos gastos de treinamento relatados de modelos de fronteira comparáveis, e intensificou o debate internacional sobre a eficiência do desenvolvimento de IA.

Em 20 de janeiro de 2025, a DeepSeek lançou o DeepSeek-R1, um modelo de raciocínio treinado predominantemente por meio de aprendizado por reforço para produzir cadeias de pensamento estendidas antes de responder. Os resultados de benchmarks posicionaram o desempenho do R1 no nível ou próximo ao do modelo o1 da OpenAI em tarefas de matemática, programação e raciocínio científico. A empresa publicou simultaneamente os pesos do modelo sob licença MIT, juntamente com um artigo técnico detalhando sua metodologia de treinamento. Em poucos dias, o aplicativo móvel da DeepSeek tornou-se o aplicativo gratuito mais baixado da App Store da Apple nos Estados Unidos e, em 27 de janeiro de 2025, as ações da NVIDIA caíram aproximadamente 17%, apagando cerca de 600 bilhões de dólares em capitalização de mercado em um único dia — a maior pergunta diária para uma única empresa na história do mercado de ações até então. O capitalista de risco Marc Andreessen descreveu o lançamento como "o momento Sputnik da IA".

Após essa ruptura, a DeepSeek continuou a iterar seus modelos em 2025, lançando versões atualizadas como o DeepSeek-R1-0528 e as séries DeepSeek-V3.1 e V3.2, que aprimoraram ainda mais as capacidades de raciocínio, o desempenho orientado a agentes e a eficiência de inferência, incluindo técnicas de atenção esparsa.

Modelos e Produtos

As famílias de modelos da DeepSeek incluem:

  • DeepSeek LLM: modelos densos de linguagem de uso geral (7B e 67B parâmetros) que estabeleceram as bases da empresa em pré-treinamento e alinhamento.
  • DeepSeek Coder / DeepSeek-Coder-V2: modelos especializados em código, treinados com dados de programação multilíngues, estando entre os primeiros modelos abertos competitivos com assistentes de programação fechados.
  • DeepSeekMath: um modelo focado em matemática que introduziu o algoritmo GRPO.
  • DeepSeek-V2 e DeepSeek-V2.5: modelos Mixture-of-Experts com Multi-head Latent Attention, notáveis pelo baixo custo de inferência e preços de API.
  • DeepSeek-V3: um modelo MoE de 671B parâmetros (37B ativados por token), treinado com precisão FP8 e balanceamento de carga sem perda auxiliar, estabelecendo um novo padrão de eficiência para modelos abertos.
  • DeepSeek-R1 e atualizações do R1: modelos de raciocínio treinados por meio de aprendizado por reforço em larga escala, com variantes destiladas baseadas em modelos abertos menores (Qwen e Llama), que tornaram as capacidades de raciocínio acessíveis em hardware de consumo.
  • DeepSeek-Prover: modelos para demonstração formal de teoremas na linguagem de programação Lean.
  • DeepSeek-VL e Janus / Janus-Pro: modelos de visão-linguagem e modelos multimodais unificados de compreensão-geração.

O assistente DeepSeek, disponível como serviço web e aplicativo móvel, fornece acesso conversacional aos modelos principais da empresa e responde por grande parte da visibilidade pública da marca.

Características Técnicas

A pesquisa da DeepSeek é distinguida por diversas inovações arquiteturais e de engenharia:

  1. Arquiteturas Mixture-of-Experts (MoE): o DeepSeekMoE emprega segmentação de especialistas em granularidade fina combinada com especialistas compartilhados, melhorando a eficiência de parâmetros em comparação com projetos MoE convencionais.
  2. Multi-head Latent Attention (MLA): ao comprimir os caches de chave-valor em um espaço latente, a MLA reduz substancialmente o consumo de memória durante a inferência, diminuindo os custos de operação.
  3. Multi-Token Prediction (MTP): utilizado no treinamento do DeepSeek-V3 para melhorar a eficiência dos dados e permitir decodificação especulativa no momento da inferência.
  4. Aprendizado por reforço para raciocínio: o DeepSeek-R1 demonstrou que o raciocínio em cadeia de pensamento poderia emergir de aprendizado por reforço baseado em regras com recompensas verificáveis (GRPO), sem a necessidade de ajuste fino supervisionado extensivo com traços de raciocínio rotulados por humanos.
  5. Engenharia de treinamento eficiente: o uso de treinamento em precisão mista FP8, estratégias de paralelismo personalizadas e comunicação de GPU otimizada possibilitou o treinamento em hardware sujeito a limitações de exportação.

Características e Modelo de Negócio

As características mais distintivas da DeepSeek incluem seu compromisso com lançamentos de código aberto, seus preços invulgarmente baixos e sua cultura organizacional orientada à pesquisa. Os pesos dos modelos são publicados em plataformas como a Hugging Face sob licenças permissivas, permitindo que desenvolvedores do mundo inteiro os baixem, modifiquem e implementem. Os preços de API da empresa figuram entre os mais baixos do setor, por vezes subcotando ofertas comparáveis em uma ordem de grandeza, o que acelerou a adoção por desenvolvedores e provedores terceirizados de IA.

Diferentemente dos grandes conglomerados tecnológicos, a DeepSeek opera com uma equipe comparativamente pequena de pesquisadores, muitos recrutados diretamente de universidades chinesas de elite, como as Universidades de Pequim e Tsinghua, e enfatiza jovens talentos, gestão horizontal e pesquisa de longo prazo em detrimento da monetização imediata. O financiamento da High-Flyer proporciona independência financeira, permitindo que a empresa priorize a pesquisa fundamental em AGI. Liang Wenfeng enquadrou a abordagem da DeepSeek como a de um contribuinte para, e não de um seguidor dentro do, ecossistema global de inovação em IA.

Impacto e Significado

O surgimento da DeepSeek teve consequências de longo alcance em vários domínios:

  • Impacto econômico e de mercado: a reação do mercado em janeiro de 2025 levantou questões sobre as avaliações das empresas de infraestrutura de IA e demonstrou que IA de nível de fronteira poderia ser desenvolvida a um custo substancialmente inferior ao sugerido pelas premissas vigentes.
  • Política tecnológica: o sucesso da DeepSeek sob os controles de exportação estadunidenses de chips avançados alimentou o debate nos Estados Unidos e em países aliados sobre a eficácia das restrições de semicondutores e o ritmo do desenvolvimento chinês de IA.
  • Ecossistema de código aberto: ao lançar modelos de nível de fronteira com pesos abertos e relatórios técnicos detalhados, a DeepSeek acelerou a difusão de técnicas de modelos de raciocínio e fortaleceu a posição dos ecossistemas de modelos abertos globalmente.
  • Concorrência setorial: seus preços e lançamentos abertos pressionaram provedores de IA chineses e internacionais quanto aos custos e impulsionaram uma reconsideração mais ampla das estratégias fechadas de desenvolvimento proprietário.

Recepção e Controvérsias

A ascensão rápida da DeepSeek também gerou escrutínio. Vários governos e instituições públicas restringiram ou proibiram o aplicativo DeepSeek em dispositivos oficiais, sob preocupações com o armazenamento de dados, o potencial acesso por autoridades do Estado chinês e riscos de segurança cibernética; tais medidas foram adotadas em jurisdições incluindo Austrália, Coreia do Sul, Itália e partes dos Estados Unidos. Críticos também observaram que os modelos da DeepSeek aplicam filtragem de conteúdo consistente com as regulamentações chinesas, recusando-se a responder a questões politicamente sensíveis. Adicionalmente, alguns líderes da indústria questionaram a integridade dos números de custos de treinamento relatados, e a OpenAI alegou no início de 2025 que a DeepSeek pode ter utilizado saídas de seus modelos, potencialmente em violação dos termos de serviço — uma acusação que, por sua vez, provocou debate sobre as práticas padrão de dados da indústria. A DeepSeek e seus defensores responderam que suas inovações estão documentadas de forma independente em relatórios técnicos submetidos ao escrutínio de pares e reproduzíveis por meio de seus lançamentos abertos.

Apesar dessas controvérsias, a DeepSeek é amplamente considerada uma das organizações de pesquisa em IA mais influentes de meados da década de 2020, tendo demonstrado que a inovação arquitetural e a eficiência de engenharia podem reduzir substancialmente as barreiras ao desenvolvimento de inteligência artificial em escala de fronteira.

Comments (0)

U

No comments yet. Be the first to comment!

You May Be Interested In

Related Articles