lulupedia

Gemini

9188 words·13/09/2026·Português
7

Gemini é uma família de grandes modelos de linguagem multimodais desenvolvida pela Google DeepMind e apresentada em dezembro de 2023. Posicionada como sucessora dos modelos PaLM e LaMDA, desenvolvidos anteriormente pela Google, a família Gemini foi concebida desde o início para processar e gerar conteúdos em múltiplas modalidades — incluindo texto, imagens, áudio, vídeo e código informático — em vez de se limitar ao texto. Os modelos alimentam a aplicação de chatbot Gemini, funcionalidades integradas nos serviços de pesquisa e de produtividade da Google, bem como um conjunto de ferramentas para programadores, o que os torna um pilar central da estratégia de inteligência artificial da empresa e um concorrente de destaque dos modelos da OpenAI, da Anthropic e de outras empresas do setor.

Antecedentes

A Google tem sido um interveniente fundamental na investigação moderna em inteligência artificial. Em 2017, investigadores da empresa publicaram o artigo "Attention Is All You Need", que introduziu a arquitetura transformer subjacente a praticamente todos os grandes modelos de linguagem subsequentes. A Google desenvolveu depois modelos influentes como o BERT, incorporado no motor de pesquisa, e os sistemas conversacionais LaMDA e PaLM.

O lançamento público do ChatGPT, da OpenAI, no final de 2022, é amplamente apontado como o desencadeador de uma resposta estratégica dentro da Google, por vezes descrita na imprensa como um "code red" (alerta máximo), que acelerou os esforços da empresa para levar produtos de IA generativa ao mercado. No início de 2023, a Google lançou o Bard, um chatbot conversacional baseado no LaMDA e, mais tarde, no PaLM. Em abril de 2023, a empresa consolidou as suas operações de investigação ao fundir a Google Brain com a DeepMind, empresa de inteligência artificial sediada em Londres que adquirira em 2014, criando a Google DeepMind, liderada por Demis Hassabis. Esta organização unificada assumiu o desenvolvimento do Gemini. Observadores sublinharam que o nome Gemini, que significa "os gémeos", tem sido interpretado como uma alusão à fusão das duas unidades de investigação em IA da Google.

História e desenvolvimento

O Gemini 1.0 foi anunciado em 6 de dezembro de 2023 e lançado em três níveis: o Gemini Ultra, a versão maior e mais capaz; o Gemini Pro, um modelo de dimensão intermédia que equilibra desempenho e eficiência; e o Gemini Nano, um modelo compacto concebido para funcionar diretamente em dispositivos móveis. A Google reportou que o Gemini Ultra alcançou resultados de estado da arte numa ampla gama de benchmarks académicos, afirmando que foi o primeiro modelo a superar especialistas humanos no teste de conhecimento MMLU, embora avaliadores independentes tenham questionado a metodologia dessa comparação.

Em fevereiro de 2024, a Google rebatizou o seu chatbot Bard como Gemini e introduziu uma subscrição paga, o Gemini Advanced, incluída no plano Google One AI Premium. Ainda nesse mês, a empresa apresentou o Gemini 1.5, uma arquitetura significativamente melhorada, construída sobre um desenho Mixture-of-Experts (mistura de especialistas), que permitiu uma janela de contexto de até um milhão de tokens — uma das maiores disponíveis na altura — permitindo ao modelo processar livros inteiros, bases de código ou horas de vídeo num único pedido. Esta capacidade foi depois expandida para dois milhões de tokens. Na conferência para programadores I/O, em maio de 2024, a Google apresentou o Gemini 1.5 Flash, uma variante mais rápida e leve, e demonstrou o Project Astra, um protótipo de investigação dedicado à exploração de assistência por IA multimodal em tempo real.

Em dezembro de 2024, a Google anunciou a série Gemini 2.0, começando por uma versão experimental do Gemini 2.0 Flash. Esta geração enfatizou capacidades agentivas — a capacidade de sistemas de IA planearem e executarem tarefas de múltiplos passos com recurso a ferramentas —, incluindo saída nativa de imagens e áudio, a funcionalidade Deep Research para geração autónoma de relatórios a partir de múltiplas fontes e agentes experimentais como o Project Mariner para navegação na web. Em março de 2025, a Google lançou o Gemini 2.5 Pro Experimental, um modelo de "raciocínio" que realiza uma deliberação interna prolongada antes de responder; este alcançou rapidamente os primeiros lugares em tabelas de comparação de modelos populares, sendo seguido pelo Gemini 2.5 Flash nos meses subsequentes.

Arquitetura e características técnicas

Os modelos Gemini são redes neuronais baseadas na arquitetura transformer, treinadas sobre grandes conjuntos de dados de texto, código, imagens, áudio e vídeo, com o treino realizado nas unidades de processamento tensorial (TPU) personalizadas da Google. Uma decisão de desenho distintiva foi a "multimodalidade nativa": em vez de acrescentar sistemas separados de visão ou de áudio a um modelo de texto, o Gemini foi treinado desde o início com dados multimodais intercalados, o que, segundo a Google, explica a sua capacidade de raciocínio entre modalidades, como responder a perguntas sobre gráficos, escrita manual ou conteúdos em vídeo.

O Gemini 1.5 adotou uma arquitetura esparsa Mixture-of-Experts, na qual apenas um subconjunto dos parâmetros da rede é ativado para cada entrada, melhorando a eficiência em relação a modelos densos de capacidade comparável. A geração Gemini 2.5 introduziu modelos híbridos de "pensamento" (thinking), que geram passos de raciocínio estruturados antes de produzirem as respostas finais — uma abordagem associada a um desempenho melhorado em matemática, programação e planeamento complexo. Os modelos suportam igualmente o processamento de contextos longos, a chamada de funções (function calling) para integração com ferramentas e APIs externas, a geração de saídas estruturadas e a afinação fina (fine-tuning) para aplicações especializadas.

Versões dos modelos e integração em produtos

A família Gemini evoluiu ao longo de várias gerações, sendo geralmente oferecida em variantes Pro (elevada capacidade), Flash (rápida e económica) e Nano (para funcionamento no dispositivo). Para além dos modelos principais, a Google mantém o Gemma, uma família de modelos mais pequenos e de disponibilidade aberta, derivados da investigação do Gemini e destinados à implementação local e à adaptação pela comunidade.

A tecnologia Gemini está integrada em todo o ecossistema de produtos da Google. A aplicação autónoma Gemini, disponível na web, em Android e em iOS, sucedeu ao Bard como chatbot de consumo da empresa e inclui conversação por voz através do Gemini Live. No Google Workspace, as funcionalidades do Gemini auxiliam a redação, a sumarização e a análise no Gmail, no Docs, no Sheets e noutras ferramentas. O Google Search incorpora as AI Overviews geradas pelo Gemini, que apresentam respostas resumidas acima dos resultados tradicionais. Os modelos também funcionam no dispositivo nos telemóveis Pixel, servem de motor ao NotebookLM e estão acessíveis aos programadores através da API Gemini, do Google AI Studio e da plataforma empresarial Vertex AI. Os planos pagos incluem o Gemini Advanced, incluído no Google One AI Premium, e subscrições empresariais e de educação para o Workspace.

Impacto e significado

O Gemini representa uma das integrações de maior escala de modelos de IA de fronteira em software de consumo e empresarial amplamente utilizado. Dado que os serviços da Google alcançam milhares de milhões de utilizadores, o lançamento das funcionalidades baseadas no Gemini teve uma influência significativa na forma como o público entra em contacto com a IA generativa, desde os resultados de pesquisa aos assistentes móveis. Na indústria, o Gemini é considerado um dos principais concorrentes da série GPT da OpenAI e do Claude da Anthropic, e a sua ênfase em janelas de contexto muito longas e na multimodalidade nativa moldou tendências de desenho mais amplas no setor.

A família de modelos também afetou a posição comercial da Google, reforçando a presença da empresa no mercado de IA em nuvem através do Vertex AI, ao mesmo tempo que levantou questões estratégicas sobre a monetização da pesquisa, uma vez que as respostas geradas por IA podem reduzir o tráfego para sites externos. Para programadores e investigadores, as capacidades de contexto longo do Gemini abriram novas aplicações na análise de documentos, na compreensão de código e na compreensão de vídeo, enquanto os lançamentos dos modelos abertos Gemma contribuíram para o ecossistema de modelos mais pequenos e implementáveis.

Recepção e controvérsias

A recepção do Gemini tem sido mista em alguns aspetos. As afirmações relativas a benchmarks feitas no lançamento suscitaram escrutínio quanto aos métodos de avaliação e às comparações com modelos concorrentes. No início de 2024, o chatbot Gemini enfrentou críticas substanciais por se recusar a responder a perguntas sobre figuras políticas e por resultados de geração de imagens que retratavam figuras e cenários históricos — como unidades militares da época da Segunda Guerra Mundial — de formas anacronicamente diversas. A Google suspendeu a funcionalidade de geração de imagens de pessoas, apresentou desculpas e descreveu o comportamento como resultado de uma afinação defeituosa do modelo. O episódio suscitou um debate mais amplo sobre enviesamento, afinação de segurança e governação de produtos em grandes sistemas de IA.

Como todos os grandes modelos de linguagem, o Gemini continua sujeito a alucinações — a geração confiante de informação imprecisa —, o que tem sido criticado quando se manifesta nas AI Overviews do motor de pesquisa. Observadores levantaram ainda preocupações sobre a privacidade, a utilização de dados no treino, a dependência de um pequeno número de grandes empresas tecnológicas no domínio da IA de fronteira e a pegada ambiental do treino de modelos à grande escala. A Google respondeu com relatórios técnicos, avaliações de segurança, ferramentas de marca de água como o SynthID para conteúdos gerados por IA e uma filosofia declarada de lançamento "ousado mas responsável", embora os debates sobre a adequação destas medidas continuem.

Outros usos do termo

O nome Gemini refere-se também a vários outros temas notáveis: Gémeos, uma constelação do zodíaco que representa os gémeos mitológicos Castor e Pólux, e o correspondente signo astrológico; o Projeto Gemini, o segundo programa de voo espacial tripulado da NASA (1961–1966), que desenvolveu e demonstrou tecnologias essenciais para as aterragens lunares do programa Apollo; e a Gemini, uma plataforma de câmbio de criptomoedas fundada em 2014 por Cameron e Tyler Winklevoss. Este artigo ocupa-se principalmente da família de modelos da Google DeepMind, que se tornou o referente contemporâneo mais proeminente do termo no contexto da inteligência artificial.

Comments (0)

U

No comments yet. Be the first to comment!

You May Be Interested In

Related Articles