AI

Ferramentas de Deep Research: OpenAI vs Perplexity vs Gemini

Todo grande laboratório de IA já lança um agente de "deep research", e a maioria deles também lança uma API de pesquisa. Todos prometem relatórios de nível de doutorado em minutos. Depois de um ano e meio de uso real, as diferenças são mais específicas do que o marketing sugere, e raramente estão onde os benchmarks apontam.

29 min de leitura
Pontos-chave
    • A Perplexity Deep Research não roda mais no Sonar: desde fevereiro de 2026 ela roda no Claude Opus e, desde junho de 2026, é executada dentro do Perplexity Computer. A API sonar-deep-research, que fez da Perplexity a favorita dos desenvolvedores, encerra o suporte em 27 de setembro de 2026.
  • O "modelo de deep research" dedicado está desaparecendo: OpenAI, Perplexity, Google, Anthropic e xAI trocaram o ID único de modelo de pesquisa por uma sessão de agente somada a um seletor de esforço. Os níveis de esforço são o novo produto.
  • O Google lidera os quatro grandes nos benchmarks publicados: o Deep Research Max reportou 54,6% no Humanity's Last Exam contra 50,4% do nível padrão (Google, abril de 2026), e o Kimi K3, da Moonshot, reivindica um número maior que os dois. Leia os rótulos de nível com atenção, porque os fornecedores raramente o fazem.
  • O orçamento de buscas vence a escolha do modelo: em testes de terceiros, uma configuração marcou 35,8% no BrowseComp com limite de 1 turno de busca e 89,0% com 25 turnos. Mesmo modelo, mesmo benchmark.
  • Os planos gratuitos ficaram mais vagos, não melhores: a central de ajuda da OpenAI deixou de informar as contagens de deep research por plano ao longo de 2026, e a empresa pausou novas assinaturas do Pro de US$ 200 em 10 de setembro. O AI Plus do Gemini, a US$ 4,99, é hoje o ponto de entrada pago mais barato de qualquer laboratório de fronteira.
  • O relatório não é o resultado; o seu entendimento é: combinar um agente de deep research com um fluxo de marcação de textos como o do Glasp transforma relatórios de 20 páginas em conhecimento utilizável, em vez de PDFs lidos uma única vez.

O momento do deep research

Para a maioria das pessoas em setembro de 2026, o Gemini Deep Research é a melhor escolha geral: os benchmarks publicados mais fortes e a entrada paga mais barata, a US$ 4,99. O Perplexity Pro, a US$ 20, oferece o melhor volume pelo preço, e OpenAI e Claude produzem os relatórios mais profundos em trabalhos ambíguos. Desenvolvedores deveriam começar pela Deep Research API do Google, a única opção pronta para uso que não está com os dias contados, porque a Perplexity aposenta o sonar-deep-research em 27 de setembro de 2026 e a OpenAI desligou seus modelos de pesquisa dedicados em julho.

O restante deste guia mostra como esses veredictos se sustentam em preços, benchmarks, APIs e trabalhos reais.

A categoria em si ainda não tem dois anos. Em 2 de fevereiro de 2025, a OpenAI anunciou o Deep Research. Foi o primeiro agente que a maioria das pessoas usou capaz de pegar um prompt de uma frase, planejar uma investigação de 30 minutos, navegar sozinho por dezenas de fontes e voltar com um relatório com citações.

A reação do setor foi reveladora. Em seis semanas, a Perplexity lançou seu próprio Deep Research (14 de fevereiro) e abriu a API Sonar Deep Research aos desenvolvedores semanas depois. O Google, que havia lançado o Gemini Deep Research discretamente em dezembro de 2024, acelerou a distribuição e seguiu atualizando a espinha dorsal do produto. A Anthropic liberou a busca na web do Claude para todos em 7 de maio de 2025, empacotando o recurso Research na mesma janela daquela primavera.

Quatro laboratórios, uma categoria de produto, dois trimestres. Isso não acontece por acaso. 2024 foi o ano em que as janelas de contexto passaram dos 200 mil tokens, o uso de ferramentas ficou confiável e os loops agênticos pararam de falhar silenciosamente no meio do caminho. O deep research foi o primeiro aplicativo voltado ao consumidor que fez os três parecerem valer o pagamento. Ele está intimamente ligado à mudança mais ampla rumo aos protocolos de agentes que cobrimos em A web agêntica: por dentro das guerras do protocolo MCP.

Se você escreve, estuda, analisa mercados ou avalia produtos, já está em desvantagem se não usa uma dessas ferramentas. A questão é qual e quando.


O que "deep research" realmente faz

É fácil confundir deep research com busca em chat. Você digita uma pergunta, recebe uma resposta com links. A mecânica é diferente.

Uma busca em chat (como o ChatGPT comum com navegação) roda uma ou duas consultas na web e sintetiza os melhores resultados em segundos. Um agente de deep research faz algo mais próximo do que um analista júnior faz ao longo de uma tarde. Ele quebra a sua pergunta em subperguntas, roda dezenas ou centenas de buscas, lê páginas inteiras, segue citações, atualiza o próprio plano conforme aprende e produz um relatório estruturado com notas de rodapé.

Pergunte à busca em chat "quais são as principais críticas à curva de Phillips?" e você receberá um resumo de três parágrafos. Faça a mesma pergunta a um agente de deep research e receberá um relatório de 15 páginas cobrindo a hipótese da taxa natural de Friedman, a ruptura da estagflação nos anos 1970, as revisões das expectativas racionais, os debates sobre o achatamento pós-2008 e artigos recentes de 2023-2025, cada um com uma fonte clicável.

O custo disso é tempo. As execuções levam de minutos a uma hora, e o Google é o único fornecedor que publica um orçamento: a maioria das tarefas dentro de 20 minutos, com teto rígido de 60. E esse é justamente o ponto. Você coloca uma na fila, trabalha em outra coisa e volta para um relatório que levaria meio dia para montar manualmente. Para mais sobre como reestruturar hábitos de pesquisa em torno de agentes de IA, veja Como construir um fluxo de trabalho de pesquisa com IA em 2026.


Frente a frente: as 4 ferramentas de consumo comparadas

Aqui está a matriz, com o modelo por trás e os preços lidos diretamente nas páginas dos próprios fornecedores em setembro de 2026. Uma coluna mudou mais que qualquer outra desde a primeira versão deste guia: a do "modelo por trás", que hoje é um alvo móvel em três dos quatro produtos.

FerramentaModelo por trás (set. de 2026)Preço e acessoTempo de execução publicado
OpenAI Deep ResearchNão divulgado; "o modelo mais recente por padrão"Gratuito e Go (US$ 8/mês): Limitado; Plus (US$ 20/mês): Ampliado; Pro (a partir de US$ 100/mês): Máximo5-30 min (OpenAI, fev. de 2025)
Perplexity Deep ResearchClaude Opus, roteado dentro do Perplexity ComputerPro US$ 20/mês; Max US$ 200/mês2-4 min (Perplexity, fev. de 2025)
Gemini Deep ResearchGemini 3.1 ProAI Plus US$ 4,99/mês; AI Pro US$ 19,99/mês; AI Ultra a partir de US$ 99,99/mês20 min típico, teto de 60 min (API)
Claude ResearchNão divulgadoTodos os planos pagos: Pro US$ 20/mês, Max US$ 100 ou US$ 200/mês, Team, EnterpriseNão publicado

Essa tabela tem mais "não publicado" do que já teve, e esse é o estado honesto das coisas. Só o Google publica um orçamento de tempo rígido para um produto atual. O "5 a 30 minutos" da OpenAI, tão citado por aí, está na página de lançamento de fevereiro de 2025 e nunca foi reafirmado. A Perplexity publicou 2 a 4 minutos no mesmo lançamento e também não atualizou, então o "menos de 3 minutos" que este guia costumava imprimir era um número de fevereiro de 2025 descrevendo um produto que foi reconstruído duas vezes desde então. A Anthropic diz apenas que o Research entrega respostas "em minutos".

Os perfis em um parágrafo:

OpenAI Deep Research continua sendo o peso-pesado para perguntas ambíguas e abertas. Os relatórios são longos e o raciocínio é visivelmente mais profundo quando a pergunta não tem resposta limpa. Duas coisas mudaram em 2026. A página de preços parou de citar contagens de execução e agora diz Limitado, Ampliado e Máximo, então os números "5 grátis, 25 no Plus, 250 no Pro" que ainda circulam vêm de uma atualização de blog de abril de 2025, e não de algo que a OpenAI publique hoje por plano. E, em 10 de setembro de 2026, a OpenAI pausou novas assinaturas de seu plano Pro de US$ 200. Existem dois níveis de Pro: US$ 100 libera 5x o uso do Plus e US$ 200 libera 20x, e a pausa deixa os US$ 100 como o plano mais alto que um novo cliente pode comprar.

Perplexity Deep Research é aquele cujo motor foi trocado por baixo do capô. Ele nasceu rodando nos modelos Sonar da própria Perplexity. Desde fevereiro de 2026, o modo Advanced Deep Research roda no Claude Opus, com assinantes Max recebendo uma revisão mais nova do Opus do que os assinantes Pro, e, em 11 de junho de 2026, a Perplexity moveu o Deep Research para dentro do Perplexity Computer, que roteia subtarefas por mais de 20 modelos de fronteira. A Perplexity atribui o salto de 40,7% para 83,8% no BrowseComp a essa mudança de arquitetura, e não à troca de modelo. Se você ler um artigo chamando o Perplexity Deep Research de produto "Sonar", ele foi escrito antes de fevereiro de 2026. Sonar agora é o nome da linha de API, não do agente de consumo.

Gemini Deep Research tem os resultados publicados mais fortes entre os quatro grandes. O Google atualizou o agente para o Gemini 3.1 Pro em abril de 2026, dividiu-o em um nível padrão e um nível Max e expôs os dois por meio de uma API de verdade. Ele ainda puxa dados do seu Gmail, Drive e Docs ao lado da web, e mostra um plano de pesquisa visível que você pode editar antes de o agente rodar. O Google publica as cotas como multiplicadores em vez de contagens, o que ao menos diz o que um upgrade compra.

Claude Research é o mais paciente de todos, bom em sustentar fontes contraditórias lado a lado em vez de resolvê-las cedo demais. Duas correções valem ser feitas: o Research está disponível em todos os planos pagos do Claude (Pro, Max, Team e Enterprise), não apenas no Pro, e a linha da Anthropic avançou além do Sonnet 5 e do Opus 5 e agora inclui o Claude Fable 5.1, lançado em 1º de setembro de 2026. A Anthropic não diz qual modelo sustenta o Research nos aplicativos. O que ela documenta é que o Claude 4.6 e versões posteriores carregam o contexto completo de 1M de tokens pelo preço padrão, de modo que grandes conjuntos de fontes não são truncados nem sobretaxados.


Alternativas ao ChatGPT Deep Research: quem mais lança uma

"Alternativa ao ChatGPT deep research" é uma das formas mais comuns pelas quais as pessoas chegam a este tema, e a comparação de quatro produtos acima não responde a isso. Veja quem mais realmente lança um agente de pesquisa em setembro de 2026, e quem só aparenta ter um.

ConcorrenteProduto e APIPreço de entradaO fato que o distingue
xAI GrokModo multiagente; grok-4.20-multi-agent (beta)SuperGrok US$ 30/mêsNão publica pontuação de HLE nem de BrowseComp
Moonshot KimiDeep Research (Kimi-Researcher); sem endpoint para elePlus US$ 19/mêsPublica telemetria por execução que mais ninguém publica
ManusAgente autônomo, Wide Research; REST no formato de tarefasUS$ 20/mês (4.000 créditos)Não publica nenhum benchmark público nomeado
You.comProduto de consumo praticamente extinto; Research APIUS$ 12 por 1.000 (lite)Cinco níveis de esforço cobrindo uma faixa de preço de 100x
MistralSkill de Deep Research no Vibe; sem endpoint autônomoPro US$ 14,99/mêsFaixa paga mais barata fora dos quatro grandes
DeepSeekBusca na web no app; nada agêntico na APIGratuitoA API ignora todas as ferramentas que você passa

xAI Grok renomeou discretamente aquilo que todo mundo ainda procura. "DeepSearch" e "DeeperSearch" não aparecem mais em lugar nenhum da documentação para desenvolvedores da xAI. O que existe agora é um modelo multiagente, grok-4.20-multi-agent, ainda rotulado como beta, no qual reasoning.effort seleciona 4 agentes em low ou medium e 16 em high ou xhigh. A documentação diz claramente para usar 16 em deep research. O problema para quem quiser comparar qualidade: a xAI não publicou nenhuma pontuação de Humanity's Last Exam, BrowseComp ou GAIA para o Grok 4.6 subjacente, então não há nada a colocar na tabela usual de benchmarks. Ela reporta 81,6% no DeepSearchQA, onde perde tanto para o GPT-5.5 quanto para o Claude Opus.

O Kimi, da Moonshot, é o concorrente mais bem documentado e o que a maioria das pessoas fora da Ásia nunca experimentou. Seu modo Deep Research roda em um modelo interno, o Kimi-Researcher, e a Moonshot publica telemetria por tarefa que os laboratórios americanos não publicam: uma média de 23 passos de raciocínio, 74 palavras-chave de busca planejadas e 206 URLs encontradas por tarefa, das quais apenas os 3,2% melhores sobrevivem até o relatório. As execuções levam de 10 a 25 minutos e as faixas pagas começam em US$ 19/mês. A Moonshot oferece endpoints de busca e de fetch que você pode chamar, mas nada que exponha o próprio agente de Deep Research, então o produto de pesquisa é exclusivo do consumidor.

Manus é a história de negócios mais interessante e a mais fraca tecnicamente. A Meta a adquiriu em dezembro de 2025, a NDRC da China bloqueou o negócio em 27 de abril de 2026 e a Manus anunciou que havia retomado a operação independente em 1º de setembro de 2026. Seu modo Wide Research roda 20 subtarefas simultaneamente, embora você não consiga acioná-lo manualmente. Vale saber antes de citá-la: a Manus não publica nenhum benchmark público nomeado em lugar algum, apenas gráficos que ela mesma rotula como internos.

You.com deixou efetivamente o mercado de consumo. O ARI, seu agente de pesquisa, não aparece mais na página inicial, e não há assinatura de consumo na página de preços. O que sobrou é uma Research API genuinamente boa, com cinco níveis de esforço de lite a frontier, com preços de US$ 12 a US$ 1.200 por mil requisições. Uma diferença de 100x em um único endpoint é a ilustração mais clara de algo para o qual toda esta categoria convergiu, tema que a seção de APIs abaixo retoma.

Mistral mudou seu agente de pesquisa de lugar e renomeou o aplicativo em torno dele. O Le Chat virou Vibe em maio de 2026, e o Deep Research foi descontinuado na aba Chat; iniciar um agora redireciona você para a aba Work com a skill de Deep Research pré-selecionada. A US$ 14,99/mês, o Mistral Pro é a faixa paga mais barata fora dos quatro grandes, embora o AI Plus do Google, a US$ 4,99, custe menos, e, para equipes europeias com exigências de residência de dados, a Mistral costuma ser a única opção que passa no crivo de compras.

DeepSeek é o resultado negativo útil. Apesar da presença constante em listas de "melhores ferramentas de deep research", a DeepSeek não lança nenhum produto de deep research. Seu aplicativo tem busca na web e um modo de pensamento, mas a documentação da API marca web_search e todas as demais ferramentas como ignoradas, então não há nada agêntico sobre o que construir. É um excelente modelo de raciocínio barato que você pode apontar para textos que você mesmo fornece, e não é um agente de pesquisa. O mesmo vale para Qoob e Arc Search, ambos aparecem em consultas de comparação e ambos são aplicativos de busca com resposta rápida, não agentes que planejam e navegam por meia hora.

As opções de código aberto, e um aviso

Se você quer hospedar por conta própria, a resposta honesta de 2026 é que manutenção e desempenho em benchmarks agora vivem em repositórios diferentes.

Ativamente mantidos e bons para começar: o GPT Researcher (Apache-2.0, cerca de 29.500 estrelas, com releases até agosto de 2026) é aquele que você pode clonar e rodar hoje sem antes substituir um nome de modelo aposentado na configuração. O DeerFlow, da ByteDance, é de longe o maior, com cerca de 82.000 estrelas, e o mais barato de testar, já que roda sem nenhuma chave de API de busca usando DuckDuckGo e um leitor sem chave, embora a reescrita 2.0 o tenha reposicionado como um arcabouço geral de agentes, com deep research sendo apenas uma skill entre várias. O Tongyi DeepResearch, da Alibaba, é a opção crível de pesos abertos sob Apache-2.0, mas seu repositório está em silêncio desde fevereiro de 2026.

Agora o aviso, porque dois projetos que lideravam todas as listas de recomendação de 2025 estão mortos e não parecem estar. O open_deep_research da LangChain foi arquivado em 21 de agosto de 2026. O GitHub exibe o aviso de arquivamento, mas o próprio README não traz nota alguma, então o projeto parece vivo para quem chega vindo de um tutorial. O STORM, de Stanford, teve 146 pull requests abertos em 2026 e mesclou exatamente zero deles; seu último commit foi em setembro de 2025, e o guia de início rápido documentado depende da Bing Search API, aposentada em agosto de 2025. Os artigos do STORM continuam valendo a leitura. O software não deveria ser seu ponto de partida.

Entre os projetos mais conhecidos, o padrão é que os agentes de pesos abertos que registraram pontuações competitivas em benchmarks ficaram em silêncio, enquanto os que ainda entregam código quase não publicam benchmarks. Escolha pela manutenção e depois meça você mesmo.

Se a sua pesquisa se limita a documentos que você já possui, e não à web aberta, essa é outra categoria de ferramentas, com outros vencedores, que cobrimos em NotebookLM em 2026.


APIs de deep research: o que você realmente pode chamar

Esta é a pergunta que os artigos de comparação insistem em pular, e a que os desenvolvedores insistem em buscar: quais agentes de deep research você pode chamar a partir do seu próprio código, quanto custam e quão boas são as citações? A maior parte disso mudou ao longo de 2026, e uma das maiores mudanças acontece em 27 de setembro de 2026.

FornecedorDeep research chamável?O que você chamaPreço
Google GeminiSim, pronto para usodeep-research-preview-04-2026 ou deep-research-max-preview-04-2026 na Interactions API~US$ 1 a US$ 3 por tarefa; Max ~US$ 3 a US$ 7 por tarefa (tarifas de prévia)
PerplexitySim, mas em migraçãoAgent API POST /v1/agent com presets de esforço; o sonar-deep-research encerra o suporte em 27 de set. de 2026Sonar legado: US$ 2/1M de entrada, US$ 8/1M de saída, mais US$ 2/1M de tokens de citação e US$ 3/1M de tokens de raciocínio, mais US$ 5 por 1.000 buscas
OpenAINão como modelo dedicadoModelo de ponta na Responses API com web_search e esforço de raciocínio alto, ou a nova Agents APITarifas de token do modelo mais web_search a US$ 10 por 1.000 chamadas
Anthropic ClaudeSem API com marca de pesquisaFerramenta web_search da Messages API, ou Claude Managed Agents (beta)US$ 10 por 1.000 buscas mais tokens; os Managed Agents somam US$ 0,08 por hora de sessão
You.comSimResearch API, cinco níveis de esforçoDe US$ 12 (lite) a US$ 1.200 (frontier) por 1.000
ExaMonte o seu próprioEndpoints Search, Deep Search e AgentSearch US$ 7 por 1.000; Deep Search de US$ 12 a US$ 15 por 1.000; Agent de US$ 0,012 a US$ 1,00 por requisição com esforço fixo
TavilyMonte o seu próprioEndpoints Search e Research1.000 créditos gratuitos/mês; pagamento por uso US$ 0,008/crédito; o Research consome de 4 a 250 créditos

Quatro coisas se destacam.

O Google é agora a opção pronta para uso entre os laboratórios de fronteira, e isso é uma reviravolta. Durante a maior parte da vida desta categoria, o Gemini Deep Research era um recurso de consumo que você não podia chamar programaticamente. Hoje é o mais limpo dos quatro grandes: você chama um modelo de deep research na Interactions API, com background=true obrigatório em vez de opcional, e o Google publica tanto uma faixa estimada de preço por tarefa quanto um orçamento de tempo real. O acesso corporativo passa pela Gemini Enterprise Agent Platform, que substituiu o Vertex AI como nome de produto para isso em 2026, então ignore artigos antigos que apontam para o Vertex.

A API pronta para uso da Perplexity está sendo aposentada neste exato momento. O sonar-deep-research foi, por dois anos, a resposta para "qual API de deep research eu posso simplesmente chamar", e a Perplexity anunciou em julho de 2026 que os endpoints Sonar Chat Completions se aposentam em 27 de setembro de 2026. A substituta é a Agent API, na qual você faz POST /v1/agent e escolhe um preset de esforço. A Perplexity mapeia o antigo modelo de deep research para high e aponta o xhigh para os melhores resultados. Todos os preços do Sonar na tabela acima valem apenas até 27 de setembro, então, se você está orçando um projeto, orce pela Agent API. Note também que o ciclo de vida mudou de formato: o endpoint assíncrono legado usava status em maiúsculas como IN_PROGRESS, enquanto a Agent API usa outro conjunto em minúsculas, o que significa que um loop de polling escrito para um falha silenciosamente com o outro.

A OpenAI moveu o deep research para dentro da linha de modelos e depois para um agente gerenciado. Os modelos dedicados o3-deep-research e o4-mini-deep-research foram depreciados em abril de 2026 e desligados em 23 de julho de 2026. O caminho de substituição é um modelo de ponta atual na Responses API com a ferramenta web_search em modo de segundo plano. Desde 10 de setembro de 2026, existe também uma Agents API gerenciada em beta pública, na qual a OpenAI executa para você a orquestração da sessão, a compactação de contexto e a recuperação. Uma armadilha que vale sinalizar: a própria página de guia de deep research da OpenAI e a página do modelo o3-deep-research estão desatualizadas e ainda apresentam esses modelos como disponíveis, contradizendo a página de depreciações. Confie na página de depreciações.

A Anthropic não obriga mais você a construir tudo sozinho. O enquadramento antigo, que este guia costumava imprimir, era que o Claude não tem API de pesquisa e você monta o próprio loop. Isso está desatualizado. O Claude Managed Agents está em beta pública desde abril de 2026: sessões de longa duração, server-sent events, capacidade de direcionar e interromper, implantações agendadas por cron e busca na web, fetch de páginas e MCP embutidos, cobrados pelo custo de token mais US$ 0,08 por hora de sessão. O exemplo prático da própria Anthropic coloca uma sessão de uma hora com o Opus bem abaixo de um dólar, e o web fetch, ao contrário da busca na web, não custa nada. Ainda não existe um modelo chamado "deep research", mas o arcabouço existe.

Para a pergunta específica "qual é a melhor API para relatórios de pesquisa com citações", três abordagens funcionam. Google e Perplexity entregam citações prontas. You.com, Exa e Tavily entregam resultados com fontes atribuídas que você alimenta no seu próprio modelo, que é o padrão sobre o qual a maioria dos recursos de pesquisa em produção é de fato construída, porque você controla custo e formatação de citações. E qualquer modelo com uma ferramenta de busca na web pode citar conforme avança, se você pedir isso no prompt. Equipes que precisam de trilhas de auditoria tendem a preferir o caminho de montar o próprio, porque cada afirmação remonta a uma URL que você buscou, e não à memória de um modelo. Para entender por que a qualidade de ancoragem e recuperação importa mais do que o tamanho bruto do contexto, veja Context Rot: por que o RAG ainda vence uma janela de contexto gigante.

Duas notas de propriedade para quem for escolher um fornecedor do qual depender. A Tavily foi adquirida pela provedora de nuvem de IA Nebius em fevereiro de 2026, então o enquadramento de "API de busca independente" precisa de um asterisco. E a Exa removeu seu endpoint /research em 1º de abril de 2026, dobrando-o dentro do /search com um tipo deep-reasoning, o que significa que qualquer tutorial mandando você chamar exa-research está quebrado.


Como automatizar deep research com uma API

Chamar uma dessas APIs não é como chamar uma conclusão de chat. As execuções levam de minutos a uma hora, então todo fornecedor obriga você a lidar com assincronia, e todos fazem isso de um jeito diferente. Se você está conectando um agente de pesquisa a um produto ou a um pipeline, é esta a parte que custa um dia de trabalho.

Presuma execução em segundo plano, não uma chamada bloqueante. O Google exige isso de forma explícita: os modelos de deep research só funcionam com background=true, e você consulta a interação por polling ou retoma um stream. A OpenAI dá suporte ao modo de segundo plano na Responses API com polling, streaming retomável e webhooks no padrão Standard Webhooks. A Perplexity documenta polling e nenhum webhook. A xAI é o ponto fora da curva. O background aparece no schema dela, mas está marcado como sem suporte, então o caminho assíncrono real ali é a API de batch, que retorna em até 24 horas em vez de minutos.

Orce por tarefa, não por token, e verifique quanto custa a busca. As contas das APIs de pesquisa vêm das sobretaxas de busca. Elas são cobradas por chamada, não por token. A OpenAI cobra US$ 10 por 1.000 chamadas de busca na web, a Anthropic US$ 10 por 1.000 buscas, a Perplexity US$ 5 por 1.000 na linha Sonar de deep research em processo de aposentadoria, e a xAI US$ 5 por 1.000 chamadas de ferramenta. O Google dá aos projetos de faixa paga 5.000 buscas de ancoragem gratuitas por mês em seus modelos Gemini 3.x e depois cobra US$ 14 por 1.000, e as tarefas de Deep Research consomem desse mesmo bolo cerca de 80 a 160 buscas cada, de modo que aproximadamente 60 tarefas o esgotam. A resposta de exemplo da própria Perplexity é o caso prático mais útil já publicado: uma única chamada de deep research custando US$ 0,816, da qual 71% foram tokens de raciocínio e apenas 11% foram saída. O relatório que você lê é a parte mais barata da fatura.

Espere níveis de esforço, porque eles substituíram os IDs de modelo. Esta é a mudança estrutural escondida por trás de cada alteração individual acima. A OpenAI aposentou seus modelos de pesquisa em favor de um modelo de ponta mais esforço de raciocínio. A Perplexity está aposentando o Sonar em favor de presets da Agent API. O Google entrega variantes padrão e Max. A xAI obriga você a escolher 4 ou 16 agentes via reasoning.effort. Exa, You.com e Tavily precificam no mesmo formato de escada, de um piso barato a um teto por requisição. Se você está desenhando em torno dessas APIs, desenhe para um seletor que possa ser girado a cada requisição, não para um nome de modelo que você fixa no código.

A etapa de esclarecimento fica por sua conta. A OpenAI diz isso explicitamente: o deep research via API não inclui nenhuma etapa de esclarecimento ou reescrita de prompt, e o modelo espera um prompt totalmente formado de antemão. Os aplicativos de consumo fazem perguntas de acompanhamento antes de começar; as APIs não. A correção padrão, que o próprio cookbook da OpenAI demonstra, é um modelo pequeno e barato que faz a triagem da solicitação e a reescreve como instrução de pesquisa antes de o agente caro sequer rodar.

Para checagem de fatos especificamente, a verificação é uma etapa do pipeline, e não um prompt. Um padrão se consolidou tanto nos cookbooks publicados pela OpenAI quanto nos da Anthropic: decomponha a saída em afirmações autônomas, verifique cada afirmação em seu próprio contexto limpo e depois coloque uma passada cética separada para contestar os veredictos. A versão da Anthropic argumenta isso de forma direta, observando que "verifique duas vezes suas conclusões" também é apenas uma instrução e, sob pressão de contexto, acaba sendo pulada. Se você está construindo o verificador de fatos em tempo real que as pessoas tanto procuram, essa decomposição é a arquitetura, e a API de busca por baixo dela importa menos do que a estrutura ao redor.


Benchmarks de deep research: o que os rankings mostram

Três números são os mais citados: Humanity's Last Exam, BrowseComp e SimpleQA. São úteis, são amplamente mal citados e carregam dois problemas estruturais que quase ninguém menciona.

Comece pelo primeiro. Nenhum ranking independente classifica os agentes de pesquisa lançados uns contra os outros com ferramentas. A própria avaliação da Scale roda uma variante sem ferramentas, os quadros dos fornecedores são autodeclarados e o único arcabouço sério de terceiros avalia configurações de modelo mais busca que você não pode comprar, em vez de produtos que você pode. Quando você vê o agente de um fornecedor pontuando na casa dos cinquenta ou sessenta "com ferramentas", você está lendo o arcabouço, o orçamento de busca e o juiz daquele fornecedor. Isso não torna os números falsos. Torna-os incomparáveis.

O segundo problema é a rotulagem de níveis. Este guia já imprimiu 54,6% no HLE e 85,9% no BrowseComp como "Gemini Deep Research". Ambos os números pertencem ao Deep Research Max, o nível de esforço mais alto do Google, contra 50,4% e 61,9% do nível padrão. Isso é uma diferença de 24 pontos no BrowseComp entre dois produtos vendidos sob um só nome, e os artigos de comparação misturam os dois o tempo todo. Vale saber que o Google publicou esses números em um gráfico no anúncio de abril de 2026, e não como texto que se possa citar, o que é parte do motivo de eles chegarem embaralhados lá adiante.

Agente ou configuraçãoHLE (com ferramentas)Reportado porQuando
Perplexity Sonar Deep Research21,1%Fornecedorfev. de 2025
OpenAI Deep Research (o3)26,6%Fornecedorfev. de 2025
Gemini Deep Research (3 Pro)46,4%Fornecedordez. de 2025
Gemini Deep Research (3.1 Pro)50,4%Fornecedorabr. de 2026
Gemini Deep Research Max (3.1 Pro)54,6%Fornecedorabr. de 2026
Kimi K3 (o modelo, não o agente Deep Research)56,0%Fornecedorjul. de 2026
Claude Opus 5 + busca da Perplexity, 25 turnos77,4%Terceiroago. de 2026

Essa última linha é a que merece ser digerida com calma. Ela vem do arcabouço de benchmark da própria OpenRouter, que roda endpoints de produção em vez de coletar afirmações de fornecedores, e publica custo e latência junto com a precisão: US$ 0,46 por pergunta, 83 segundos, em uma amostra de 84 perguntas. Não é um produto que você possa comprar. É um modelo mais um provedor de busca mais um orçamento de turnos, montado por um terceiro, e supera o número autodeclarado de todos os agentes lançados. Uma ressalva sobre quem está medindo: a OpenRouter revende a maioria dos modelos e mecanismos de busca que avalia.

A descoberta mais útil de toda a categoria vem desse mesmo arcabouço. No BrowseComp, uma configuração marcou 35,8% com limite de 1 turno de busca e 89,0% com limite de 25 turnos, na mesma série de execuções. Mesmo modelo, mesmo benchmark. A estrutura ao redor, especificamente quantas buscas ele tem permissão para fazer, moveu o resultado em 53 pontos. É por isso que um modelo de navegação simples pontua abaixo de 2% no BrowseComp enquanto um agente construído sobre ele pontua na casa dos oitenta, e é por isso que "qual modelo é mais inteligente" é quase a pergunta errada. Compre orçamento de busca.

A curva de custo também é mais plana do que o marketing sugere. Nas mesmas execuções, a melhor configuração no BrowseComp custou US$ 0,99 por pergunta, enquanto um modelo barato combinado com o mesmo provedor de busca atingiu 77,0% por US$ 0,076, cerca de 13 vezes mais barato por 12 pontos a menos de precisão. Para a maior parte do trabalho real, essa troca é obviamente correta.

Os benchmarks feitos para agentes de pesquisa

HLE e BrowseComp medem se um agente consegue encontrar um fato difícil. Eles não medem se o relatório é bom. Três benchmarks mais novos medem isso, e são bem menos lisonjeiros.

O ResearchQA, um esforço acadêmico independente abrangendo 21.000 consultas e 160.000 itens de rubrica em 75 áreas, validado por 31 anotadores com doutorado em oito delas, concluiu que nenhum dos modelos de linguagem comuns nem dos sistemas de recuperação testados alcançou 70% de cobertura de rubrica. Só os agentes de deep research feitos para isso foram além, e o melhor deles parou em 75,3%. Mais revelador ainda: esse sistema de topo atendeu integralmente a menos de 11% dos itens de rubrica de citação e a cerca de metade dos itens de limitação e de comparação. Os agentes encontram fontes. Eles são muito piores em declarar o que as fontes não estabelecem.

O ResearchRubrics, construído sobre mais de 2.800 horas de trabalho especializado, colocou tanto o Gemini Deep Research quanto o OpenAI Deep Research abaixo de 68% de conformidade média com as rubricas. O DeepResearch Bench II, com 9.430 rubricas binárias destiladas de artigos investigativos de especialistas, reportou em janeiro de 2026 que mesmo os modelos mais fortes satisfaziam menos da metade delas. Desde então, seu ranking ao vivo subiu acima dessa marca, o que é a trajetória de sempre.

Mais duas ressalvas antes de usar qualquer um desses números para escolher uma ferramenta. Qual modelo avalia a rubrica move as pontuações em mais de dez pontos e pode reordenar os dois primeiros colocados, então qualquer tabela que misture juízes está falando de juízes, não de agentes. E agentes navegando na web ao vivo podem recuperar as próprias respostas de um benchmark: um estudo de 2026 mediu até 4% de inflação por esse motivo. A metodologia de avaliação publicada pelo Google agora bloqueia sites como o Hugging Face durante os testes, o que diz que o problema é real o suficiente para exigir uma solução de engenharia.

O SimpleQA merece hoje uma nota de rodapé, não uma manchete. Os 93,9% da Perplexity são genuínos, mas datam de fevereiro de 2025 e descrevem um produto baseado em Sonar que, como visto acima, não existe mais nessa forma.

A descoberta independente mais duradoura também é a mais antiga. O Tow Center, da Columbia Journalism Review, testou oito mecanismos de busca com IA em 1.600 consultas e constatou que eles falharam em recuperar a informação correta em mais de 60% das vezes, com taxas de erro variando de 37% a 94% conforme o mecanismo. Esse estudo é de março de 2025 e o Tow Center não publicou uma repetição naquela escala, o que é, por si só, um comentário sobre como a avaliação independente continua rala.

A leitura honesta: os benchmarks classificam ferramentas de forma confiável no extremo superior de dificuldade e de forma ruim abaixo disso. Rode o mesmo prompt real em duas ferramentas na faixa paga mais barata de cada uma e compare. Benchmarks são sugestivos. Seu próprio teste é decisivo. Para um argumento mais longo sobre por que a obsessão por benchmarks engana, veja A armadilha do pensamento com IA.


Verificação da realidade dos planos gratuitos

Todas as páginas de marketing destacam o acesso gratuito. Veja o que "gratuito" realmente significa em setembro de 2026, e a resposta honesta começa com uma admissão: os números ficaram mais difíceis de achar, não melhores.

A OpenAI é a única com uma cota gratuita, e ela parou de dizer qual é o tamanho. Os números "5 grátis por mês, 25 no Plus, 250 no Pro" que ainda circulam vêm de uma atualização de blog de abril de 2025. A página de preços atual diz Limitado no plano gratuito e na faixa Go de US$ 8/mês, Ampliado no Plus e Máximo no Pro, e a central de ajuda confirma um contador dentro do produto que reinicia a cada 30 dias sem dizer de que valor ele parte. O único número atual publicado está na tabela de tarifas para empresas, onde uma tarefa de deep research custa 50 créditos. Se você precisa de uma cota previsível, este é o fornecedor menos previsível.

A Perplexity moveu o Deep Research para trás do paywall. Contas gratuitas recebem busca. O Deep Research é um recurso Pro e, como agora roda dentro do Perplexity Computer, é exclusivo de Pro e Max. Este guia costumava imprimir "5 por dia" para a faixa gratuita, o que era um fato de 2025 sobre um produto que foi reconstruído desde então.

A faixa barata do Gemini é a história de verdade, não uma faixa gratuita. O Google publica as cotas dos planos como multiplicadores em vez de contagens, com limites que se renovam a cada cinco horas, e suas próprias páginas de planos colocam o Deep Research nas faixas pagas. O que faz do Google a escolha de melhor custo-benefício não é uma cota gratuita, é o fato de o AI Plus custar US$ 4,99/mês, bem abaixo do preço de entrada de todos os outros.

O Claude não tem Research gratuito, mas também não é exclusivo do Pro. O Research está indisponível no plano gratuito e disponível em todos os planos pagos: Pro a US$ 20, Max a US$ 100 ou US$ 200, além de Team e Enterprise. Versões anteriores deste guia o descreviam como exclusivo do Pro, o que subestimava quem tem acesso.

A leitura prática: já não existe uma ferramenta de deep research em que você possa se apoiar para trabalho real sem pagar. Se você vai pagar por apenas uma, o AI Plus do Gemini a US$ 4,99 é o caminho mais barato para um agente líder em benchmarks, e o Perplexity Pro a US$ 20 dá o melhor volume pelo preço. Se você quer a saída mais profunda em perguntas ambíguas, o ChatGPT Plus a US$ 20 compra o OpenAI Deep Research mais todo o resto do pacote. O Claude Pro faz mais sentido se você já usa o Claude para ler e escrever e quer uma assinatura só.


Qual ferramenta para qual trabalho

Depois de rodar centenas de consultas em todas elas, padrões claros aparecem. Veja como eu direcionaria o trabalho hoje.

Revisão de literatura acadêmica. Claude Research. O contexto de 1M de tokens importa quando o agente precisa segurar mais de 20 artigos ao mesmo tempo, e o Claude é nitidamente melhor em distinguir afirmações superficialmente parecidas. As execuções demoram mais, mas revisões de literatura não são urgentes.

Dimensionamento de mercado e inteligência competitiva. OpenAI Deep Research. A profundidade de raciocínio em questões estratégicas ambíguas aparece com clareza aqui. É aquele em que mais confio para prompts do tipo "me ajude a entender este setor".

Recuperação factual mais difícil. Gemini Deep Research Max. Se os líderes de benchmark dizem alguma coisa, é que a faixa de esforço alto do Google é o agente lançado mais forte em encontrar fatos obscuros e de múltiplos saltos. Use a faixa Max deliberadamente, já que a faixa padrão é um produto significativamente diferente.

Briefings rápidos antes de uma reunião. Perplexity. Os relatórios são mais curtos e mais enciclopédicos, que é o que você quer quando precisa de orientação em vez de um ensaio.

Pesquisa envolvendo seus próprios documentos. Gemini Deep Research. A integração com o Workspace é o fosso competitivo. Se metade do seu material de origem está no Drive, no Gmail e em notas antigas de reunião, nada mais se compara.

Integrações de desenvolvedor e execuções em massa. A Deep Research API do Google é agora a escolha pronta para uso, já que a linha Sonar da Perplexity se aposenta em 27 de setembro de 2026 e a OpenAI não tem modelo de pesquisa dedicado. Se você quer controle sobre formatação de citações e custo, monte o loop você mesmo sobre a Exa, a Tavily ou a Research API da You.com.

Pesquisa barata e de alto volume dentro de um produto. Um modelo de faixa intermediária combinado com um bom provedor de busca e um orçamento generoso de turnos. A evidência dos benchmarks acima diz que isso entrega a maior parte da precisão por uma fração do custo, e é a configuração que a maioria dos recursos em produção de fato lança.

Sintetizar evidências contraditórias. Claude. Quando as fontes discordam, o Claude é o mais disposto a expor a discordância em vez de escolher um lado prematuramente.

Um padrão que pode surpreender as pessoas: nenhuma ferramenta domina sozinha. Eu rodo o mesmo prompt em dois agentes para trabalho de alto risco. O custo é de cerca de US$ 40/mês por duas assinaturas, e o resultado é notavelmente melhor do que o de qualquer uma delas isolada. Se você está decidindo como a IA se encaixa na sua rotina de estudo ou trabalho de forma mais ampla, Modos de estudo com IA comparados cobre a questão vizinha.


A peça que falta: transformar relatórios de pesquisa em conhecimento utilizável

Eis o que quase nenhum artigo de comparação menciona. O relatório que o agente produz é matéria-prima, e a pesquisa não termina até você tê-lo lido direito.

Uma saída de 20 páginas do Claude Research ou um relatório de 15 páginas do OpenAI Deep Research é o começo do trabalho, não o fim. Leia uma vez, passe os olhos na conclusão, feche a aba, e você pagou a um agente para resumir algo que você não aprendeu de fato. Um estudo de 2025 do MIT Media Lab (acompanhado em nossa análise sobre o impacto da IA no aprendizado) mediu a atividade de EEG enquanto pessoas escreviam redações com e sem o ChatGPT, e encontrou engajamento cognitivo marcadamente menor no grupo assistido. Era um preprint pequeno sobre escrita, e não sobre leitura, mas a direção que ele aponta é a que todo usuário intenso de IA reconhece.

A solução é o que os pesquisadores fazem há séculos: anotar. Destacar as afirmações que importam. Sinalizar as fontes que você quer verificar. Conectar insights entre relatórios.

É aqui que o marcador de textos web do Glasp se encaixa no fluxo de trabalho. Rode sua pesquisa na OpenAI, Perplexity, Gemini ou Claude. Cole o relatório em uma página legível. Destaque diretamente no navegador enquanto lê. Seus destaques sincronizam com sua biblioteca do Glasp, pesquisável e organizada, ao lado de tudo o mais que você leu naquele mês.

Alguns fluxos de trabalho específicos que funcionam:

Destaque e depois reconsulte. Leia o relatório e destaque as 10 a 15 afirmações que mais importam. Cole esses destaques de volta no mesmo agente com "aprofunde nestes pontos específicos". Iterativo em vez de resposta única.

Empilhe relatórios por tema. Quando você pesquisa o mesmo tema em duas ferramentas (digamos, OpenAI e Claude), destacar os dois relatórios no Glasp permite ver onde eles convergem e divergem. As discordâncias costumam ser as partes mais interessantes.

Use o YouTube junto com o texto. Quando as melhores fontes são podcasts ou palestras, o YouTube Summary entrega resumos em nível de transcrição com marcações de tempo. Combinar um relatório de deep research em texto com 3 ou 4 palestras anotadas do YouTube cobre um tema de forma mais completa do que qualquer um dos dois sozinho.

Converse com seus destaques. O chat com IA do Glasp consegue responder perguntas usando suas anotações como fonte. É a diferença entre "o que o agente disse sobre X?" e "o que eu de fato concluí sobre X?".

Publique o que você aprendeu. A comunidade do Glasp está cheia de outras pessoas pesquisando temas parecidos. Compartilhar relatórios destacados é um mecanismo que obriga a terminar a pesquisa, em vez de apenas enfileirar mais. Para um guia passo a passo, veja Como anotar artigos do jeito certo.

Um relatório que você lê uma vez é um comprovante, não conhecimento. O passo de destacar e anotar é o que converte a saída do agente em algo que você realmente sabe.


Perguntas frequentes

Qual ferramenta de deep research é a mais precisa?

Entre os quatro grandes, o Gemini Deep Research Max, do Google, lidera com 54,6% no Humanity's Last Exam (Google, abril de 2026). Cuidado com esse nome: a faixa padrão do Deep Research marcou 50,4% no mesmo teste, e a maioria dos artigos de comparação cita o número do Max sob o nome simples do produto. O Kimi K3, da Moonshot, reivindica um número ainda maior, de 56,0%. Todos esses são autodeclarações de fornecedores e, em testes de terceiros, uma configuração de modelo mais busca que ninguém vende superou todos os agentes lançados. No uso prático, as diferenças de precisão entre as melhores ferramentas são menores do que os rankings sugerem.

Qual é a melhor alternativa ao ChatGPT Deep Research?

Para a maioria das pessoas, o Gemini Deep Research, que tem os melhores resultados publicados em benchmarks e a entrada paga mais barata a US$ 4,99/mês, ou a Perplexity, que é mais ampla e mais rápida. Se você quer algo fora dos quatro grandes: o Kimi, da Moonshot, tem um modo Deep Research bem documentado, o da Mistral é o mais barato entre os concorrentes a US$ 14,99/mês, e o Grok, da xAI, oferece um modo multiagente. Se você quer hospedar por conta própria, o GPT Researcher e o DeerFlow, da ByteDance, são as opções de código aberto ativamente mantidas. Evite o open_deep_research da LangChain, arquivado em agosto de 2026, e o STORM, de Stanford, que não mescla um pull request há mais de um ano.

Qual é a melhor API de deep research?

Os modelos de Deep Research do Google na Interactions API, para a maioria das equipes. É a única API de pesquisa pronta para uso de um laboratório de fronteira que não está sendo aposentada, publica uma estimativa de preço por tarefa de aproximadamente US$ 1 a US$ 3 (ou US$ 3 a US$ 7 no Max) e documenta um orçamento de tempo real. A Agent API da Perplexity é o destino natural se você já usa o Sonar, já que o sonar-deep-research encerra o suporte em 27 de setembro de 2026. Se você quer controle sobre formatação de citações e custo, monte o loop você mesmo sobre a Exa, a Tavily ou a You.com em vez de comprar um relatório pronto.

Qual é a API de deep research mais rápida?

O Google é o mais rápido a documentar: a maioria das tarefas de Deep Research termina em 20 minutos, com teto de 60. Mais ninguém publica um número atual de latência, o que já é a resposta. A OpenAI diz apenas "dezenas de minutos", e os 2 a 4 minutos da Perplexity datam do lançamento de fevereiro de 2025. Se você precisa de velocidade, a alavanca é o esforço, não o fornecedor: todas essas APIs agora expõem um seletor de faixa, e as faixas baixas retornam em segundos ou poucos minutos. Para resultados brutos com fontes em segundos, que alimentem seu próprio modelo, os níveis de esforço mais baixos da Exa, da Tavily e da You.com são o caminho rápido.

Quanto tempo levam as execuções de deep research?

Usando apenas números que os fornecedores publicam: o Google diz que a maioria das tarefas termina em 20 minutos e limita as execuções a 60. A Moonshot diz que o Kimi leva de 10 a 25 minutos. A página de lançamento da OpenAI ainda diz 5 a 30 minutos, frase que não é revisada desde fevereiro de 2025, e os 2 a 4 minutos da Perplexity vêm do mesmo mês. A Anthropic diz apenas que as respostas do Research chegam "em minutos". Trate os números mais antigos como históricos, porque os três produtos foram reconstruídos desde então.

Posso usar ferramentas de deep research via API?

Sim, e as opções mudaram substancialmente em 2026. Os modelos de Deep Research do Google na Interactions API são a opção pronta para uso, com preço de aproximadamente US$ 1 a US$ 3 por tarefa e de US$ 3 a US$ 7 na faixa Max. O sonar-deep-research da Perplexity era o favorito dos desenvolvedores, mas encerra o suporte em 27 de setembro de 2026, substituído pelos presets de esforço da Agent API. A OpenAI aposentou seus modelos dedicados o3-deep-research e o4-mini-deep-research em 23 de julho de 2026, então agora você roda um modelo de ponta na Responses API com a ferramenta de busca na web, ou usa a Agents API, em beta pública desde setembro de 2026. A Anthropic não tem API com marca de pesquisa, mas oferece o Claude Managed Agents em beta, cobrado por tokens mais US$ 0,08 por hora de sessão. Exa, Tavily e You.com são as opções populares de montar o seu próprio.

Qual API de deep research tem as melhores citações?

Google e Perplexity retornam relatórios totalmente citados prontos para uso. Para sistemas em produção que precisam rastrear cada afirmação até uma URL, as equipes costumam construir sobre a Exa, a Tavily ou a You.com, que retornam resultados com fontes atribuídas que você alimenta no seu próprio modelo, de modo que você controla a formatação e consegue mostrar uma trilha de auditoria. Qualquer modelo com uma ferramenta de busca na web pode citar em linha se você pedir no prompt. Tenha em mente a pesquisa independente sobre isso: o melhor sistema avaliado atendeu integralmente a menos de 11% dos itens de rubrica de citação, então ter citações não é o mesmo que ter citações suficientes.

Existe alguma ferramenta de deep research gratuita?

Quase não, e piorou em 2026. A OpenAI é a única das quatro que ainda dá às contas gratuitas uma cota de deep research, descrita como "Limitado", sem contagem publicada. A Perplexity moveu o Deep Research para trás do Pro, o Claude nunca o ofereceu de graça e o Google o coloca nos planos pagos. Para trabalho regular, os pontos de entrada realistas são o Gemini AI Plus a US$ 4,99 ou um plano de US$ 20 de qualquer um dos três grandes. Se você quer algo genuinamente gratuito e não se importa em rodar por conta própria, os agentes de código aberto cobertos acima são a resposta honesta.

Como evito alucinações em relatórios de deep research?

Três táticas práticas. Primeira: clique em pelo menos as três a cinco fontes citadas no topo e confirme que a afirmação está mesmo na fonte, já que citar erroneamente uma fonte real é muito mais comum do que inventar uma fonte falsa. Segunda: rode o mesmo prompt em uma segunda ferramenta; as discordâncias costumam indicar onde uma delas errou. Terceira: se você está embutindo isso em software, faça da verificação uma etapa separada do pipeline em vez de uma linha no seu prompt: extraia cada afirmação, verifique-a em um contexto limpo e depois coloque uma passada cética para contestar os veredictos. Esse é o padrão para o qual os cookbooks publicados pela OpenAI e pela Anthropic convergiram.

As ferramentas de deep research conseguem ler meus documentos privados?

O Gemini Deep Research tem a integração mais profunda, com acesso nativo ao seu Gmail, Drive e Docs mediante permissão. O Claude oferece conectores para o Google Workspace. O OpenAI Deep Research consegue ler arquivos que você envia durante uma sessão, mas não se integra diretamente a armazenamento em nuvem. A Perplexity trabalha principalmente contra a web. Se o seu material de origem está majoritariamente no Google Workspace, o Gemini é a escolha óbvia.

Qual é a melhor forma de salvar e reutilizar relatórios de deep research?

Exporte o relatório como PDF ou Markdown, abra-o em uma visualização legível e destaque-o como faria com qualquer artigo longo. O Glasp foi construído exatamente para esse fluxo de trabalho: os destaques sincronizam com uma biblioteca que você pode pesquisar, conectar a outros destaques e revisitar. Sem uma etapa de destaque, a maioria dos relatórios de deep research é lida uma vez e esquecida. Isso se conecta ao que os educadores chamam de efeito de geração: informação que você processa ativamente é retida muito melhor do que informação que você recebe passivamente.


Conclusão: a pilha de pesquisa, não a ferramenta de pesquisa

Dezenove meses após o lançamento da OpenAI, a categoria ficou mais clara e então começou a se reorganizar. Agentes de deep research não são um mercado em que o vencedor leva tudo. São uma mistura na qual a resposta certa depende do que você está pesquisando, de quanto tempo você tem, de onde seu material de origem está e de se você está clicando em um botão ou chamando uma API.

Se eu tivesse que escolher um para a maioria dos trabalhadores do conhecimento agora, seria o Gemini: os melhores resultados publicados em benchmarks, a entrada paga mais barata a US$ 4,99 e a única API de pesquisa de laboratório de fronteira que não está com os dias contados. Para trabalho mais pesado ou mais ambíguo, combine-o com o OpenAI Deep Research ou o Claude Research. Desenvolvedores migrando do Sonar deveriam olhar a Agent API da Perplexity antes de 27 de setembro.

A mudança mais profunda é estrutural. O modelo dedicado de deep research está a caminho da saída em todos os laboratórios: a OpenAI aposentou seus modelos de pesquisa, a Perplexity está aposentando o Sonar, o Google entrega um agente em vez de um modelo, a Anthropic entrega um arcabouço gerenciado e a xAI faz você escolher uma quantidade de agentes. O que os substituiu é um seletor de esforço. Isso é uma boa notícia para quem constrói, porque esforço é um parâmetro que você pode ajustar a cada requisição, e é por isso que a descoberta de benchmark mais útil de 2026 foi que aumentar o orçamento de busca moveu a precisão em 53 pontos enquanto o modelo permanecia o mesmo.

Mas a escolha da ferramenta importa menos do que o que você faz com o resultado. O maior erro que vejo as pessoas cometerem é tratar um relatório de deep research como trabalho concluído. Não é. É matéria-prima. O conhecimento de verdade é construído quando você destaca as afirmações que importam, as conecta a outras coisas que leu e volta a elas mais tarde, quando o tema reaparece.

É para esse fluxo de trabalho que o Glasp foi projetado. Destaque qualquer relatório, qualquer artigo, qualquer transcrição do YouTube. Construa uma biblioteca pesquisável do que você de fato achou importante. Converse com seus destaques depois, quando precisar recordar algo específico. Compartilhe seu trabalho com outras pessoas fazendo a mesma pesquisa.

Os agentes de deep research vão continuar melhorando, e as APIs vão continuar se multiplicando. Os que não ganharem também uma camada de marcação de textos por cima vão continuar produzindo relatórios que são lidos uma vez e esquecidos. Não construa seu fluxo de trabalho de pesquisa de 2026 em torno de uma única ferramenta. Construa-o em torno de uma pilha, e garanta que o último elo dessa pilha seja aquele em que o seu próprio entendimento fica registrado.

Comece rodando uma pergunta de pesquisa real em duas das quatro ferramentas esta semana. Destaque os dois relatórios. Compare o que você aprendeu. Esse é o fluxo de trabalho. Todo o resto é lista de recursos.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it