AI

Outils de recherche approfondie : OpenAI vs Perplexity vs Gemini

Chaque grand laboratoire d'IA propose désormais un agent de « recherche approfondie », et la plupart proposent aussi une API de recherche. Tous promettent des rapports de niveau doctoral en quelques minutes. Après un an et demi d'usage réel, les différences sont plus précises que ne le suggère le marketing, et rarement là où pointent les benchmarks.

29 min de lecture
Points clés
    • Perplexity Deep Research ne tourne plus sur Sonar : depuis février 2026, il s'appuie sur Claude Opus, et depuis juin 2026 il s'exécute à l'intérieur de Perplexity Computer. L'API sonar-deep-research qui avait fait de Perplexity le favori des développeurs cesse d'être prise en charge le 27 septembre 2026.
  • Le « modèle de recherche approfondie » dédié est en train de disparaître : OpenAI, Perplexity, Google, Anthropic et xAI ont tous remplacé un identifiant de modèle unique par une session d'agent assortie d'un curseur d'effort. Les paliers d'effort sont le nouveau produit.
  • Google domine les quatre grands sur les benchmarks publiés : Deep Research Max a rapporté 54,6 % à Humanity's Last Exam contre 50,4 % pour le palier standard (Google, avril 2026), et le Kimi K3 de Moonshot revendique un chiffre supérieur aux deux. Lisez attentivement les étiquettes de palier, car les éditeurs le font rarement.
  • Le budget de recherche l'emporte sur le choix du modèle : lors de tests indépendants, une même configuration a obtenu 35,8 % à BrowseComp avec une limite d'un tour de recherche, et 89,0 % avec 25 tours. Même modèle, même benchmark.
  • Les offres gratuites sont devenues plus floues, pas meilleures : le centre d'aide d'OpenAI a cessé de publier des quotas de recherche approfondie par formule au cours de 2026, et l'entreprise a suspendu les nouvelles inscriptions à l'offre Pro à 200 $ le 10 septembre. L'offre AI Plus de Gemini à 4,99 $ est désormais le point d'entrée payant le moins cher de tous les laboratoires de pointe.
  • Le rapport n'est pas le résultat, votre compréhension l'est : associer un agent de recherche approfondie à un flux de surlignage comme Glasp transforme des rapports de 20 pages en savoir exploitable plutôt qu'en PDF lus une seule fois.

Le moment de la recherche approfondie

Pour la plupart des gens, en septembre 2026, Gemini Deep Research est le meilleur choix polyvalent : les benchmarks publiés les plus solides et l'entrée payante la moins chère, à 4,99 $. Perplexity Pro à 20 $ offre le meilleur volume pour le prix, et OpenAI comme Claude produisent les rapports les plus fouillés sur les travaux ambigus. Les développeurs devraient commencer par la Deep Research API de Google, la seule option clé en main qui ne soit pas sur un compte à rebours de retrait, puisque Perplexity retire sonar-deep-research le 27 septembre 2026 et qu'OpenAI a fermé ses modèles de recherche dédiés en juillet.

Le reste de ce guide montre comment ces verdicts tiennent face aux tarifs, aux benchmarks, aux API et aux tâches réelles.

La catégorie elle-même n'a pas encore deux ans. Le 2 février 2025, OpenAI annonçait Deep Research. C'était le premier agent que la plupart des gens avaient utilisé capable de prendre une consigne d'une phrase, de planifier une enquête de 30 minutes, de parcourir seul des dizaines de sources et de revenir avec un rapport sourcé.

La réaction du secteur est révélatrice. En six semaines, Perplexity lançait sa propre Deep Research (le 14 février) et ouvrait l'API Sonar Deep Research aux développeurs quelques semaines plus tard. Google, qui avait lancé Gemini Deep Research discrètement en décembre 2024, a accéléré son déploiement et n'a cessé d'en renforcer le socle technique. Anthropic a rendu la recherche web de Claude généralement disponible le 7 mai 2025, en empaquetant la fonctionnalité Research dans la même fenêtre de printemps.

Quatre laboratoires, une catégorie de produit, deux trimestres. Cela n'arrive pas par hasard. 2024 a été l'année où les fenêtres de contexte ont franchi les 200 000 tokens, où l'usage d'outils est devenu fiable et où les boucles agentiques ont cessé d'échouer silencieusement à mi-parcours. La recherche approfondie a été la première application grand public qui donnait envie de payer pour les trois à la fois. Elle est étroitement liée au basculement plus large vers les protocoles d'agents, que nous traitons dans Le web agentique : MCP, A2A et les guerres de protocoles.

Si vous écrivez, si vous étudiez, si vous analysez des marchés ou si vous évaluez des produits, vous êtes déjà désavantagé en n'en utilisant aucun. La question est de savoir lequel, et quand.


Ce que fait vraiment la « recherche approfondie »

Il est facile de confondre recherche approfondie et recherche conversationnelle. Vous tapez une question, vous obtenez une réponse avec des liens. Les mécanismes, eux, sont différents.

Une recherche conversationnelle (comme ChatGPT ordinaire avec navigation) lance une ou deux requêtes web et synthétise les meilleurs résultats en quelques secondes. Un agent de recherche approfondie fait quelque chose de plus proche du travail d'un analyste junior en un après-midi. Il découpe votre question en sous-questions, lance des dizaines voire des centaines de recherches, lit des pages entières, suit les citations, met à jour son plan à mesure qu'il apprend, et produit un rapport structuré avec des notes de bas de page.

Demandez à une recherche conversationnelle « quelles sont les principales critiques de la courbe de Phillips ? » et vous obtiendrez un résumé de trois paragraphes. Posez la même question à un agent de recherche approfondie et vous obtiendrez un rapport de 15 pages couvrant l'hypothèse du taux naturel de Friedman, la rupture stagflationniste des années 1970, les révisions par les anticipations rationnelles, les débats sur l'aplatissement post-2008 et des articles récents de 2023-2025, chacun accompagné d'une source cliquable.

Le compromis, c'est le temps. Les exécutions prennent de quelques minutes à une heure, et Google est le seul éditeur à publier un budget : la plupart des tâches en moins de 20 minutes, avec un plafond strict à 60. C'est précisément le principe. Vous en lancez une, vous travaillez sur autre chose, et vous revenez à un rapport qu'il vous aurait fallu une demi-journée à assembler à la main. Pour aller plus loin sur la réorganisation des habitudes de recherche autour des agents IA, voir Comment construire un flux de recherche propulsé par l'IA en 2026.


Face-à-face : les 4 outils grand public comparés

Voici la matrice, avec le modèle sous-jacent et les tarifs relevés sur les pages des éditeurs eux-mêmes en septembre 2026. Une colonne a plus changé que toutes les autres depuis la première version de ce guide : celle du « modèle sous-jacent », qui est désormais une cible mouvante chez trois des quatre.

OutilModèle sous-jacent (sept. 2026)Tarif et accèsDurée d'exécution publiée
OpenAI Deep ResearchNon divulgué ; « le modèle le plus récent par défaut »Free et Go (8 $/mois) : Limité ; Plus (20 $/mois) : Étendu ; Pro (à partir de 100 $/mois) : Maximum5-30 min (OpenAI, févr. 2025)
Perplexity Deep ResearchClaude Opus, routé dans Perplexity ComputerPro 20 $/mois ; Max 200 $/mois2-4 min (Perplexity, févr. 2025)
Gemini Deep ResearchGemini 3.1 ProAI Plus 4,99 $/mois ; AI Pro 19,99 $/mois ; AI Ultra à partir de 99,99 $/mois20 min en général, plafond à 60 min (API)
Claude ResearchNon divulguéToutes les formules payantes : Pro 20 $/mois, Max 100 ou 200 $/mois, Team, EnterpriseNon publiée

Ce tableau contient plus de « non publié » qu'auparavant, et c'est là, honnêtement, l'état des choses. Seul Google publie un budget temps ferme pour un produit actuel. Le « 5 à 30 minutes » largement cité d'OpenAI figure sur sa page de lancement de février 2025 et n'a jamais été réaffirmé. Perplexity avait publié 2 à 4 minutes lors de ce même lancement et ne l'a pas davantage mis à jour, si bien que le « moins de 3 minutes » qu'imprimait ce guide était un chiffre de février 2025 décrivant un produit reconstruit deux fois depuis. Anthropic se contente de dire que Research livre ses réponses « en quelques minutes ».

Les profils en un paragraphe :

OpenAI Deep Research reste le poids lourd des questions ambiguës et ouvertes. Les rapports sont longs et le raisonnement est visiblement plus profond quand la question n'a pas de réponse nette. Deux choses ont changé en 2026. La page tarifaire a cessé de donner des quotas d'exécutions et indique maintenant Limité, Étendu et Maximum, si bien que les chiffres « 5 gratuites, 25 sur Plus, 250 sur Pro » qui circulent encore proviennent d'une mise à jour de blog d'avril 2025 plutôt que de quoi que ce soit qu'OpenAI publie aujourd'hui formule par formule. Et le 10 septembre 2026, OpenAI a suspendu les nouvelles inscriptions à son offre Pro à 200 $. Il existe deux paliers Pro : 100 $ débloque 5 fois l'usage de Plus et 200 $ en débloque 20 fois, et cette suspension laisse 100 $ comme formule la plus élevée qu'un nouveau client puisse acheter.

Perplexity Deep Research est celui à qui l'on a changé le moteur sous le capot. Il a été lancé sur les modèles Sonar maison de Perplexity. Depuis février 2026, le mode Advanced Deep Research tourne sur Claude Opus, les abonnés Max bénéficiant d'une révision d'Opus plus récente que les abonnés Pro, et le 11 juin 2026 Perplexity a déplacé Deep Research à l'intérieur de Perplexity Computer, qui répartit les sous-tâches sur plus de 20 modèles de pointe. Perplexity attribue un bond de 40,7 % à 83,8 % sur BrowseComp à ce changement d'architecture plutôt qu'au changement de modèle. Si vous lisez un article qualifiant Perplexity Deep Research de produit « Sonar », c'est qu'il a été écrit avant février 2026. Sonar est désormais le nom de la gamme d'API, pas celui de l'agent grand public.

Gemini Deep Research affiche les meilleurs résultats publiés des quatre grands. Google a fait passer l'agent à Gemini 3.1 Pro en avril 2026, l'a scindé en un palier standard et un palier Max, et a exposé les deux via une véritable API. Il puise toujours dans vos Gmail, Drive et Docs en parallèle du web, et il montre un plan de recherche visible que vous pouvez modifier avant l'exécution de l'agent. Google publie ses allocations sous forme de multiplicateurs plutôt que de quotas, ce qui vous indique au moins ce qu'achète une montée en gamme.

Claude Research est le plus patient des quatre, doué pour tenir côte à côte des sources contradictoires au lieu de trancher trop tôt. Deux corrections méritent d'être faites : Research est disponible sur toutes les formules payantes de Claude (Pro, Max, Team et Enterprise), et pas seulement sur Pro, et la gamme d'Anthropic a dépassé Sonnet 5 et Opus 5 pour inclure Claude Fable 5.1, sorti le 1er septembre 2026. Anthropic ne dit pas quel modèle alimente Research dans ses applications. Ce qu'elle documente, en revanche, c'est que Claude 4.6 et les versions suivantes embarquent le contexte complet d'un million de tokens au tarif standard : de grands corpus de sources ne sont donc ni tronqués ni surfacturés.


Alternatives à ChatGPT Deep Research : qui en propose une

« Alternative à ChatGPT deep research » est l'une des façons les plus courantes d'arriver sur ce sujet, et la comparaison à quatre ci-dessus n'y répond pas. Voici qui propose réellement un agent de recherche en septembre 2026, et qui se contente d'en avoir l'air.

ChallengerProduit et APIPrix d'entréeLe fait distinctif
xAI GrokMode multi-agent ; grok-4.20-multi-agent (bêta)SuperGrok 30 $/moisNe publie aucun score HLE ni BrowseComp
Moonshot KimiDeep Research (Kimi-Researcher) ; aucun point de terminaison dédiéPlus 19 $/moisPublie une télémétrie par exécution que personne d'autre ne donne
ManusAgent autonome, Wide Research ; REST orienté tâche20 $/mois (4 000 crédits)Ne publie aucun benchmark public nommé
You.comProduit grand public quasi disparu ; Research API12 $ pour 1 000 (lite)Cinq paliers d'effort couvrant un écart de prix de 100x
MistralCompétence Deep Research dans Vibe ; aucun point de terminaison autonomePro 14,99 $/moisPalier payant le moins cher hors des quatre grands
DeepSeekRecherche web dans l'application ; rien d'agentique dans l'APIGratuitL'API ignore tous les outils que vous lui passez

xAI Grok a discrètement renommé la chose que tout le monde cherche encore. « DeepSearch » et « DeeperSearch » n'apparaissent plus nulle part dans la documentation développeur de xAI. Ce qui existe maintenant, c'est un modèle multi-agent, grok-4.20-multi-agent, toujours étiqueté bêta, où reasoning.effort sélectionne 4 agents en low ou medium et 16 en high ou xhigh. La documentation vous dit sans détour d'utiliser 16 pour la recherche approfondie. Le hic, pour quiconque compare sur la qualité : xAI n'a publié aucun score Humanity's Last Exam, BrowseComp ou GAIA pour le Grok 4.6 sous-jacent, il n'y a donc rien à mettre dans le tableau de benchmarks habituel. L'entreprise rapporte en revanche 81,6 % sur DeepSearchQA, où elle perd à la fois contre GPT-5.5 et contre Claude Opus.

Kimi, de Moonshot, est le challenger le mieux documenté et celui que la plupart des gens hors d'Asie n'ont jamais essayé. Son mode Deep Research tourne sur un modèle maison, Kimi-Researcher, et Moonshot publie une télémétrie par tâche que les laboratoires américains taisent : en moyenne 23 étapes de raisonnement, 74 mots-clés de recherche planifiés et 206 URL trouvées par tâche, dont seuls les 3,2 % les mieux classés survivent jusqu'au rapport. Les exécutions prennent de 10 à 25 minutes et les paliers payants démarrent à 19 $ par mois. Moonshot propose des points de terminaison de recherche et de récupération que vous pouvez appeler, mais rien qui expose l'agent Deep Research lui-même : le produit de recherche reste donc réservé au grand public.

Manus est l'histoire commerciale la plus intéressante et le dossier technique le plus mince. Meta l'a racheté en décembre 2025, la NDRC chinoise a bloqué l'opération le 27 avril 2026, et Manus a annoncé avoir repris ses activités de façon indépendante le 1er septembre 2026. Son mode Wide Research exécute 20 sous-tâches en parallèle, même si vous ne pouvez pas le déclencher manuellement. À savoir avant de le citer : Manus ne publie nulle part de benchmark public nommé, seulement des graphiques qu'il qualifie d'internes.

You.com a de fait quitté le marché grand public. ARI, son agent de recherche, n'apparaît plus sur la page d'accueil, et il n'y a plus d'abonnement grand public sur la page tarifaire. Il reste une Research API vraiment bonne, avec cinq niveaux d'effort de lite à frontier, facturés de 12 $ à 1 200 $ pour mille requêtes. Un écart de 100x sur un seul point de terminaison est l'illustration la plus claire d'une chose vers laquelle toute cette catégorie a convergé, et que la section consacrée aux API reprend plus bas.

Mistral a déplacé son agent de recherche et renommé l'application autour de lui. Le Chat est devenu Vibe en mai 2026, et Deep Research a été retiré de l'onglet Chat ; en lancer un aujourd'hui vous redirige vers l'onglet Work avec la compétence Deep Research présélectionnée. À 14,99 $ par mois, Mistral Pro est le palier payant le moins cher hors des quatre grands, même si l'offre AI Plus de Google à 4,99 $ passe en dessous, et pour les équipes européennes soumises à des exigences de résidence des données, Mistral est souvent la seule option qui passe le filtre des achats.

DeepSeek est le résultat négatif utile. Malgré sa présence constante dans les listes des « meilleurs outils de recherche approfondie », DeepSeek ne propose aucun produit de recherche approfondie. Son application dispose d'une recherche web et d'un mode réflexion, mais sa documentation API signale web_search et tous les autres outils comme ignorés : il n'y a donc rien d'agentique sur quoi construire. C'est un excellent modèle de raisonnement bon marché que vous pouvez pointer vers du texte que vous fournissez, et ce n'est pas un agent de recherche. Il en va de même pour Qoob et Arc Search, tous deux présents dans les requêtes de comparaison et tous deux des applications de recherche à réponse rapide, pas des agents qui planifient et naviguent pendant une demi-heure.

Les options open source, et une mise en garde

Si vous voulez auto-héberger, la réponse honnête en 2026 est que la maintenance et la performance aux benchmarks vivent désormais dans des dépôts différents.

Activement maintenus, et par où commencer : GPT Researcher (Apache-2.0, environ 29 500 étoiles, avec des versions publiées jusqu'en août 2026) est celui que vous pouvez cloner et faire tourner aujourd'hui sans devoir d'abord remplacer un nom de modèle retiré dans sa configuration. DeerFlow, de ByteDance, est de loin le plus gros avec environ 82 000 étoiles et le moins cher à essayer, puisqu'il fonctionne sans aucune clé d'API de recherche, à l'aide de DuckDuckGo et d'un lecteur sans clé, même si sa réécriture 2.0 l'a repositionné en harnais d'agent généraliste dont la recherche approfondie n'est qu'une compétence parmi d'autres. Tongyi DeepResearch, d'Alibaba, est l'option crédible à poids ouverts sous licence Apache-2.0, mais son dépôt est silencieux depuis février 2026.

Passons à la mise en garde, car deux projets qui trônaient en tête de toutes les listes de recommandations de 2025 sont morts sans en avoir l'air. Le open_deep_research de LangChain a été archivé le 21 août 2026. GitHub affiche la bannière d'archivage, mais le README lui-même ne porte aucun avis, si bien que le projet paraît vivant à quiconque y arrive depuis un tutoriel. STORM, de Stanford, a vu 146 pull requests ouvertes en 2026 et n'en a fusionné exactement aucune ; son dernier commit date de septembre 2025, et son guide de démarrage documenté dépend de l'API Bing Search, retirée en août 2025. Les articles sur STORM valent toujours la lecture. Le logiciel, lui, ne devrait pas être votre point de départ.

Parmi les projets les plus connus, le schéma est le suivant : les agents à poids ouverts qui affichaient des scores compétitifs se sont tus, tandis que ceux qui continuent de livrer du code ne publient presque aucun benchmark. Choisissez selon la maintenance, puis mesurez vous-même.

Si votre recherche se limite à des documents que vous possédez déjà plutôt qu'au web ouvert, il s'agit d'une autre catégorie d'outils avec d'autres gagnants, que nous traitons dans NotebookLM en 2026.


Les API de recherche approfondie : ce que vous pouvez réellement appeler

C'est la question que les articles comparatifs esquivent systématiquement, et celle que les développeurs cherchent sans relâche : quels agents de recherche approfondie pouvez-vous appeler depuis votre propre code, combien coûtent-ils, et quelle est la qualité des citations ? L'essentiel a changé au cours de 2026, et l'un des plus gros changements tombe le 27 septembre 2026.

FournisseurRecherche approfondie appelable ?Ce que vous appelezPrix
Google GeminiOui, clé en maindeep-research-preview-04-2026 ou deep-research-max-preview-04-2026 sur l'Interactions API~1 à 3 $ par tâche ; Max ~3 à 7 $ par tâche (tarifs de préversion)
PerplexityOui, mais en migrationAgent API POST /v1/agent avec préréglages d'effort ; sonar-deep-research n'est plus pris en charge après le 27 sept. 2026Sonar historique : 2 $/1M en entrée, 8 $/1M en sortie, plus 2 $/1M de tokens de citation et 3 $/1M de tokens de raisonnement, plus 5 $ pour 1 000 recherches
OpenAIPas sous forme de modèle dédiéModèle phare sur la Responses API avec web_search et un effort de raisonnement élevé, ou la nouvelle Agents APITarif des tokens du modèle plus web_search à 10 $ pour 1 000 appels
Anthropic ClaudeAucune API estampillée rechercheOutil web_search de la Messages API, ou Claude Managed Agents (bêta)10 $ pour 1 000 recherches plus les tokens ; Managed Agents ajoute 0,08 $ par heure de session
You.comOuiResearch API, cinq niveaux d'effortDe 12 $ (lite) à 1 200 $ (frontier) pour 1 000
ExaÀ construire soi-mêmePoints de terminaison Search, Deep Search et AgentSearch 7 $ pour 1 000 ; Deep Search 12 à 15 $ pour 1 000 ; Agent 0,012 à 1,00 $ par requête à effort fixe
TavilyÀ construire soi-mêmePoints de terminaison Search et Research1 000 crédits/mois gratuits ; à l'usage 0,008 $/crédit ; une exécution Research consomme de 4 à 250 crédits

Quatre points ressortent.

Google est désormais l'option clé en main d'un laboratoire de pointe, et c'est un renversement. Pendant l'essentiel de la vie de cette catégorie, Gemini Deep Research était une fonctionnalité grand public que vous ne pouviez pas appeler par programmation. C'est aujourd'hui l'option la plus propre des quatre grands : vous appelez un modèle de recherche approfondie sur l'Interactions API, avec background=true obligatoire plutôt qu'optionnel, et Google publie à la fois une fourchette de prix estimée par tâche et un vrai budget temps. L'accès entreprise passe par la Gemini Enterprise Agent Platform, qui a remplacé Vertex AI comme nom de produit pour cela en 2026 : ignorez donc les articles plus anciens qui vous renvoient vers Vertex.

L'API clé en main de Perplexity est en train d'être retirée, en ce moment même. sonar-deep-research a été pendant deux ans la réponse à « quelle API de recherche approfondie puis-je simplement appeler », et Perplexity a annoncé en juillet 2026 que les points de terminaison Sonar Chat Completions seraient retirés le 27 septembre 2026. Le remplaçant est l'Agent API, où vous faites POST /v1/agent et choisissez un préréglage d'effort. Perplexity fait correspondre l'ancien modèle de recherche approfondie à high et pointe vers xhigh pour ses meilleurs résultats. Tous les tarifs Sonar du tableau ci-dessus ne valent que jusqu'au 27 septembre : si vous chiffrez un projet, chiffrez l'Agent API. Notez aussi que le cycle de vie a changé de forme : l'ancien point de terminaison asynchrone utilisait des statuts en majuscules comme IN_PROGRESS tandis que l'Agent API en utilise un jeu différent, en minuscules, ce qui signifie qu'une boucle d'interrogation écrite pour l'un échoue silencieusement contre l'autre.

OpenAI a déplacé la recherche approfondie dans sa gamme de modèles, puis dans un agent managé. Les modèles dédiés o3-deep-research et o4-mini-deep-research ont été dépréciés en avril 2026 et fermés le 23 juillet 2026. Leur voie de remplacement est un modèle phare actuel sur la Responses API avec l'outil web_search en mode arrière-plan. Depuis le 10 septembre 2026, il existe aussi une Agents API managée en bêta publique, où OpenAI assure pour vous l'orchestration de session, le compactage du contexte et la reprise. Un piège mérite d'être signalé : la page du guide de recherche approfondie d'OpenAI et la page de son modèle o3-deep-research sont toutes deux périmées et présentent encore ces modèles comme disponibles, en contradiction avec la page des dépréciations. Fiez-vous à la page des dépréciations.

Anthropic ne vous oblige plus à tout construire vous-même. L'ancien cadrage, qu'imprimait ce guide, voulait que Claude n'ait pas d'API de recherche et que vous assembliez votre propre boucle. C'est dépassé. Claude Managed Agents est en bêta publique depuis avril 2026 : sessions de longue durée, événements envoyés par le serveur, pilotage et interruption, déploiements planifiés par cron, et recherche web, récupération web et MCP intégrés, le tout facturé au coût des tokens plus 0,08 $ par heure de session. L'exemple chiffré d'Anthropic elle-même situe une session Opus d'une heure à bien moins d'un dollar, et la récupération web, contrairement à la recherche web, ne coûte rien. Il n'existe toujours pas de modèle appelé « deep research », mais le harnais, lui, existe.

Pour la question précise de la « meilleure API pour des rapports de recherche avec citations », trois approches fonctionnent. Google et Perplexity vous donnent les citations d'emblée. You.com, Exa et Tavily vous renvoient des résultats attribués à leurs sources, que vous injectez dans votre propre modèle, ce qui est le schéma sur lequel la plupart des fonctionnalités de recherche en production sont réellement bâties, parce que vous y maîtrisez le coût et le formatage des citations. Et n'importe quel modèle doté d'un outil de recherche web peut citer au fil de l'eau si vous le lui demandez. Les équipes qui ont besoin de pistes d'audit préfèrent en général la voie du sur-mesure, parce que chaque affirmation remonte à une URL que vous avez vous-même récupérée plutôt qu'à la mémoire d'un modèle. Pour comprendre pourquoi l'ancrage et la qualité de la récupération comptent plus que la taille brute du contexte, voir Context Rot : pourquoi le RAG bat encore une fenêtre de contexte géante.

Deux remarques de propriété pour qui choisit un fournisseur dont dépendre. Tavily a été racheté par le fournisseur de cloud IA Nebius en février 2026 : le cadrage « API de recherche indépendante » mérite donc un astérisque. Et Exa a supprimé son point de terminaison /research le 1er avril 2026, en le repliant dans /search avec un type deep-reasoning, ce qui veut dire que tout tutoriel vous disant d'appeler exa-research est cassé.


Comment automatiser la recherche approfondie avec une API

Appeler l'une de ces API n'a rien à voir avec un appel de complétion de chat. Les exécutions durent de quelques minutes à une heure : chaque fournisseur vous impose donc de gérer l'asynchronie, et tous le font différemment. Si vous branchez un agent de recherche dans un produit ou un pipeline, c'est la partie qui vous coûtera une journée.

Partez du principe d'une exécution en arrière-plan, pas d'un appel bloquant. Google l'exige purement et simplement : les modèles de recherche approfondie ne fonctionnent qu'avec background=true, et vous interrogez l'interaction ou reprenez un flux. OpenAI prend en charge le mode arrière-plan sur la Responses API, avec interrogation, flux reprenable et webhooks conformes à la spécification Standard Webhooks. Perplexity documente l'interrogation et aucun webhook. xAI fait figure d'exception. background apparaît dans son schéma mais y est marqué non pris en charge : la vraie voie asynchrone est donc l'API batch, qui répond sous 24 heures plutôt qu'en quelques minutes.

Budgétez par tâche, pas par token, et regardez ce que coûte la recherche. Les surcoûts de recherche sont l'origine des factures d'API de recherche. Ils sont facturés à l'appel, pas au token. OpenAI facture 10 $ pour 1 000 appels de recherche web, Anthropic 10 $ pour 1 000 recherches, Perplexity 5 $ pour 1 000 sur la gamme Sonar deep research en cours de retrait, et xAI 5 $ pour 1 000 appels d'outil. Google offre aux projets sur palier payant 5 000 recherches d'ancrage gratuites par mois sur l'ensemble de ses modèles Gemini 3.x, puis facture 14 $ pour 1 000, et les tâches Deep Research puisent dans ce même pot à raison d'environ 80 à 160 recherches chacune : environ 60 tâches suffisent donc à l'épuiser. L'exemple de réponse publié par Perplexity est le cas chiffré le plus utile qui existe : un seul appel de recherche approfondie coûtant 0,816 $, dont 71 % en tokens de raisonnement et seulement 11 % en sortie. Le rapport que vous lisez est la partie la moins chère de la facture.

Attendez-vous à des paliers d'effort, car ils ont remplacé les identifiants de modèles. C'est le basculement structurel qui se cache derrière chacun des changements individuels évoqués plus haut. OpenAI a retiré ses modèles de recherche au profit d'un modèle phare plus un effort de raisonnement. Perplexity retire Sonar au profit de préréglages de l'Agent API. Google livre des variantes standard et Max. xAI vous fait choisir 4 ou 16 agents via reasoning.effort. Exa, You.com et Tavily facturent tous la même forme d'échelle, d'un plancher bon marché à un plafond par requête. Si vous concevez autour de ces API, concevez pour un curseur que vous pouvez tourner à chaque requête, pas pour un nom de modèle codé en dur.

L'étape de clarification, c'est à vous de la construire. OpenAI le dit explicitement : la recherche approfondie via l'API n'inclut aucune étape de clarification ni de réécriture de la consigne, et le modèle attend une consigne entièrement formée dès le départ. Les applications grand public vous posent des questions de suivi avant de démarrer ; les API, non. Le correctif standard, que démontre le cookbook d'OpenAI lui-même, est un petit modèle bon marché qui trie la demande et la réécrit en instruction de recherche avant que l'agent coûteux ne se lance.

Pour la vérification des faits en particulier, la vérification est une étape de pipeline plutôt qu'une consigne. Un schéma s'est imposé dans les cookbooks publiés d'OpenAI comme d'Anthropic : décomposer la sortie en affirmations autonomes, vérifier chaque affirmation dans son propre contexte vierge, puis faire contester les verdicts par une passe sceptique distincte. La version d'Anthropic en donne la raison sans détour, en notant que « revérifiez vos conclusions » n'est jamais qu'une instruction de plus, et que sous pression de contexte elle passe à la trappe. Si vous construisez le vérificateur de faits en temps réel que tout le monde cherche, cette décomposition est l'architecture, et l'API de recherche qui la sous-tend compte moins que la structure bâtie autour d'elle.


Benchmarks de recherche approfondie : ce que montrent les classements

Trois chiffres sont les plus cités : Humanity's Last Exam, BrowseComp et SimpleQA. Ils sont utiles, ils sont massivement mal cités, et ils portent deux problèmes structurels que presque personne ne mentionne.

Commençons par le premier. Aucun classement indépendant ne compare entre eux les agents de recherche réellement commercialisés, outils compris. L'évaluation de Scale exécute une variante sans outils, les tableaux des éditeurs sont auto-déclarés, et le seul harnais tiers sérieux évalue des configurations modèle plus recherche que vous ne pouvez pas acheter, plutôt que des produits que vous pouvez acheter. Quand vous voyez l'agent d'un éditeur obtenir un score dans les cinquante ou soixante pour cent « avec outils », vous lisez le harnais, le budget de recherche et le juge de cet éditeur. Cela ne rend pas les chiffres faux. Cela les rend incomparables.

Le second problème est l'étiquetage des paliers. Ce guide imprimait auparavant 54,6 % à HLE et 85,9 % à BrowseComp sous le nom « Gemini Deep Research ». Les deux chiffres appartiennent à Deep Research Max, le palier à effort supérieur de Google, contre 50,4 % et 61,9 % pour le palier standard. Cela fait 24 points d'écart sur BrowseComp entre deux produits vendus sous un même nom, et les articles comparatifs les confondent en permanence. Bon à savoir : Google a publié ces chiffres dans un graphique de son annonce d'avril 2026 plutôt qu'en texte citable, ce qui explique en partie qu'ils soient déformés en aval.

Agent ou configurationHLE (avec outils)Rapporté parQuand
Perplexity Sonar Deep Research21,1 %Éditeurfévr. 2025
OpenAI Deep Research (o3)26,6 %Éditeurfévr. 2025
Gemini Deep Research (3 Pro)46,4 %Éditeurdéc. 2025
Gemini Deep Research (3.1 Pro)50,4 %Éditeuravr. 2026
Gemini Deep Research Max (3.1 Pro)54,6 %Éditeuravr. 2026
Kimi K3 (le modèle, pas l'agent Deep Research)56,0 %Éditeurjuil. 2026
Claude Opus 5 + recherche Perplexity, 25 tours77,4 %Tiersaoût 2026

C'est cette dernière ligne qui mérite qu'on s'y arrête. Elle provient du harnais de benchmark d'OpenRouter, qui exécute des points de terminaison de production plutôt que de collecter les déclarations des éditeurs, et publie coût et latence à côté de la justesse : 0,46 $ par question, 83 secondes, sur un échantillon de 84 questions. Ce n'est pas un produit que vous pouvez acheter. C'est un modèle plus un fournisseur de recherche plus un budget de tours, assemblés par un tiers, et cela bat le chiffre auto-déclaré de tous les agents commercialisés. Une réserve sur l'identité du mesureur : OpenRouter revend la plupart des modèles et des moteurs de recherche qu'il évalue.

La trouvaille la plus utile de toute la catégorie vient de ce même harnais. Sur BrowseComp, une même configuration a obtenu 35,8 % avec une limite d'un tour de recherche et 89,0 % avec une limite de 25 tours, dans la même série d'exécutions. Même modèle, même benchmark. L'échafaudage autour de lui, et précisément le nombre de recherches autorisées, a déplacé le résultat de 53 points. C'est pourquoi un simple modèle de navigation obtient moins de 2 % à BrowseComp tandis qu'un agent bâti dessus atteint les quatre-vingts pour cent, et c'est pourquoi « quel modèle est le plus intelligent » est presque la mauvaise question. Achetez du budget de recherche.

La courbe des coûts est elle aussi plus plate que ne le laisse entendre le marketing. Dans les mêmes exécutions, la meilleure configuration BrowseComp coûtait 0,99 $ par question, tandis qu'un modèle bon marché associé au même fournisseur de recherche atteignait 77,0 % à 0,076 $, soit environ 13 fois moins cher pour 12 points de justesse en moins. Pour l'essentiel du travail réel, ce compromis est manifestement le bon.

Les benchmarks conçus pour les agents de recherche

HLE et BrowseComp mesurent si un agent sait trouver un fait difficile. Ils ne mesurent pas si le rapport est bon. Trois benchmarks plus récents le font, et ils sont bien moins flatteurs.

ResearchQA, un effort académique indépendant couvrant 21 000 requêtes et 160 000 items de grille sur 75 disciplines, validé par 31 annotateurs docteurs dans huit d'entre elles, a constaté qu'aucun des modèles de langage simples ni des systèmes à récupération testés n'atteignait 70 % de couverture de la grille. Seuls les agents de recherche approfondie conçus pour cela ont fait mieux, et le meilleur d'entre eux s'est arrêté à 75,3 %. Plus révélateur encore : ce système de tête traitait pleinement moins de 11 % des items de grille relatifs aux citations, et environ la moitié de ceux relatifs aux limites et aux comparaisons. Les agents trouvent des sources. Ils sont bien plus mauvais pour dire ce que les sources n'établissent pas.

ResearchRubrics, bâti sur plus de 2 800 heures de travail d'experts, place aussi bien Gemini Deep Research qu'OpenAI Deep Research sous 68 % de conformité moyenne à la grille. DeepResearch Bench II, avec 9 430 grilles binaires distillées à partir d'articles d'investigation d'experts, rapportait en janvier 2026 que même les modèles les plus solides en satisfaisaient moins de la moitié. Son classement en direct a depuis franchi cette barre, ce qui est la trajectoire habituelle.

Deux mises en garde supplémentaires avant d'utiliser l'un de ces chiffres pour choisir un outil. Le modèle qui note la grille déplace les scores de plus de dix points et peut réordonner les deux premiers : tout tableau mélangeant les juges vous renseigne donc sur les juges plutôt que sur les agents. Et les agents qui naviguent sur le web en direct peuvent récupérer les réponses du benchmark lui-même : une étude de 2026 a mesuré jusqu'à 4 % d'inflation de ce fait. La méthodologie d'évaluation publiée par Google bloque désormais des sites comme Hugging Face pendant les tests, ce qui vous dit que le problème est assez réel pour qu'on le contourne par l'ingénierie.

SimpleQA mérite désormais une note de bas de page plutôt qu'un titre. Les 93,9 % de Perplexity sont authentiques, mais ils datent de février 2025 et décrivent un produit fondé sur Sonar qui, comme vu plus haut, n'existe plus sous cette forme.

La conclusion indépendante la plus durable est aussi la plus ancienne. Le Tow Center de la Columbia Journalism Review a testé huit moteurs de recherche IA sur 1 600 requêtes et a constaté qu'ils échouaient à récupérer l'information correcte plus de 60 % du temps, avec des taux d'erreur allant de 37 % à 94 % selon le moteur. Cette étude date de mars 2025 et le Tow Center n'en a pas publié de réplique à cette échelle, ce qui en dit long sur la minceur persistante de l'évaluation indépendante.

En toute honnêteté : les benchmarks classent les outils de façon fiable à l'extrême haut de la difficulté, et mal en dessous. Passez la même consigne réelle dans deux outils sur leur palier payant le moins cher, puis comparez. Les benchmarks sont indicatifs. Votre propre test est décisif. Pour un argumentaire plus long sur la façon dont l'obsession des benchmarks induit en erreur, voir Le piège de la pensée IA.


Le point sur la réalité des offres gratuites

Les pages marketing mettent toutes en avant un accès gratuit. Voici ce que « gratuit » veut dire en septembre 2026, et la réponse honnête commence par un aveu : les chiffres sont devenus plus difficiles à trouver, pas meilleurs.

OpenAI est le seul à offrir une allocation gratuite, et il a cessé de dire de quelle taille. Les chiffres « 5 gratuites par mois, 25 sur Plus, 250 sur Pro » qui circulent encore proviennent d'une mise à jour de blog d'avril 2025. La page tarifaire actuelle indique Limité sur Free et sur le palier Go à 8 $ par mois, Étendu sur Plus, et Maximum sur Pro, et le centre d'aide confirme l'existence d'un compteur intégré au produit qui se réinitialise tous les 30 jours, sans dire à combien il démarre. Le seul chiffre publié actuel figure sur la grille tarifaire entreprise, où une tâche de recherche approfondie coûte 50 crédits. S'il vous faut un quota prévisible, c'est l'éditeur le moins prévisible.

Perplexity a fait passer Deep Research derrière le paywall. Les comptes gratuits ont droit à la recherche. Deep Research est une fonctionnalité Pro, et puisqu'elle s'exécute désormais dans Perplexity Computer, elle est réservée à Pro et Max. Ce guide imprimait autrefois « 5 par jour » pour l'offre gratuite, un fait de 2025 portant sur un produit reconstruit depuis.

Le vrai sujet chez Gemini, c'est son palier bon marché, pas un palier gratuit. Google publie les allocations de ses formules sous forme de multiplicateurs plutôt que de quotas, avec des limites qui se rechargent toutes les cinq heures, et ses propres pages de formules placent Deep Research sur les paliers payants. Ce qui fait de Google le meilleur rapport qualité-prix, ce n'est pas une allocation gratuite, c'est qu'AI Plus coûte 4,99 $ par mois, bien en dessous du prix d'entrée de tous les autres.

Claude n'a pas de Research gratuit, mais ce n'est pas non plus réservé à Pro. Research est indisponible sur la formule gratuite et disponible sur toutes les formules payantes : Pro à 20 $, Max à 100 ou 200 $, plus Team et Enterprise. Les versions antérieures de ce guide le décrivaient comme réservé à Pro, ce qui sous-estimait qui y a droit.

Concrètement : il n'existe plus d'outil de recherche approfondie sur lequel s'appuyer pour du vrai travail sans payer. Si vous ne payez que pour un seul, AI Plus de Gemini à 4,99 $ est la voie la moins chère vers un agent en tête des benchmarks, et Perplexity Pro à 20 $ offre le meilleur volume pour le prix. Si vous voulez la sortie la plus fouillée sur des questions ambiguës, ChatGPT Plus à 20 $ vous donne OpenAI Deep Research plus tout le reste du paquet. Claude Pro a surtout du sens si vous utilisez déjà Claude pour lire et écrire et que vous voulez un seul abonnement.


Quel outil pour quelle tâche

Après des centaines de requêtes passées dans tous ces outils, des schémas nets se dégagent. Voici comment j'orienterais le travail aujourd'hui.

Revue de littérature académique. Claude Research. Le contexte d'un million de tokens compte quand l'agent doit tenir plus de 20 articles à la fois, et Claude distingue nettement mieux des affirmations superficiellement semblables. Les exécutions durent plus longtemps, mais une revue de littérature n'est pas urgente.

Dimensionnement de marché et intelligence concurrentielle. OpenAI Deep Research. La profondeur du raisonnement sur les questions stratégiques ambiguës se voit clairement ici. C'est celui auquel je fais le plus confiance pour les consignes du type « aidez-moi à comprendre ce secteur ».

Récupération factuelle la plus difficile. Gemini Deep Research Max. Si les leaders des benchmarks vous apprennent une chose, c'est que le palier à effort élevé de Google est l'agent commercialisé le plus fort pour dénicher des faits obscurs à plusieurs sauts. Utilisez le palier Max délibérément, puisque le palier standard est un produit sensiblement différent.

Briefings rapides avant une réunion. Perplexity. Les rapports sont plus courts et plus encyclopédiques, ce qui est exactement ce qu'on veut quand on cherche à s'orienter plutôt qu'à lire une dissertation.

Recherche portant sur vos propres documents. Gemini Deep Research. L'intégration à Workspace est la vraie barrière à l'entrée. Si la moitié de votre matériau source est dans Drive, Gmail et de vieilles notes de réunion, rien d'autre ne soutient la comparaison.

Intégrations développeur et exécutions en masse. La Deep Research API de Google est désormais le choix clé en main, puisque la gamme Sonar de Perplexity est retirée le 27 septembre 2026 et qu'OpenAI n'a plus de modèle de recherche dédié. Si vous voulez la main sur le formatage des citations et sur le coût, construisez la boucle vous-même sur Exa, Tavily ou la Research API de You.com.

Recherche bon marché et à gros volume au sein d'un produit. Un modèle de milieu de gamme associé à un bon fournisseur de recherche et à un budget de tours généreux. Les données de benchmark ci-dessus disent que cela vous donne l'essentiel de la justesse pour une fraction du coût, et c'est la configuration que la plupart des fonctionnalités en production livrent réellement.

Synthèse de preuves contradictoires. Claude. Quand les sources divergent, Claude est le plus disposé à faire apparaître le désaccord plutôt qu'à choisir un camp prématurément.

Un schéma qui pourrait surprendre : aucun outil unique ne domine. Pour le travail à fort enjeu, je passe la même consigne dans deux agents. Cela coûte environ 40 $ par mois pour deux abonnements, et la sortie est nettement meilleure que celle de l'un ou l'autre pris seul. Si vous vous demandez plus largement quelle place l'IA doit prendre dans vos études ou votre travail, les modes d'étude IA comparés traitent la question voisine.


La pièce manquante : transformer les rapports de recherche en savoir exploitable

Voici ce que presque aucun article comparatif ne mentionne. Le rapport produit par l'agent est une matière première, et la recherche n'est pas terminée tant que vous ne l'avez pas lu correctement.

Une sortie de 20 pages de Claude Research ou un rapport de 15 pages d'OpenAI Deep Research est le début du travail, pas la fin. Lisez-le une fois, survolez la conclusion, fermez l'onglet, et vous aurez payé un agent pour résumer quelque chose que vous n'avez pas réellement appris. Une étude du MIT Media Lab de 2025 (suivie dans notre analyse de l'impact de l'IA sur l'apprentissage) a mesuré l'activité EEG de personnes rédigeant des dissertations avec et sans ChatGPT, et a constaté un engagement cognitif nettement plus faible dans le groupe assisté. C'était une petite prépublication portant sur l'écriture plutôt que sur la lecture, mais la direction qu'elle indique est celle que reconnaît tout gros utilisateur d'IA.

Le remède est ce que les chercheurs font depuis des siècles : annoter. Surlignez les affirmations qui comptent. Signalez les sources que vous voulez vérifier. Reliez les idées d'un rapport à l'autre.

C'est là que le surligneur web de Glasp s'insère dans le flux de travail. Lancez votre recherche sur OpenAI, Perplexity, Gemini ou Claude. Collez le rapport dans une page lisible. Surlignez directement dans le navigateur à mesure que vous lisez. Vos surlignages se synchronisent avec votre bibliothèque Glasp, consultable et organisée, aux côtés de tout ce que vous avez lu ce mois-ci.

Quelques flux de travail précis qui fonctionnent :

Surlignez, puis relancez la requête. Lisez le rapport, surlignez les 10 à 15 affirmations les plus importantes. Recollez ces surlignages dans le même agent avec « creusez davantage ces points précis ». Itératif plutôt qu'en une seule passe.

Empilez les rapports par sujet. Quand vous étudiez le même sujet avec deux outils (disons OpenAI et Claude), surligner les deux rapports dans Glasp vous laisse voir où ils convergent et où ils divergent. Les désaccords sont souvent les passages les plus intéressants.

Utilisez YouTube à côté du texte. Quand les meilleures sources sont des podcasts ou des conférences, YouTube Summary vous donne des résumés au niveau de la transcription, horodatés. Associer un rapport de recherche approfondie en texte à 3 ou 4 conférences YouTube annotées couvre un sujet plus complètement que l'un ou l'autre pris seul.

Discutez avec vos surlignages. Le chat IA de Glasp peut répondre à vos questions en s'appuyant sur vos annotations comme source. C'est toute la différence entre « qu'a dit l'agent à propos de X ? » et « qu'ai-je moi-même conclu à propos de X ? ».

Publiez ce que vous avez appris. La communauté de Glasp regorge de gens qui étudient des sujets voisins. Partager des rapports surlignés est un moyen de se forcer à terminer une recherche, au lieu d'en empiler toujours plus. Pour un guide pas à pas, voir Comment annoter des articles correctement.

Un rapport lu une seule fois est un reçu, pas du savoir. L'étape « surligner et annoter » est ce qui convertit la sortie d'un agent en quelque chose que vous savez vraiment.


Foire aux questions

Quel outil de recherche approfondie est le plus précis ?

Parmi les quatre grands, Gemini Deep Research Max de Google mène avec 54,6 % à Humanity's Last Exam (Google, avril 2026). Attention au nom : le palier Deep Research standard a obtenu 50,4 % au même test, et la plupart des articles comparatifs citent le chiffre de Max sous le nom de produit simple. Le Kimi K3 de Moonshot revendique un chiffre encore supérieur, à 56,0 %. Ce sont toutes des déclarations d'éditeurs, et lors de tests indépendants une configuration modèle plus recherche que personne ne vend a dépassé tous les agents commercialisés. À l'usage, les écarts de précision entre les meilleurs outils sont plus faibles que ne le suggèrent les classements.

Quelle est la meilleure alternative à ChatGPT Deep Research ?

Pour la plupart des gens, Gemini Deep Research, qui affiche les meilleurs résultats de benchmarks publiés et l'entrée payante la moins chère à 4,99 $ par mois, ou Perplexity, plus large et plus rapide. Si vous voulez sortir des quatre grands : Kimi de Moonshot possède un mode Deep Research bien documenté, celui de Mistral est le moins cher des challengers à 14,99 $ par mois, et Grok de xAI propose un mode multi-agent. Si vous voulez auto-héberger, GPT Researcher et DeerFlow de ByteDance sont les options open source activement maintenues. Évitez open_deep_research de LangChain, archivé en août 2026, et STORM de Stanford, qui n'a pas fusionné de pull request depuis plus d'un an.

Quelle est la meilleure API de recherche approfondie ?

Les modèles Deep Research de Google sur l'Interactions API, pour la plupart des équipes. C'est la seule API de recherche clé en main d'un laboratoire de pointe qui ne soit pas en cours de retrait, elle publie une estimation de prix par tâche d'environ 1 à 3 $ (ou 3 à 7 $ pour Max), et elle documente un vrai budget temps. L'Agent API de Perplexity est le point de chute naturel si vous utilisez déjà Sonar, puisque sonar-deep-research n'est plus pris en charge après le 27 septembre 2026. Si vous voulez la main sur le formatage des citations et sur le coût, construisez la boucle vous-même sur Exa, Tavily ou You.com plutôt que d'acheter un rapport fini.

Quelle est l'API de recherche approfondie la plus rapide ?

Google est le plus rapide de ceux qui publient un chiffre : la plupart des tâches Deep Research se terminent en moins de 20 minutes, avec un plafond à 60. Personne d'autre ne publie de chiffre de latence actuel, ce qui constitue en soi une réponse. OpenAI se contente de « quelques dizaines de minutes », et les 2 à 4 minutes de Perplexity remontent à son lancement de février 2025. S'il vous faut de la vitesse, le levier est l'effort, pas le fournisseur : chacune de ces API expose désormais un curseur de palier, et les paliers bas répondent en quelques secondes à quelques minutes. Pour obtenir des résultats sourcés bruts en quelques secondes à injecter dans votre propre modèle, les niveaux d'effort bas d'Exa, Tavily et You.com sont la voie rapide.

Combien de temps durent les exécutions de recherche approfondie ?

En s'en tenant aux chiffres publiés par les éditeurs : Google annonce que la plupart des tâches se terminent en moins de 20 minutes et plafonne les exécutions à 60. Moonshot annonce de 10 à 25 minutes pour Kimi. La page de lancement d'OpenAI indique toujours 5 à 30 minutes, une phrase qu'elle n'a pas révisée depuis février 2025, et les 2 à 4 minutes de Perplexity datent du même mois. Anthropic se contente de dire que les réponses de Research arrivent « en quelques minutes ». Traitez les chiffres les plus anciens comme historiques, car les trois produits ont été reconstruits depuis.

Puis-je utiliser les outils de recherche approfondie via une API ?

Oui, et les options ont substantiellement changé en 2026. Les modèles Deep Research de Google sur l'Interactions API sont l'option clé en main, facturés environ 1 à 3 $ par tâche et 3 à 7 $ pour le palier Max. Le sonar-deep-research de Perplexity était le favori des développeurs mais n'est plus pris en charge après le 27 septembre 2026, remplacé par les préréglages d'effort de l'Agent API. OpenAI a retiré ses modèles dédiés o3-deep-research et o4-mini-deep-research le 23 juillet 2026 : vous exécutez donc désormais un modèle phare sur la Responses API avec l'outil de recherche web, ou vous utilisez son Agents API, en bêta publique depuis septembre 2026. Anthropic n'a aucune API estampillée recherche mais propose bien Claude Managed Agents en bêta, facturé aux tokens plus 0,08 $ par heure de session. Exa, Tavily et You.com sont les options populaires à construire soi-même.

Quelle API de recherche approfondie offre les meilleures citations ?

Google et Perplexity renvoient d'emblée des rapports entièrement sourcés. Pour les systèmes en production qui doivent relier chaque affirmation à une URL, les équipes construisent en général sur Exa, Tavily ou You.com, qui renvoient des résultats attribués à leurs sources et que vous injectez dans votre propre modèle : vous maîtrisez ainsi le formatage et pouvez afficher une piste d'audit. N'importe quel modèle doté d'un outil de recherche web peut citer en ligne si vous le lui demandez. Gardez en tête ce que dit la recherche indépendante sur le sujet : le meilleur système évalué traitait pleinement moins de 11 % des items de grille relatifs aux citations, et la présence de citations ne garantit donc pas qu'elles soient suffisantes.

Existe-t-il un outil de recherche approfondie gratuit ?

À peine, et cela a empiré en 2026. OpenAI est le seul des quatre à encore accorder aux comptes gratuits une allocation de recherche approfondie, décrite comme « limitée » et sans quota publié. Perplexity a placé Deep Research derrière Pro, Claude ne l'a jamais offert gratuitement, et Google le réserve à ses formules payantes. Pour un usage régulier, les points d'entrée réalistes sont Gemini AI Plus à 4,99 $ ou une formule à 20 $ chez l'un des trois grands. Si vous voulez quelque chose de vraiment gratuit et que cela ne vous dérange pas de le faire tourner vous-même, les agents open source évoqués plus haut sont la réponse honnête.

Comment éviter les hallucinations dans les rapports de recherche approfondie ?

Trois tactiques pratiques. Premièrement, cliquez au moins sur les trois à cinq premières sources citées et confirmez que l'affirmation s'y trouve réellement, car mal citer une vraie source est bien plus fréquent qu'en inventer une fausse. Deuxièmement, passez la même consigne dans un second outil ; les désaccords sont en général l'endroit où l'un des deux s'est trompé. Troisièmement, si vous intégrez cela dans un logiciel, faites de la vérification une étape de pipeline distincte plutôt qu'une ligne dans votre consigne : extrayez chaque affirmation, vérifiez-la dans un contexte vierge, puis faites contester les verdicts par une passe sceptique. C'est le schéma sur lequel les cookbooks publiés d'OpenAI et d'Anthropic ont convergé.

Les outils de recherche approfondie peuvent-ils lire mes documents privés ?

Gemini Deep Research offre l'intégration la plus profonde, avec un accès natif à vos Gmail, Drive et Docs moyennant autorisation. Claude prend en charge les connecteurs Google Workspace. OpenAI Deep Research peut lire les fichiers que vous téléversez pendant une session mais ne s'intègre pas directement au stockage cloud. Perplexity travaille avant tout sur le web. Si votre matériau source réside en grande partie dans Google Workspace, Gemini est le choix évident.

Quelle est la meilleure façon de sauvegarder et de réutiliser les rapports de recherche approfondie ?

Exportez le rapport en PDF ou en Markdown, ouvrez-le dans une vue lisible, et surlignez-le comme vous le feriez de n'importe quel long article. Glasp est conçu exactement pour ce flux de travail : les surlignages se synchronisent dans une bibliothèque que vous pouvez interroger, relier à d'autres surlignages et revisiter. Sans étape de surlignage, la plupart des rapports de recherche approfondie sont lus une fois puis oubliés. Cela rejoint ce que les pédagogues appellent l'effet de génération : une information que vous traitez activement se retient bien mieux qu'une information reçue passivement.


Conclusion : la pile de recherche, pas l'outil de recherche

Dix-neuf mois après le lancement d'OpenAI, la catégorie s'est clarifiée, puis a commencé à se réorganiser. Les agents de recherche approfondie ne forment pas un marché où le vainqueur rafle tout. C'est un assemblage où la bonne réponse dépend de ce que vous étudiez, du temps dont vous disposez, de l'endroit où vit votre matériau source, et du fait que vous cliquiez sur un bouton ou appeliez une API.

S'il fallait n'en retenir qu'un pour la plupart des travailleurs du savoir aujourd'hui, ce serait Gemini : les meilleurs résultats de benchmarks publiés, l'entrée payante la moins chère à 4,99 $, et la seule API de recherche d'un laboratoire de pointe qui ne soit pas sur un compte à rebours de retrait. Pour du travail plus lourd ou plus ambigu, associez-le à OpenAI Deep Research ou à Claude Research. Les développeurs qui quittent Sonar devraient regarder l'Agent API de Perplexity avant le 27 septembre.

Le changement de fond est structurel. Le modèle de recherche approfondie dédié est en voie de disparition dans tous les laboratoires : OpenAI a retiré ses modèles de recherche, Perplexity retire Sonar, Google livre un agent plutôt qu'un modèle, Anthropic livre un harnais managé, et xAI vous fait choisir un nombre d'agents. Ce qui les a remplacés, c'est un curseur d'effort. Bonne nouvelle pour qui construit, car l'effort est un paramètre réglable à chaque requête, et c'est pourquoi la trouvaille de benchmark la plus utile de 2026 a été qu'augmenter un budget de recherche déplaçait la justesse de 53 points à modèle constant.

Mais le choix de l'outil compte moins que ce que vous faites de sa sortie. La plus grosse erreur que je vois commettre est de traiter un rapport de recherche approfondie comme un travail fini. Il ne l'est pas. C'est une matière première. Le vrai savoir se construit quand vous surlignez les affirmations qui comptent, que vous les reliez à d'autres choses que vous avez lues, et que vous y revenez plus tard, quand le sujet ressurgit.

C'est le flux de travail pour lequel Glasp est conçu. Surlignez n'importe quel rapport, n'importe quel article, n'importe quelle transcription YouTube. Construisez une bibliothèque consultable de ce que vous avez jugé important. Discutez avec vos surlignages plus tard, quand vous avez besoin de retrouver un point précis. Partagez votre travail avec d'autres personnes qui mènent la même recherche.

Les agents de recherche approfondie continueront de s'améliorer, et les API de se multiplier. Ceux qui n'ajoutent pas aussi une couche de surlignage par-dessus continueront de produire des rapports lus une fois puis oubliés. Ne construisez pas votre flux de recherche 2026 autour d'un seul outil. Construisez-le autour d'une pile, et assurez-vous que le dernier maillon de cette pile est celui où votre propre compréhension se trouve consignée.

Commencez cette semaine par passer une vraie question de recherche dans deux des quatre outils. Surlignez les deux rapports. Comparez ce que vous avez appris. Voilà le flux de travail. Tout le reste n'est qu'une liste de fonctionnalités.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it