AI

Deep-Research-Tools: OpenAI vs Perplexity vs Gemini

Jedes große KI-Labor liefert inzwischen einen "Deep Research"-Agenten aus, und die meisten stellen zusätzlich eine Recherche-API bereit. Alle versprechen Berichte auf Doktorniveau innerhalb von Minuten. Nach anderthalb Jahren echter Nutzung sind die Unterschiede konkreter, als das Marketing nahelegt, und sie liegen selten dort, wohin die Benchmarks zeigen.

29 Min. Lesezeit
Wichtige Erkenntnisse
    • Perplexity Deep Research läuft nicht mehr auf Sonar: Seit Februar 2026 läuft es auf Claude Opus, und seit Juni 2026 wird es innerhalb von Perplexity Computer ausgeführt. Die sonar-deep-research-API, die Perplexity zum Liebling der Entwickler machte, wird am 27. September 2026 eingestellt.
  • Das dedizierte "Deep-Research-Modell" verschwindet: OpenAI, Perplexity, Google, Anthropic und xAI haben die einzelne Recherche-Modell-ID allesamt durch eine Agenten-Session plus einen Aufwandsregler ersetzt. Effort-Stufen sind das neue Produkt.
  • Google führt bei den großen vier in den veröffentlichten Benchmarks: Deep Research Max meldete 54,6 % bei Humanity's Last Exam gegenüber 50,4 % für die Standardstufe (Google, April 2026), und Moonshots Kimi K3 beansprucht einen noch höheren Wert als beide. Lesen Sie die Stufenbezeichnungen genau, denn die Anbieter tun es selten.
  • Das Suchbudget schlägt die Modellwahl: In Tests Dritter erreichte ein und dieselbe Konfiguration 35,8 % bei BrowseComp mit einem Suchlimit von einer Runde und 89,0 % bei 25 Runden. Gleiches Modell, gleicher Benchmark.
  • Die kostenlosen Stufen wurden vager, nicht besser: OpenAIs Hilfecenter nannte im Lauf von 2026 keine Deep-Research-Kontingente pro Tarif mehr, und am 10. September wurden neue Anmeldungen für den 200-$-Pro-Tarif pausiert. Geminis AI Plus für 4,99 $ ist inzwischen der günstigste kostenpflichtige Einstieg aller Frontier-Labore.
  • Der Bericht ist nicht das Ergebnis, Ihr Verständnis ist es: Wer einen Deep-Research-Agenten mit einem Markier-Workflow wie Glasp kombiniert, verwandelt 20-seitige Berichte in nutzbares Wissen statt in einmal gelesene PDFs.

Der Deep-Research-Moment

Für die meisten Menschen ist Gemini Deep Research im September 2026 die beste Allround-Wahl: die stärksten veröffentlichten Benchmarks und der günstigste kostenpflichtige Einstieg für 4,99 $. Perplexity Pro für 20 $ bietet das beste Volumen fürs Geld, und OpenAI und Claude liefern die tiefsten Berichte bei mehrdeutigen Aufgaben. Entwickler sollten mit Googles Deep Research API beginnen, der einzigen schlüsselfertigen Option, die kein Abkündigungsdatum hat, denn Perplexity stellt sonar-deep-research am 27. September 2026 ein, und OpenAI hat seine dedizierten Recherche-Modelle im Juli abgeschaltet.

Der Rest dieses Leitfadens zeigt, wie sich diese Urteile über Preise, Benchmarks, APIs und echte Aufgaben hinweg halten.

Die Kategorie selbst ist noch keine zwei Jahre alt. Am 2. Februar 2025 kündigte OpenAI Deep Research an. Es war der erste Agent, den die meisten Menschen je benutzt hatten, der aus einem Ein-Satz-Prompt eine 30-minütige Untersuchung planen, eigenständig Dutzende Quellen durchsehen und mit einem belegten Bericht zurückkehren konnte.

Die Reaktion der Branche war aufschlussreich. Innerhalb von sechs Wochen brachte Perplexity sein eigenes Deep Research heraus (14. Februar) und öffnete wenige Wochen später die Sonar-Deep-Research-API für Entwickler. Google, das Gemini Deep Research im Dezember 2024 leise gestartet hatte, beschleunigte den Rollout und baute den technischen Unterbau kontinuierlich aus. Anthropic gab die Websuche von Claude am 7. Mai 2025 allgemein frei und schnürte die Research-Funktion im selben Frühjahrsfenster mit hinein.

Vier Labore, eine Produktkategorie, zwei Quartale. So etwas passiert nicht zufällig. 2024 war das Jahr, in dem Kontextfenster die Marke von 200K Token überschritten, Tool-Nutzung zuverlässig wurde und agentische Schleifen aufhörten, auf halbem Weg still zu scheitern. Deep Research war die erste verbraucherorientierte Anwendung, die alle drei Dinge ihr Geld wert erscheinen ließ. Es hängt eng mit der breiteren Verschiebung hin zu Agenten-Protokollen zusammen, die wir in Das agentische Web: MCP, A2A und die Protokollkriege behandeln.

Wenn Sie schreiben, studieren, Märkte analysieren oder Produkte bewerten, sind Sie bereits im Nachteil, falls Sie keines dieser Tools nutzen. Die Frage ist, welches und wann.


Was "Deep Research" tatsächlich tut

Deep Research lässt sich leicht mit Chat-Suche verwechseln. Sie tippen eine Frage, Sie erhalten eine Antwort mit Links. Die Mechanik ist jedoch eine andere.

Eine Chat-Suche (etwa das normale ChatGPT mit Browsing) führt ein oder zwei Web-Anfragen aus und fasst die besten Treffer in Sekunden zusammen. Ein Deep-Research-Agent tut eher das, was ein Junior-Analyst an einem Nachmittag leistet. Er zerlegt Ihre Frage in Teilfragen, führt Dutzende oder Hunderte Suchen aus, liest ganze Seiten, folgt Quellenangaben, passt seinen Plan an, während er dazulernt, und erzeugt einen strukturierten Bericht mit Fußnoten.

Fragen Sie die Chat-Suche "Was sind die wichtigsten Kritikpunkte an der Phillips-Kurve?", erhalten Sie eine Zusammenfassung in drei Absätzen. Stellen Sie einem Deep-Research-Agenten dieselbe Frage, erhalten Sie einen 15-seitigen Bericht über Friedmans Hypothese der natürlichen Arbeitslosenquote, den Stagflationsbruch der 1970er, Revisionen durch rationale Erwartungen, die Debatten über die Verflachung nach 2008 und aktuelle Arbeiten aus den Jahren 2023 bis 2025, jeweils mit anklickbarer Quelle.

Der Preis dafür ist Zeit. Läufe dauern Minuten bis zu einer Stunde, und Google ist der einzige Anbieter, der ein Budget veröffentlicht: die meisten Aufgaben innerhalb von 20 Minuten, hart gedeckelt bei 60. Genau das ist der Punkt. Sie stellen einen Lauf in die Warteschlange, arbeiten an etwas anderem und kommen zu einem Bericht zurück, für dessen manuelle Erstellung Sie einen halben Tag gebraucht hätten. Mehr zum Umbau von Recherchegewohnheiten rund um KI-Agenten finden Sie in Einen KI-gestützten Forschungsworkflow aufbauen.


Direktvergleich: Die 4 Consumer-Tools

Hier die Matrix, mit Modellunterbau und Preisen, abgelesen von den Seiten der Anbieter selbst im September 2026. Eine Spalte hat sich seit der ersten Fassung dieses Leitfadens stärker verändert als jede andere: die Spalte "zugrundeliegendes Modell", die bei drei von vier Anbietern inzwischen ein bewegliches Ziel ist.

ToolZugrundeliegendes Modell (Sept. 2026)Preis und ZugangVeröffentlichte Laufzeit
OpenAI Deep ResearchNicht offengelegt; "standardmäßig das neueste Modell"Free und Go (8 $/Monat): begrenzt; Plus (20 $/Monat): erweitert; Pro (ab 100 $/Monat): maximal5 bis 30 Min. (OpenAI, Feb. 2025)
Perplexity Deep ResearchClaude Opus, geroutet innerhalb von Perplexity ComputerPro 20 $/Monat; Max 200 $/Monat2 bis 4 Min. (Perplexity, Feb. 2025)
Gemini Deep ResearchGemini 3.1 ProAI Plus 4,99 $/Monat; AI Pro 19,99 $/Monat; AI Ultra ab 99,99 $/Monat20 Min. typisch, 60 Min. Obergrenze (API)
Claude ResearchNicht offengelegtAlle kostenpflichtigen Tarife: Pro 20 $/Monat, Max 100 oder 200 $/Monat, Team, EnterpriseNicht veröffentlicht

In dieser Tabelle steht häufiger "nicht veröffentlicht" als früher, und das ist der ehrliche Stand der Dinge. Nur Google veröffentlicht ein hartes Zeitbudget für ein aktuelles Produkt. OpenAIs vielzitierte "5 bis 30 Minuten" stehen auf der Launch-Seite vom Februar 2025 und wurden nie erneut bestätigt. Perplexity veröffentlichte beim selben Launch 2 bis 4 Minuten und hat diese Angabe ebenfalls nicht aktualisiert, sodass die "unter 3 Minuten", die dieser Leitfaden früher abdruckte, eine Zahl aus dem Februar 2025 waren, die ein Produkt beschrieb, das seither zweimal neu gebaut wurde. Anthropic sagt lediglich, dass Research Antworten "in Minuten" liefert.

Die Kurzprofile in je einem Absatz:

OpenAI Deep Research ist weiterhin das Schwergewicht für mehrdeutige, offene Fragen. Die Berichte sind lang, und das Reasoning ist sichtbar tiefer, wenn die Frage keine saubere Antwort hat. Zwei Dinge änderten sich 2026. Die Preisseite nennt keine Laufzahlen mehr, sondern spricht von begrenzt, erweitert und maximal, sodass die weiterhin kursierenden Angaben "5 kostenlos, 25 bei Plus, 250 bei Pro" aus einem Blog-Update vom April 2025 stammen statt aus etwas, das OpenAI derzeit pro Tarif veröffentlicht. Und am 10. September 2026 pausierte OpenAI neue Anmeldungen für den 200-$-Pro-Tarif. Es gibt zwei Pro-Stufen: 100 $ schalten die 5-fache Plus-Nutzung frei und 200 $ die 20-fache, und durch die Pause bleibt 100 $ der höchste Tarif, den ein Neukunde kaufen kann.

Perplexity Deep Research ist dasjenige, dem der Motor unter der Haube ausgetauscht wurde. Es startete auf Perplexitys eigenen Sonar-Modellen. Seit Februar 2026 läuft der Modus Advanced Deep Research auf Claude Opus, wobei Max-Abonnenten eine neuere Opus-Revision erhalten als Pro-Abonnenten, und am 11. Juni 2026 verlagerte Perplexity Deep Research in Perplexity Computer, das Teilaufgaben über mehr als 20 Frontier-Modelle verteilt. Perplexity schreibt den Sprung von 40,7 % auf 83,8 % bei BrowseComp diesem Architekturwechsel zu und nicht dem Modelltausch. Wenn Sie einen Artikel lesen, der Perplexity Deep Research als "Sonar"-Produkt bezeichnet, wurde er vor Februar 2026 geschrieben. Sonar ist heute der Name der API-Linie, nicht des Consumer-Agenten.

Gemini Deep Research hat die stärksten veröffentlichten Ergebnisse der großen vier. Google rüstete den Agenten im April 2026 auf Gemini 3.1 Pro auf, teilte ihn in eine Standard- und eine Max-Stufe und machte beide über eine echte API zugänglich. Er zieht weiterhin neben dem Web auch aus Ihrem Gmail, Drive und Docs und zeigt einen sichtbaren Rechercheplan, den Sie vor dem Lauf bearbeiten können. Google veröffentlicht Kontingente als Multiplikatoren statt als Stückzahlen, was Ihnen immerhin sagt, was ein Upgrade bringt.

Claude Research ist das geduldige Werkzeug, gut darin, widersprüchliche Quellen nebeneinander stehen zu lassen, statt sie zu früh aufzulösen. Zwei Korrekturen lohnen sich: Research ist in jedem kostenpflichtigen Claude-Tarif verfügbar (Pro, Max, Team und Enterprise), nicht nur in Pro, und Anthropics Portfolio ist über Sonnet 5 und Opus 5 hinausgewachsen und umfasst inzwischen Claude Fable 5.1, veröffentlicht am 1. September 2026. Anthropic sagt nicht, welches Modell Research in den Apps antreibt. Dokumentiert ist hingegen, dass Claude 4.6 und neuer den vollen 1M-Token-Kontext zum Standardpreis mitbringen, sodass große Quellensammlungen weder gekürzt noch mit Aufschlägen belegt werden.


Alternativen zu ChatGPT Deep Research: Wer sonst einen Agenten liefert

"ChatGPT Deep Research Alternative" ist einer der häufigsten Wege, auf denen Menschen bei diesem Thema landen, und der obige Vierervergleich beantwortet das nicht. Hier ist, wer im September 2026 sonst noch tatsächlich einen Recherche-Agenten ausliefert, und wer nur so aussieht.

HerausfordererProdukt und APIEinstiegspreisDas unterscheidende Detail
xAI GrokMulti-Agenten-Modus; grok-4.20-multi-agent (Beta)SuperGrok 30 $/MonatVeröffentlicht weder HLE- noch BrowseComp-Wert
Moonshot KimiDeep Research (Kimi-Researcher); kein Endpunkt dafürPlus 19 $/MonatVeröffentlicht Telemetrie pro Lauf, die sonst niemand zeigt
ManusAutonomer Agent, Wide Research; aufgabenförmige REST-API20 $/Monat (4.000 Credits)Veröffentlicht keinen benannten öffentlichen Benchmark
You.comConsumer-Produkt weitgehend verschwunden; Research API12 $ pro 1.000 (lite)Fünf Effort-Stufen über eine Preisspanne von 100x
MistralDeep-Research-Skill in Vibe; kein eigenständiger EndpunktPro 14,99 $/MonatGünstigste kostenpflichtige Stufe außerhalb der großen vier
DeepSeekWebsuche in der App; nichts Agentisches in der APIKostenlosDie API ignoriert jedes Tool, das Sie ihr übergeben

xAI Grok hat still umbenannt, wonach alle weiterhin suchen. "DeepSearch" und "DeeperSearch" tauchen in xAIs Entwicklerdokumentation nirgends mehr auf. Was es jetzt gibt, ist ein Multi-Agenten-Modell, grok-4.20-multi-agent, weiterhin als Beta gekennzeichnet, bei dem reasoning.effort 4 Agenten bei niedrigem oder mittlerem Aufwand auswählt und 16 bei hohem oder sehr hohem. Die Doku sagt unmissverständlich, dass man für Deep Research 16 nehmen soll. Der Haken für alle, die nach Qualität vergleichen: xAI veröffentlichte für das zugrundeliegende Grok 4.6 weder einen Wert für Humanity's Last Exam noch für BrowseComp oder GAIA, sodass es nichts gibt, was man in die übliche Benchmark-Tabelle eintragen könnte. Gemeldet werden immerhin 81,6 % bei DeepSearchQA, wo es sowohl gegen GPT-5.5 als auch gegen Claude Opus verliert.

Moonshots Kimi ist der bestdokumentierte Herausforderer und derjenige, den die meisten Menschen außerhalb Asiens nie ausprobiert haben. Der Deep-Research-Modus läuft auf einem hauseigenen Kimi-Researcher-Modell, und Moonshot veröffentlicht Telemetrie pro Aufgabe, die die amerikanischen Labore nicht liefern: durchschnittlich 23 Reasoning-Schritte, 74 geplante Such-Keywords und 206 gefundene URLs pro Aufgabe, von denen nur die besten 3,2 % in den Bericht gelangen. Läufe dauern 10 bis 25 Minuten, und kostenpflichtige Stufen beginnen bei 19 $/Monat. Moonshot bietet Such- und Abruf-Endpunkte an, die Sie aufrufen können, aber nichts, was den Deep-Research-Agenten selbst freilegt, sodass das Recherche-Produkt rein für Endkunden ist.

Manus ist die interessante Unternehmensgeschichte und die dünnste technische. Meta übernahm das Unternehmen im Dezember 2025, Chinas NDRC blockierte den Deal am 27. April 2026, und Manus gab am 1. September 2026 bekannt, den unabhängigen Betrieb wieder aufgenommen zu haben. Der Modus Wide Research führt 20 Teilaufgaben gleichzeitig aus, auch wenn Sie ihn nicht manuell auslösen können. Wissenswert, bevor Sie sich darauf berufen: Manus veröffentlicht nirgends einen benannten öffentlichen Benchmark, sondern nur Diagramme, die als intern gekennzeichnet sind.

You.com hat den Consumer-Markt faktisch verlassen. ARI, der hauseigene Recherche-Agent, erscheint nicht mehr auf der Startseite, und auf der Preisseite gibt es kein Verbraucherabo. Geblieben ist eine wirklich gute Research API mit fünf Effort-Stufen von lite bis frontier, bepreist von 12 bis 1.200 $ pro tausend Anfragen. Eine Spanne von 100x auf einem einzigen Endpunkt ist die deutlichste Veranschaulichung von etwas, worauf diese ganze Kategorie zugelaufen ist, und der API-Abschnitt weiter unten greift es auf.

Mistral hat seinen Recherche-Agenten verschoben und die App um ihn herum umbenannt. Le Chat wurde im Mai 2026 zu Vibe, und Deep Research wurde im Chat-Tab abgeschaltet; wer heute einen Lauf startet, wird in den Work-Tab umgeleitet, mit vorausgewähltem Deep-Research-Skill. Mit 14,99 $/Monat ist Mistral Pro die günstigste kostenpflichtige Stufe außerhalb der großen vier, auch wenn Googles AI Plus für 4,99 $ sie unterbietet, und für europäische Teams mit Anforderungen an den Datenstandort ist Mistral oft die einzige Option, die den Einkauf passiert.

DeepSeek ist das nützliche negative Ergebnis. Trotz ständiger Aufnahme in Listen der "besten Deep-Research-Tools" liefert DeepSeek gar kein Deep-Research-Produkt. Die App hat Websuche und einen Think-Modus, doch die API-Dokumentation markiert web_search und jedes andere Tool als ignoriert, sodass es nichts Agentisches gibt, worauf man aufbauen könnte. Es ist ein exzellentes günstiges Reasoning-Modell, das Sie auf von Ihnen bereitgestellten Text ansetzen können, und es ist kein Recherche-Agent. Dasselbe gilt für Qoob und Arc Search, die beide in Vergleichsanfragen auftauchen und beide Schnellantwort-Suchapps sind, keine Agenten, die eine halbe Stunde lang planen und browsen.

Die Open-Source-Optionen und eine Warnung

Wenn Sie selbst hosten wollen, lautet die ehrliche Antwort für 2026, dass Wartung und Benchmark-Leistung inzwischen in verschiedenen Repositories liegen.

Aktiv gepflegt und als Einstieg geeignet: GPT Researcher (Apache-2.0, rund 29.500 Sterne, Releases bis August 2026) ist dasjenige, das Sie heute klonen und starten können, ohne vorher einen abgeschalteten Modellnamen in der Konfiguration ersetzen zu müssen. ByteDances DeerFlow ist mit rund 82.000 Sternen das mit Abstand größte und das günstigste zum Ausprobieren, denn es läuft ganz ohne Such-API-Schlüssel mit DuckDuckGo und einem schlüssellosen Reader, auch wenn die 2.0-Neufassung es als generelles Agenten-Gerüst neu positioniert hat, in dem Deep Research eine Fähigkeit unter vielen ist. Alibabas Tongyi DeepResearch ist die glaubwürdige Open-Weights-Option unter Apache-2.0, doch das Repository ist seit Februar 2026 still.

Nun die Warnung, denn zwei Projekte, die 2025 jede Empfehlungsliste anführten, sind tot und sehen nicht danach aus. LangChains open_deep_research wurde am 21. August 2026 archiviert. GitHub zeigt das Archiv-Banner, doch die README selbst enthält keinen Hinweis, sodass das Projekt für jeden, der aus einem Tutorial kommt, lebendig wirkt. Stanfords STORM hatte 2026 genau 146 eröffnete Pull Requests und exakt null davon gemerged; der letzte Commit stammt vom September 2025, und der dokumentierte Schnellstart hängt an der Bing Search API, die im August 2025 abgeschaltet wurde. Die STORM-Papers sind weiterhin lesenswert. Die Software sollte nicht Ihr Ausgangspunkt sein.

Unter den bekanntesten Projekten zeigt sich das Muster, dass die Open-Weight-Agenten mit konkurrenzfähigen Benchmark-Werten verstummt sind, während die weiterhin Code ausliefernden Projekte fast keine Benchmarks veröffentlichen. Wählen Sie nach Wartung und messen Sie dann selbst.

Wenn Ihre Recherche auf Dokumente begrenzt ist, die Sie bereits besitzen, statt auf das offene Web, dann ist das eine andere Werkzeugkategorie mit anderen Gewinnern, die wir in Gemini Notebook (früher NotebookLM) im Jahr 2026 behandeln.


Deep-Research-APIs: Was Sie tatsächlich aufrufen können

Das ist die Frage, die die Vergleichsartikel ständig überspringen, und diejenige, nach der Entwickler ständig suchen: Welche Deep-Research-Agenten können Sie aus eigenem Code aufrufen, was kosten sie, und wie gut sind die Quellenangaben? Das meiste davon änderte sich im Lauf von 2026, und eine der größten Änderungen fällt auf den 27. September 2026.

AnbieterDeep Research aufrufbar?Was Sie aufrufenPreis
Google GeminiJa, schlüsselfertigdeep-research-preview-04-2026 oder deep-research-max-preview-04-2026 über die Interactions APIca. 1 bis 3 $ pro Aufgabe; Max ca. 3 bis 7 $ pro Aufgabe (Preview-Tarife)
PerplexityJa, aber in MigrationAgent API POST /v1/agent mit Effort-Presets; sonar-deep-research endet am 27. Sept. 2026Legacy Sonar: 2 $/1M Eingabe, 8 $/1M Ausgabe, plus 2 $/1M Quellen- und 3 $/1M Reasoning-Token, plus 5 $ pro 1.000 Suchen
OpenAINicht als dediziertes ModellFlaggschiffmodell über die Responses API mit web_search und hohem Reasoning-Aufwand, oder die neue Agents APIModell-Token-Tarife plus web_search zu 10 $ pro 1.000 Aufrufe
Anthropic ClaudeKeine Research-gebrandete APIMessages API web_search-Tool oder Claude Managed Agents (Beta)10 $ pro 1.000 Suchen plus Token; Managed Agents zusätzlich 0,08 $ pro Session-Stunde
You.comJaResearch API, fünf Effort-Stufen12 $ (lite) bis 1.200 $ (frontier) pro 1.000
ExaSelbst bauenSearch-, Deep-Search- und Agent-EndpunkteSearch 7 $ pro 1.000; Deep Search 12 bis 15 $ pro 1.000; Agent 0,012 bis 1,00 $ pro Anfrage bei festem Aufwand
TavilySelbst bauenSearch- und Research-EndpunkteKostenlos 1.000 Credits/Monat; PAYG 0,008 $/Credit; Research-Läufe 4 bis 250 Credits

Vier Dinge stechen hervor.

Google ist jetzt die schlüsselfertige Option unter den Frontier-Laboren, und das ist eine Umkehr. Über den Großteil der Lebensdauer dieser Kategorie war Gemini Deep Research eine Consumer-Funktion, die Sie nicht programmatisch aufrufen konnten. Heute ist es das sauberste Angebot der großen vier: Sie rufen ein Deep-Research-Modell über die Interactions API auf, wobei background=true vorgeschrieben statt optional ist, und Google veröffentlicht sowohl eine geschätzte Preisspanne pro Aufgabe als auch ein echtes Zeitbudget. Der Enterprise-Zugang läuft über die Gemini Enterprise Agent Platform, die 2026 Vertex AI als Produktnamen dafür ablöste, ignorieren Sie also ältere Artikel, die Sie zu Vertex schicken.

Perplexitys schlüsselfertige API wird gerade jetzt abgeschaltet. sonar-deep-research war zwei Jahre lang die Antwort auf "Welche Deep-Research-API kann ich einfach aufrufen", und Perplexity kündigte im Juli 2026 an, dass die Sonar-Chat-Completions-Endpunkte am 27. September 2026 abgeschaltet werden. Der Ersatz ist die Agent API, bei der Sie POST /v1/agent senden und ein Effort-Preset wählen. Perplexity bildet das alte Deep-Research-Modell auf high ab und verweist für die besten Ergebnisse auf xhigh. Jeder Sonar-Preis in der obigen Tabelle gilt nur bis zum 27. September, wenn Sie also eine Umsetzung kalkulieren, kalkulieren Sie die Agent API. Beachten Sie außerdem, dass der Lebenszyklus seine Form geändert hat: Der alte asynchrone Endpunkt nutzte Großbuchstaben-Status wie IN_PROGRESS, während die Agent API einen anderen Satz in Kleinbuchstaben verwendet, was bedeutet, dass eine gegen das eine geschriebene Polling-Schleife am anderen still scheitert.

OpenAI verlagerte Deep Research in die Modelllinie und dann in einen verwalteten Agenten. Die dedizierten Modelle o3-deep-research und o4-mini-deep-research wurden im April 2026 als veraltet markiert und am 23. Juli 2026 abgeschaltet. Ihr Ersatzpfad ist ein aktuelles Flaggschiffmodell über die Responses API mit dem web_search-Tool im Hintergrundmodus. Seit dem 10. September 2026 gibt es zusätzlich eine verwaltete Agents API in öffentlicher Beta, bei der OpenAI die Session-Orchestrierung, die Kontextverdichtung und die Wiederherstellung für Sie übernimmt. Eine Falle, auf die hinzuweisen sich lohnt: OpenAIs eigene Deep-Research-Leitfadenseite und die Modellseite zu o3-deep-research sind beide veraltet und stellen diese Modelle weiterhin als verfügbar dar, im Widerspruch zur Deprecations-Seite. Vertrauen Sie der Deprecations-Seite.

Anthropic zwingt Sie nicht mehr, alles selbst zu bauen. Die alte Darstellung, die dieser Leitfaden früher abdruckte, lautete, dass Claude keine Recherche-API hat und Sie Ihre eigene Schleife zusammenbauen. Das ist überholt. Claude Managed Agents ist seit April 2026 in öffentlicher Beta: langlaufende Sessions, Server-Sent Events, Steuern und Unterbrechen, per Cron geplante Deployments sowie eingebaute Websuche, Web-Abruf und MCP, abgerechnet zu Token-Kosten plus 0,08 $ pro Session-Stunde. Anthropics eigenes durchgerechnetes Beispiel veranschlagt für eine einstündige Opus-Session deutlich unter einem Dollar, und der Web-Abruf kostet, anders als die Websuche, nichts. Ein Modell namens "Deep Research" gibt es weiterhin nicht, aber das Gerüst existiert.

Für die Frage nach der "besten API für Rechercheberichte mit Quellenangaben" funktionieren konkret drei Ansätze. Google und Perplexity liefern Quellenangaben ab Werk. You.com, Exa und Tavily liefern quellenattribuierte Ergebnisse, die Sie in Ihr eigenes Modell einspeisen, und genau darauf sind die meisten produktiven Recherche-Features tatsächlich gebaut, weil Sie damit Kosten und Zitationsformat kontrollieren. Und jedes Modell mit einem Websuch-Tool kann laufend zitieren, wenn Sie es entsprechend anweisen. Teams, die Prüfpfade brauchen, bevorzugen meist den Selbstbauweg, weil dort jede Behauptung auf eine von Ihnen abgerufene URL zurückgeht statt auf das Gedächtnis eines Modells. Warum Grounding und Retrieval-Qualität mehr zählen als reine Kontextgröße, lesen Sie in Context Rot: Warum RAG ein riesiges Kontextfenster weiterhin schlägt.

Zwei Eigentümerhinweise für alle, die sich einen Anbieter aussuchen, von dem sie abhängig sein werden. Tavily wurde im Februar 2026 vom KI-Cloud-Anbieter Nebius übernommen, die Einordnung als "unabhängige Such-API" braucht also ein Sternchen. Und Exa entfernte seinen /research-Endpunkt am 1. April 2026 und faltete ihn in /search mit einem deep-reasoning-Typ, was bedeutet, dass jedes Tutorial, das Ihnen den Aufruf von exa-research empfiehlt, kaputt ist.


Wie Sie Deep Research per API automatisieren

Eine dieser APIs aufzurufen ist nicht wie ein Chat-Completion-Aufruf. Läufe dauern Minuten bis zu einer Stunde, deshalb zwingt Sie jeder Anbieter zum Umgang mit Asynchronität, und alle machen es anders. Wenn Sie einen Recherche-Agenten in ein Produkt oder eine Pipeline verdrahten, ist das der Teil, der Sie einen Tag kostet.

Gehen Sie von Hintergrundausführung aus, nicht von einem blockierenden Aufruf. Google verlangt es rundheraus: Die Deep-Research-Modelle funktionieren nur mit background=true, und Sie pollen die Interaktion oder nehmen einen Stream wieder auf. OpenAI unterstützt den Hintergrundmodus auf der Responses API mit Polling, wiederaufnehmbarem Streaming und Webhooks nach der Standard-Webhooks-Spezifikation. Perplexity dokumentiert Polling und keine Webhooks. xAI ist der Ausreißer. background taucht im Schema auf, ist aber als nicht unterstützt gekennzeichnet, sodass der echte asynchrone Pfad dort die Batch-API ist, die innerhalb von 24 Stunden statt innerhalb von Minuten zurückkommt.

Budgetieren Sie pro Aufgabe, nicht pro Token, und prüfen Sie, was die Suche kostet. Suchaufschläge sind der Ursprung der Rechnungen für Recherche-APIs. Sie werden pro Aufruf bepreist, nicht pro Token. OpenAI verlangt 10 $ pro 1.000 Websuch-Aufrufe, Anthropic 10 $ pro 1.000 Suchen, Perplexity 5 $ pro 1.000 auf der auslaufenden Sonar-Deep-Research-Linie und xAI 5 $ pro 1.000 Tool-Aufrufe. Google gewährt Projekten auf kostenpflichtigen Stufen 5.000 kostenlose Grounding-Suchen pro Monat über seine Gemini-3.x-Modelle hinweg und verlangt danach 14 $ pro 1.000, und Deep-Research-Aufgaben schöpfen aus demselben Topf mit je rund 80 bis 160 Suchen, sodass etwa 60 Aufgaben ihn erschöpfen. Perplexitys eigene Beispielantwort ist das nützlichste veröffentlichte Rechenbeispiel: ein einzelner Deep-Research-Aufruf für 0,816 $, davon 71 % Reasoning-Token und nur 11 % Ausgabe. Der Bericht, den Sie lesen, ist der billigste Posten auf der Rechnung.

Rechnen Sie mit Effort-Stufen, denn sie haben die Modell-IDs ersetzt. Das ist die strukturelle Verschiebung, die sich hinter jeder einzelnen der obigen Änderungen verbirgt. OpenAI hat seine Recherche-Modelle zugunsten eines Flaggschiffs plus Reasoning-Aufwand ausgemustert. Perplexity mustert Sonar zugunsten von Agent-API-Presets aus. Google liefert Standard- und Max-Varianten. xAI lässt Sie über reasoning.effort zwischen 4 und 16 Agenten wählen. Exa, You.com und Tavily bepreisen alle dieselbe Form von Leiter, von einem günstigen Boden bis zu einer Decke pro Anfrage. Wenn Sie rund um diese APIs entwerfen, entwerfen Sie für einen Regler, den Sie pro Anfrage drehen können, nicht für einen Modellnamen, den Sie fest verdrahten.

Den Klärungsschritt müssen Sie selbst bauen. OpenAI sagt das ausdrücklich: Deep Research über die API enthält keinen Klärungs- oder Prompt-Umschreibeschritt, und das Modell erwartet von Anfang an einen vollständig ausformulierten Prompt. Die Consumer-Apps stellen Ihnen Rückfragen, bevor sie loslegen; die APIs nicht. Die übliche Lösung, die OpenAIs eigenes Cookbook vorführt, ist ein kleines günstiges Modell, das die Anfrage triagiert und in eine Rechercheanweisung umschreibt, bevor der teure Agent überhaupt startet.

Speziell beim Faktencheck ist die Verifikation eine Pipeline-Stufe und kein Prompt. In den veröffentlichten Cookbooks von OpenAI und Anthropic hat sich ein Muster eingespielt: Zerlegen Sie die Ausgabe in eigenständige Behauptungen, prüfen Sie jede Behauptung in ihrem eigenen sauberen Kontext, und lassen Sie anschließend einen separaten Skeptiker-Durchgang die Urteile anfechten. Anthropics Fassung begründet das unverblümt und merkt an, dass "überprüfen Sie Ihre Ergebnisse doppelt" eben auch nur eine Anweisung sei, die unter Kontextdruck übersprungen werde. Wenn Sie den Echtzeit-Faktenchecker bauen, nach dem alle suchen, ist diese Zerlegung die Architektur, und die Such-API darunter zählt weniger als die Struktur darum herum.


Deep-Research-Benchmarks: Was die Leaderboards zeigen

Drei Zahlen werden am häufigsten zitiert: Humanity's Last Exam, BrowseComp und SimpleQA. Sie sind nützlich, sie werden breit falsch zitiert, und sie tragen zwei strukturelle Probleme, die fast niemand erwähnt.

Beginnen wir mit dem ersten. Kein unabhängiges Leaderboard stellt die ausgelieferten Recherche-Agenten mit Tools gegeneinander in eine Rangfolge. Scales eigene Auswertung führt eine Variante ohne Tools aus, die Anbieter-Boards sind selbstgemeldet, und das eine ernstzunehmende Drittanbieter-Gerüst bewertet Modell-plus-Suche-Konfigurationen, die Sie nicht kaufen können, statt Produkte, die Sie kaufen können. Wenn Sie sehen, dass der Agent eines Anbieters "mit Tools" in den Fünfzigern oder Sechzigern punktet, lesen Sie das Gerüst, das Suchbudget und den Bewerter genau dieses Anbieters. Das macht die Zahlen nicht falsch. Es macht sie unvergleichbar.

Das zweite Problem ist die Stufenbezeichnung. Dieser Leitfaden druckte früher 54,6 % HLE und 85,9 % BrowseComp als "Gemini Deep Research". Beide Zahlen gehören zu Deep Research Max, Googles Stufe mit höherem Aufwand, gegenüber 50,4 % und 61,9 % für die Standardstufe. Das sind 24 Punkte Abstand bei BrowseComp zwischen zwei Produkten, die unter einem Namen verkauft werden, und Vergleichsartikel werfen sie ständig zusammen. Wissenswert ist, dass Google diese Werte in seiner Ankündigung vom April 2026 in einem Diagramm veröffentlichte statt als zitierbaren Text, was mit ein Grund dafür ist, dass sie weiter unten in der Kette verstümmelt werden.

Agent oder KonfigurationHLE (mit Tools)Gemeldet vonWann
Perplexity Sonar Deep Research21,1 %AnbieterFeb. 2025
OpenAI Deep Research (o3)26,6 %AnbieterFeb. 2025
Gemini Deep Research (3 Pro)46,4 %AnbieterDez. 2025
Gemini Deep Research (3.1 Pro)50,4 %AnbieterApr. 2026
Gemini Deep Research Max (3.1 Pro)54,6 %AnbieterApr. 2026
Kimi K3 (das Modell, nicht der Deep-Research-Agent)56,0 %AnbieterJul. 2026
Claude Opus 5 + Perplexity-Suche, 25 Runden77,4 %DritteAug. 2026

Bei dieser letzten Zeile lohnt es sich zu verweilen. Sie stammt aus OpenRouters eigenem Benchmark-Gerüst, das produktive Endpunkte laufen lässt, statt Anbieterangaben zu sammeln, und das Kosten und Latenz neben der Genauigkeit veröffentlicht: 0,46 $ pro Frage, 83 Sekunden, bei einer Stichprobe von 84 Fragen. Es ist kein Produkt, das Sie kaufen können. Es ist ein Modell plus ein Suchanbieter plus ein Rundenbudget, von Dritten zusammengesetzt, und es schlägt die selbstgemeldete Zahl jedes ausgelieferten Agenten. Eine Einschränkung dazu, wer hier misst: OpenRouter verkauft die meisten der Modelle und Suchmaschinen, die es bewertet, selbst weiter.

Der mit Abstand nützlichste Befund der ganzen Kategorie stammt aus demselben Gerüst. Bei BrowseComp erreichte eine Konfiguration 35,8 % mit einem Suchlimit von einer Runde und 89,0 % mit einem Limit von 25 Runden, in derselben Laufreihe. Gleiches Modell, gleicher Benchmark. Das Gerüst darum herum, genauer gesagt die Zahl der erlaubten Suchen, verschob das Ergebnis um 53 Punkte. Deshalb punktet ein schlichtes Browsing-Modell bei BrowseComp unter 2 %, während ein darauf gebauter Agent in den Achtzigern liegt, und deshalb ist "Welches Modell ist am klügsten" nahezu die falsche Frage. Kaufen Sie Suchbudget.

Auch die Kostenkurve ist flacher, als das Marketing suggeriert. In denselben Läufen kostete die beste BrowseComp-Konfiguration 0,99 $ pro Frage, während ein günstiges Modell mit demselben Suchanbieter 77,0 % bei 0,076 $ erreichte, also rund 13-mal günstiger bei 12 Punkten weniger Genauigkeit. Für die meiste reale Arbeit ist dieser Kompromiss offensichtlich richtig.

Die Benchmarks, die für Recherche-Agenten gebaut wurden

HLE und BrowseComp messen, ob ein Agent eine schwierige Tatsache finden kann. Sie messen nicht, ob der Bericht etwas taugt. Drei neuere Benchmarks tun das, und sie fallen weit weniger schmeichelhaft aus.

ResearchQA, ein unabhängiges akademisches Vorhaben mit 21.000 Anfragen und 160.000 Rubrik-Kriterien aus 75 Fachgebieten, in acht davon validiert durch 31 promovierte Annotatoren, stellte fest, dass keines der einfachen Sprachmodelle und keines der getesteten Retrieval-Systeme 70 % Rubrik-Abdeckung erreichte. Nur die eigens dafür gebauten Deep-Research-Agenten schnitten besser ab, und der beste von ihnen blieb bei 75,3 % stehen. Deutlicher noch: Dieses Spitzensystem behandelte unter 11 % der Zitations-Rubrik-Kriterien vollständig und rund die Hälfte der Kriterien zu Einschränkungen und Vergleichen. Agenten finden Quellen. Weit schlechter sind sie darin zu sagen, was die Quellen nicht belegen.

ResearchRubrics, gebaut auf über 2.800 Stunden Expertenarbeit, setzte sowohl Gemini Deep Research als auch OpenAI Deep Research unter 68 % durchschnittliche Rubrik-Erfüllung. DeepResearch Bench II, mit 9.430 binären Rubrik-Kriterien, destilliert aus investigativen Expertenartikeln, meldete im Januar 2026, dass selbst die stärksten Modelle weniger als die Hälfte davon erfüllten. Sein Live-Leaderboard ist seither über diese Marke geklettert, was der übliche Verlauf ist.

Zwei weitere Warnungen, bevor Sie eine dieser Zahlen zur Toolauswahl heranziehen. Welches Modell die Rubrik bewertet, verschiebt die Werte um mehr als zehn Punkte und kann die obersten beiden Plätze vertauschen, sodass jede Tabelle, die Bewerter vermischt, Ihnen etwas über Bewerter erzählt statt über Agenten. Und Agenten, die das lebende Web durchsuchen, können die Antworten eines Benchmarks selbst abrufen: Eine Studie von 2026 maß dadurch eine Aufblähung von bis zu 4 %. Googles veröffentlichte Evaluationsmethodik blockiert beim Testen inzwischen Seiten wie Hugging Face, was Ihnen sagt, dass das Problem real genug ist, um technisch gegenzusteuern.

SimpleQA verdient heute eher eine Fußnote als eine Schlagzeile. Perplexitys 93,9 % sind echt, stammen aber vom Februar 2025 und beschreiben ein Sonar-basiertes Produkt, das, wie oben beschrieben, in dieser Form nicht mehr existiert.

Der beständigste unabhängige Befund ist zugleich der älteste. Das Tow Center der Columbia Journalism Review testete acht KI-Suchmaschinen über 1.600 Anfragen hinweg und stellte fest, dass sie in mehr als 60 % der Fälle die richtige Information nicht abrufen konnten, mit Fehlerquoten von 37 % bis 94 % je nach Maschine. Diese Studie stammt vom März 2025, und das Tow Center hat keine Wiederholung in diesem Umfang veröffentlicht, was für sich genommen ein Kommentar dazu ist, wie dünn unabhängige Evaluation bleibt.

Die ehrliche Lesart: Benchmarks ordnen Tools am extrem schwierigen oberen Ende zuverlässig und darunter schlecht. Schicken Sie denselben echten Prompt durch zwei Tools auf deren günstigster kostenpflichtiger Stufe und vergleichen Sie. Benchmarks sind ein Hinweis. Ihr eigener Test ist ausschlaggebend. Für eine längere Begründung, warum Benchmark-Besessenheit in die Irre führt, siehe Die KI-Denkfalle.


Realitätscheck für kostenlose Stufen

Die Marketingseiten heben alle den kostenlosen Zugang hervor. Hier steht, was "kostenlos" im September 2026 tatsächlich bedeutet, und die ehrliche Antwort beginnt mit einem Eingeständnis: Die Zahlen wurden schwerer zu finden, nicht besser.

OpenAI ist der Einzige mit einem kostenlosen Kontingent, und es sagt nicht mehr, wie groß es ist. Die weiterhin kursierenden Angaben "5 kostenlos pro Monat, 25 bei Plus, 250 bei Pro" stammen aus einem Blog-Update vom April 2025. Die aktuelle Preisseite nennt "begrenzt" für den Free-Tarif und die Go-Stufe für 8 $/Monat, "erweitert" für Plus und "maximal" für Pro, und das Hilfecenter bestätigt einen Zähler im Produkt, der alle 30 Tage zurückgesetzt wird, ohne zu sagen, bei welchem Wert er startet. Die einzige derzeit veröffentlichte Zahl steht auf der Preisliste für Geschäftskunden, wo eine Deep-Research-Aufgabe 50 Credits kostet. Wenn Sie ein planbares Kontingent brauchen, ist das der am wenigsten planbare Anbieter.

Perplexity hat Deep Research hinter die Paywall verschoben. Kostenlose Konten erhalten Suche. Deep Research ist eine Pro-Funktion, und da es inzwischen innerhalb von Perplexity Computer läuft, ist es auf Pro und Max beschränkt. Dieser Leitfaden druckte früher "5 pro Tag" für die kostenlose Stufe, was eine Tatsache aus 2025 über ein Produkt war, das seither neu gebaut wurde.

Das Bemerkenswerte an Gemini ist die günstige Stufe, nicht eine kostenlose. Google veröffentlicht Tarifkontingente als Multiplikatoren statt als Stückzahlen, wobei sich die Limits alle fünf Stunden auffrischen, und die eigenen Tarifseiten setzen Deep Research auf die kostenpflichtigen Stufen. Was Google zur Preis-Leistungs-Wahl macht, ist kein kostenloses Kontingent, sondern dass AI Plus 4,99 $/Monat kostet, deutlich unter dem Einstiegspreis aller anderen.

Claude hat kein kostenloses Research, ist aber auch nicht Pro-exklusiv. Research ist im kostenlosen Tarif nicht verfügbar und in jedem kostenpflichtigen Tarif enthalten: Pro für 20 $, Max für 100 oder 200 $, dazu Team und Enterprise. Frühere Fassungen dieses Leitfadens beschrieben es als Pro-exklusiv, was zu eng gefasst war.

Die praktische Lesart: Es gibt kein Deep-Research-Tool mehr, auf das Sie sich für echte Arbeit stützen können, ohne zu zahlen. Wenn Sie nur für eines zahlen, ist Geminis AI Plus für 4,99 $ der günstigste Weg zu einem Benchmark-führenden Agenten, und Perplexity Pro für 20 $ bietet das beste Volumen fürs Geld. Wenn Sie die tiefste Ausgabe bei mehrdeutigen Fragen wollen, verschafft Ihnen ChatGPT Plus für 20 $ OpenAI Deep Research plus alles andere im Paket. Claude Pro ergibt am meisten Sinn, wenn Sie Claude ohnehin zum Lesen und Schreiben nutzen und ein einziges Abonnement wollen.


Welches Tool für welche Aufgabe

Nachdem ich Hunderte Anfragen durch all diese Tools geschickt habe, zeichnen sich klare Muster ab. So würde ich die Arbeit heute verteilen.

Wissenschaftliche Literaturübersicht. Claude Research. Der 1M-Token-Kontext zählt, wenn der Agent über 20 Arbeiten gleichzeitig halten muss, und Claude ist merklich besser darin, oberflächlich ähnliche Behauptungen zu unterscheiden. Die Läufe dauern länger, aber Literaturübersichten sind nicht zeitkritisch.

Marktdimensionierung und Wettbewerbsanalyse. OpenAI Deep Research. Die Tiefe des Reasonings bei mehrdeutigen strategischen Fragen kommt hier deutlich zum Tragen. Es ist dasjenige, dem ich bei Prompts der Art "Helfen Sie mir, diese Branche zu verstehen" am meisten vertraue.

Härteste faktische Recherche. Gemini Deep Research Max. Wenn die Benchmark-Führenden überhaupt etwas aussagen, dann dass Googles Stufe mit hohem Aufwand der stärkste ausgelieferte Agent beim Auffinden obskurer, mehrstufiger Fakten ist. Nutzen Sie die Max-Stufe bewusst, denn die Standardstufe ist ein spürbar anderes Produkt.

Kurzbriefings vor einem Meeting. Perplexity. Die Berichte sind kürzer und enzyklopädischer, und genau das wollen Sie, wenn Sie Orientierung brauchen statt eines Essays.

Recherche mit Ihren eigenen Dokumenten. Gemini Deep Research. Die Workspace-Integration ist der Burggraben. Wenn die Hälfte Ihres Quellenmaterials in Drive, Gmail und alten Besprechungsnotizen liegt, kommt nichts anderes heran.

Entwickler-Integrationen und Massenläufe. Googles Deep Research API ist jetzt die schlüsselfertige Wahl, da Perplexitys Sonar-Linie am 27. September 2026 abgeschaltet wird und OpenAI kein dediziertes Recherche-Modell hat. Wenn Sie Kontrolle über Zitationsformat und Kosten wollen, bauen Sie die Schleife selbst auf Exa, Tavily oder der Research API von You.com.

Günstige Recherche in hohem Volumen innerhalb eines Produkts. Ein Modell der mittleren Klasse, gepaart mit einem guten Suchanbieter und einem großzügigen Rundenbudget. Die obige Benchmark-Evidenz sagt, dass Sie damit den größten Teil der Genauigkeit zu einem Bruchteil der Kosten erhalten, und es ist die Konfiguration, die die meisten produktiven Features tatsächlich ausliefern.

Widersprüchliche Belege zusammenführen. Claude. Wenn Quellen sich widersprechen, ist Claude am ehesten bereit, den Widerspruch sichtbar zu machen, statt vorschnell Partei zu ergreifen.

Ein Muster, das manche überraschen dürfte: kein einzelnes Tool dominiert. Für Arbeiten mit hohem Einsatz schicke ich denselben Prompt durch zwei Agenten. Die Kosten liegen bei etwa 40 $/Monat für zwei Abonnements, und die Ausgabe ist merklich besser als die jedes einzelnen Tools. Wenn Sie breiter entscheiden, wie KI in Ihren Lern- oder Arbeitsalltag passt, behandelt KI-Lernmodi im Vergleich die angrenzende Frage.


Das fehlende Stück: Rechercheberichte in nutzbares Wissen verwandeln

Hier kommt, was fast kein Vergleichsartikel erwähnt. Der Bericht, den der Agent erzeugt, ist Rohmaterial, und die Recherche ist erst beendet, wenn Sie ihn richtig gelesen haben.

Eine 20-seitige Ausgabe von Claude Research oder ein 15-seitiger OpenAI-Deep-Research-Bericht ist der Anfang der Arbeit, nicht das Ende. Einmal lesen, das Fazit überfliegen, den Tab schließen, und Sie haben einen Agenten dafür bezahlt, etwas zusammenzufassen, das Sie gar nicht gelernt haben. Eine Studie des MIT Media Lab aus dem Jahr 2025 (verfolgt in unserer Analyse zu KI und Lernen) maß die EEG-Aktivität, während Menschen Essays mit und ohne ChatGPT schrieben, und fand deutlich geringere kognitive Beteiligung in der unterstützten Gruppe. Es war ein kleiner Preprint über das Schreiben statt über das Lesen, doch die Richtung, in die er zeigt, erkennt jeder Vielnutzer von KI wieder.

Die Abhilfe ist das, was Forschende seit Jahrhunderten tun: annotieren. Markieren Sie die Behauptungen, auf die es ankommt. Kennzeichnen Sie die Quellen, die Sie überprüfen wollen. Verknüpfen Sie Erkenntnisse über Berichte hinweg.

Genau hier passt Glasps Web-Highlighter in den Workflow. Führen Sie Ihre Recherche auf OpenAI, Perplexity, Gemini oder Claude aus. Fügen Sie den Bericht in eine lesbare Seite ein. Markieren Sie direkt im Browser, während Sie lesen. Ihre Markierungen synchronisieren sich in Ihre Glasp-Bibliothek, durchsuchbar und geordnet, neben allem anderen, was Sie in diesem Monat gelesen haben.

Ein paar konkrete Workflows, die funktionieren:

Markieren, dann erneut fragen. Lesen Sie den Bericht und markieren Sie die 10 bis 15 wichtigsten Behauptungen. Fügen Sie diese Markierungen mit "Gehen Sie bei diesen konkreten Punkten tiefer" zurück in denselben Agenten ein. Iterativ statt einmalig.

Berichte nach Thema stapeln. Wenn Sie dasselbe Thema mit zwei Tools recherchieren (etwa OpenAI und Claude), zeigt Ihnen das Markieren beider Berichte in Glasp, wo sie übereinstimmen und wo sie auseinandergehen. Die Widersprüche sind oft die interessantesten Stellen.

YouTube neben Text nutzen. Wenn die besten Quellen Podcasts oder Vorträge sind, liefert Ihnen YouTube Summary Zusammenfassungen auf Transkriptebene mit Zeitstempeln. Ein Deep-Research-Textbericht zusammen mit 3 bis 4 annotierten YouTube-Vorträgen deckt ein Thema gründlicher ab als jedes für sich.

Mit Ihren Markierungen chatten. Glasps KI-Chat kann Fragen beantworten und dabei Ihre Annotationen als Quelle nutzen. Das ist der Unterschied zwischen "Was hat der Agent über X gesagt?" und "Was habe ich selbst über X geschlossen?".

Veröffentlichen Sie, was Sie gelernt haben. Die Community auf Glasp ist voll von Menschen, die an ähnlichen Themen forschen. Markierte Berichte zu teilen, zwingt dazu, eine Recherche abzuschließen, statt immer nur neue anzustoßen. Eine Schritt-für-Schritt-Anleitung finden Sie in Wie man Artikel richtig annotiert.

Ein Bericht, den Sie einmal lesen, ist eine Quittung, kein Wissen. Der Schritt des Markierens und Annotierens ist es, der Agentenausgabe in etwas verwandelt, das Sie tatsächlich wissen.


Häufig gestellte Fragen

Welches Deep-Research-Tool ist am genauesten?

Unter den großen vier führt Googles Gemini Deep Research Max mit 54,6 % bei Humanity's Last Exam (Google, April 2026). Achten Sie auf den Namen: Die Standardstufe Deep Research erreichte im selben Test 50,4 %, und die meisten Vergleichsartikel zitieren die Max-Zahl unter dem schlichten Produktnamen. Moonshots Kimi K3 beansprucht mit 56,0 % einen noch höheren Wert. All das sind Selbstangaben der Anbieter, und in Tests Dritter übertraf eine Modell-plus-Suche-Konfiguration, die niemand verkauft, jeden ausgelieferten Agenten. In der Praxis sind die Genauigkeitsunterschiede zwischen den Spitzentools kleiner, als die Leaderboards nahelegen.

Was ist die beste Alternative zu ChatGPT Deep Research?

Für die meisten Menschen Gemini Deep Research, mit den besten veröffentlichten Benchmark-Ergebnissen und dem günstigsten kostenpflichtigen Einstieg für 4,99 $/Monat, oder Perplexity, das breiter und schneller ist. Wenn Sie etwas außerhalb der großen vier wollen: Moonshots Kimi hat einen gut dokumentierten Deep-Research-Modus, Mistrals Angebot ist mit 14,99 $/Monat das günstigste der Herausforderer, und xAIs Grok bietet einen Multi-Agenten-Modus. Wenn Sie selbst hosten wollen, sind GPT Researcher und ByteDances DeerFlow die aktiv gepflegten Open-Source-Optionen. Meiden Sie LangChains open_deep_research, im August 2026 archiviert, und Stanfords STORM, das seit über einem Jahr keinen Pull Request mehr gemerged hat.

Was ist die beste Deep-Research-API?

Für die meisten Teams Googles Deep-Research-Modelle über die Interactions API. Es ist die einzige schlüsselfertige Recherche-API eines Frontier-Labors, die nicht abgeschaltet wird, sie veröffentlicht eine Preisschätzung pro Aufgabe von rund 1 bis 3 $ (oder 3 bis 7 $ für Max), und sie dokumentiert ein echtes Zeitbudget. Perplexitys Agent API ist der natürliche Landeplatz, wenn Sie bereits Sonar nutzen, da sonar-deep-research am 27. September 2026 eingestellt wird. Wenn Sie Kontrolle über Zitationsformat und Kosten wollen, bauen Sie die Schleife selbst auf Exa, Tavily oder You.com, statt einen fertigen Bericht zu kaufen.

Was ist die schnellste Deep-Research-API?

Google ist der Anbieter mit der schnellsten dokumentierten Laufzeit: Die meisten Deep-Research-Aufgaben sind innerhalb von 20 Minuten fertig, gedeckelt bei 60. Niemand sonst veröffentlicht eine aktuelle Latenzangabe, was selbst schon die Antwort ist. OpenAI sagt nur "einige Dutzend Minuten", und Perplexitys 2 bis 4 Minuten stammen vom Start im Februar 2025. Wenn Sie Tempo brauchen, ist der Hebel der Aufwand, nicht der Anbieter: Jede dieser APIs bietet inzwischen einen Stufenregler, und die niedrigen Stufen liefern in Sekunden bis wenigen Minuten. Für rohe, belegte Ergebnisse in Sekunden, die Sie in Ihr eigenes Modell einspeisen, sind die niedrigeren Aufwandsstufen von Exa, Tavily und You.com der schnelle Weg.

Wie lange dauern Deep-Research-Läufe?

Nur mit von den Anbietern veröffentlichten Zahlen: Google sagt, die meisten Aufgaben seien innerhalb von 20 Minuten fertig, und deckelt Läufe bei 60. Moonshot gibt für Kimi 10 bis 25 Minuten an. OpenAIs Launch-Seite nennt weiterhin 5 bis 30 Minuten, ein Satz, der seit Februar 2025 nicht überarbeitet wurde, und Perplexitys 2 bis 4 Minuten stammen aus demselben Monat. Anthropic sagt lediglich, dass Research-Antworten "in Minuten" eintreffen. Behandeln Sie die älteren Zahlen als historisch, denn alle drei Produkte wurden seither neu gebaut.

Kann ich Deep-Research-Tools per API nutzen?

Ja, und die Optionen haben sich 2026 erheblich verändert. Googles Deep-Research-Modelle über die Interactions API sind die schlüsselfertige Option, bepreist mit rund 1 bis 3 $ pro Aufgabe und 3 bis 7 $ für die Max-Stufe. Perplexitys sonar-deep-research war der Liebling der Entwickler, wird aber am 27. September 2026 eingestellt und durch Effort-Presets der Agent API ersetzt. OpenAI schaltete seine dedizierten Modelle o3-deep-research und o4-mini-deep-research am 23. Juli 2026 ab, sodass Sie nun ein Flaggschiffmodell über die Responses API mit dem Websuch-Tool laufen lassen oder die Agents API nutzen, in öffentlicher Beta seit September 2026. Anthropic hat keine Research-gebrandete API, bietet aber Claude Managed Agents in der Beta an, abgerechnet nach Token plus 0,08 $ pro Session-Stunde. Exa, Tavily und You.com sind die beliebten Optionen zum Selbstbauen.

Welche Deep-Research-API hat die besten Quellenangaben?

Google und Perplexity liefern ab Werk vollständig belegte Berichte zurück. Für produktive Systeme, die jede Behauptung auf eine URL zurückführen müssen, bauen Teams meist auf Exa, Tavily oder You.com auf, die quellenattribuierte Ergebnisse liefern, welche Sie in Ihr eigenes Modell einspeisen, sodass Sie das Format steuern und einen Prüfpfad zeigen können. Jedes Modell mit einem Websuch-Tool kann inline zitieren, wenn Sie es entsprechend anweisen. Denken Sie dabei an die unabhängige Forschung: Das bestbewertete System behandelte unter 11 % der Zitations-Rubrik-Kriterien vollständig, das Vorhandensein von Quellenangaben ist also nicht dasselbe wie ausreichende Quellenangaben.

Gibt es ein kostenloses Deep-Research-Tool?

Kaum, und 2026 wurde es schlechter. OpenAI ist das einzige der vier, das kostenlosen Konten weiterhin ein Deep-Research-Kontingent gibt, beschrieben als "begrenzt" ohne veröffentlichte Stückzahl. Perplexity hat Deep Research hinter Pro verschoben, Claude hat es nie kostenlos angeboten, und Google setzt es auf die kostenpflichtigen Tarife. Für regelmäßige Arbeit sind die realistischen Einstiegspunkte Gemini AI Plus für 4,99 $ oder ein 20-$-Tarif bei einem der großen drei. Wenn Sie etwas wirklich Kostenloses wollen und nichts dagegen haben, es selbst zu betreiben, sind die oben behandelten Open-Source-Agenten die ehrliche Antwort.

Wie verhindere ich Halluzinationen in Deep-Research-Berichten?

Drei praktische Taktiken. Erstens: Klicken Sie mindestens die drei bis fünf wichtigsten zitierten Quellen an und bestätigen Sie, dass die Behauptung tatsächlich in der Quelle steht, denn eine echte Quelle falsch zu zitieren ist weit häufiger, als eine gefälschte zu erfinden. Zweitens: Schicken Sie denselben Prompt durch ein zweites Tool; Widersprüche zeigen meist, wo eines von beiden danebenlag. Drittens: Wenn Sie das in Software einbauen, machen Sie die Verifikation zu einer eigenen Pipeline-Stufe statt zu einer Zeile in Ihrem Prompt: jede Behauptung extrahieren, sie in sauberem Kontext prüfen, dann einen Skeptiker-Durchgang die Urteile anfechten lassen. Das ist das Muster, auf das die veröffentlichten Cookbooks von OpenAI und Anthropic zugelaufen sind.

Können Deep-Research-Tools meine privaten Dokumente lesen?

Gemini Deep Research hat die tiefste Integration, mit nativem Zugriff auf Gmail, Drive und Docs nach Erteilung der Berechtigung. Claude unterstützt Google-Workspace-Konnektoren. OpenAI Deep Research kann Dateien lesen, die Sie während einer Session hochladen, ist aber nicht direkt mit Cloud-Speicher verbunden. Perplexity arbeitet vorwiegend gegen das Web. Wenn Ihr Quellenmaterial größtenteils in Google Workspace liegt, ist Gemini die naheliegende Wahl.

Wie speichere und verwende ich Deep-Research-Berichte am besten wieder?

Exportieren Sie den Bericht als PDF oder Markdown, öffnen Sie ihn in einer Leseansicht und markieren Sie ihn wie jeden anderen langen Artikel. Glasp ist genau für diesen Workflow gebaut: Markierungen synchronisieren sich in eine Bibliothek, die Sie durchsuchen, mit anderen Markierungen verknüpfen und erneut aufsuchen können. Ohne einen Markierschritt werden die meisten Deep-Research-Berichte einmal gelesen und dann vergessen. Das hängt mit dem zusammen, was Lehrende den Generierungseffekt nennen: Informationen, die Sie aktiv verarbeiten, bleiben weit besser haften als Informationen, die Sie passiv aufnehmen.


Fazit: Der Recherche-Stack, nicht das Recherche-Tool

Neunzehn Monate nach OpenAIs Start hat sich die Kategorie geklärt und dann begonnen, sich neu zu ordnen. Deep-Research-Agenten sind kein Markt, in dem einer alles gewinnt. Sie sind eine Mischung, in der die richtige Antwort davon abhängt, was Sie recherchieren, wie viel Zeit Sie haben, wo Ihr Quellenmaterial liegt und ob Sie einen Knopf drücken oder eine API aufrufen.

Müsste ich gerade jetzt eines für die meisten Wissensarbeiter auswählen, wäre es Gemini: die besten veröffentlichten Benchmark-Ergebnisse, der günstigste kostenpflichtige Einstieg für 4,99 $ und die einzige Recherche-API eines Frontier-Labors ohne Abkündigungsdatum. Für schwerere oder mehrdeutigere Arbeit kombinieren Sie es mit OpenAI Deep Research oder Claude Research. Entwickler, die von Sonar migrieren, sollten sich vor dem 27. September Perplexitys Agent API ansehen.

Die tiefere Veränderung ist struktureller Art. Das dedizierte Deep-Research-Modell ist in jedem Labor auf dem Weg nach draußen: OpenAI hat seine Recherche-Modelle ausgemustert, Perplexity mustert Sonar aus, Google liefert einen Agenten statt eines Modells, Anthropic liefert ein verwaltetes Gerüst, und xAI lässt Sie eine Agentenzahl wählen. Was an ihre Stelle trat, ist ein Aufwandsregler. Das ist eine gute Nachricht für alle, die bauen, denn Aufwand ist ein Parameter, den Sie pro Anfrage justieren können, und deshalb lautete der nützlichste Benchmark-Befund von 2026, dass ein höheres Suchbudget die Genauigkeit um 53 Punkte verschob, während das Modell dasselbe blieb.

Doch die Toolwahl zählt weniger als das, was Sie mit der Ausgabe machen. Der größte Fehler, den ich bei Menschen sehe, ist, einen Deep-Research-Bericht als fertige Arbeit zu behandeln. Das ist er nicht. Er ist Rohmaterial. Das eigentliche Wissen entsteht, wenn Sie die wichtigen Behauptungen markieren, sie mit anderem Gelesenen verknüpfen und später darauf zurückkommen, wenn das Thema wieder auftaucht.

Genau für diesen Workflow ist Glasp gemacht. Markieren Sie jeden Bericht, jeden Artikel, jedes YouTube-Transkript. Bauen Sie eine durchsuchbare Bibliothek dessen auf, was Sie tatsächlich für wichtig hielten. Chatten Sie später mit Ihren Markierungen, wenn Sie sich an etwas Bestimmtes erinnern müssen. Teilen Sie Ihre Arbeit mit anderen, die dasselbe recherchieren.

Die Deep-Research-Agenten werden weiter besser, und die APIs werden sich weiter vermehren. Diejenigen, die keine Markierebene obendrauf bekommen, werden weiter Berichte produzieren, die einmal gelesen und dann vergessen werden. Bauen Sie Ihren Recherche-Workflow für 2026 nicht um ein einzelnes Tool herum. Bauen Sie ihn um einen Stack, und sorgen Sie dafür, dass das letzte Glied in diesem Stack dasjenige ist, in dem Ihr eigenes Verständnis festgehalten wird.

Fangen Sie damit an, diese Woche eine echte Rechercheanfrage durch zwei der vier Tools zu schicken. Markieren Sie beide Berichte. Vergleichen Sie, was Sie gelernt haben. Das ist der Workflow. Alles andere ist eine Featureliste.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it