ディープリサーチという転換点
2026年9月時点で、ほとんどの人にとって総合的なベストは Gemini Deep Research です。公開ベンチマークが最も強く、有料の入口も4.99ドルと最安だからです。月20ドルの Perplexity Pro は金額あたりの実行量が最も多く、曖昧な問いに対して最も深いレポートを返すのは OpenAI と Claude です。開発者はまず Google の Deep Research API から始めるべきでしょう。廃止のカウントダウンが動いていない唯一のターンキー選択肢だからです。Perplexity は2026年9月27日に sonar-deep-research を廃止し、OpenAI は7月に専用のリサーチモデルを停止しました。
このガイドの残りでは、こうした結論が価格、ベンチマーク、API、そして実際の仕事においてどこまで通用するのかを見ていきます。
このカテゴリー自体、まだ2年も経っていません。2025年2月2日、OpenAI は Deep Research を発表しました。1文のプロンプトを受け取り、30分の調査を計画し、自力で数十のソースを巡り、引用つきのレポートを返す。多くの人にとって、それは初めて触れるタイプのエージェントでした。
業界の反応は物語っていました。6週間以内に Perplexity は自社版の Deep Research を公開し(2月14日)、その数週間後には Sonar Deep Research API を開発者に開放します。2024年12月に Gemini Deep Research をひっそりと立ち上げていた Google は展開を加速させ、その基盤を更新し続けました。Anthropic は2025年5月7日に Claude のウェブ検索を一般提供し、同じ春の期間に Research 機能をパッケージ化しました。
4つのラボ、1つのプロダクトカテゴリー、2四半期。これは偶然ではありません。2024年は、コンテキストウィンドウが20万トークンを超え、ツール利用が安定し、エージェントのループが途中で黙って失敗しなくなった年でした。ディープリサーチは、その3つすべてに「お金を払う価値がある」と感じさせた最初の一般向けアプリだったのです。これはエージェンティックウェブ:MCP プロトコル戦争の内側で扱っている、エージェントプロトコルへの大きな潮流と密接に結びついています。
文章を書く人、学ぶ人、市場を分析する人、製品を評価する人であれば、これを使っていない時点ですでに不利です。問題はどれを、いつ使うかです。
「ディープリサーチ」が実際にやっていること
ディープリサーチはチャット検索と混同されがちです。質問を打ち込めばリンクつきの答えが返ってくる、という見た目は同じだからです。しかし中身の仕組みは違います。
チャット検索(ブラウジングを有効にした通常の ChatGPT など)は、ウェブ検索を1回か2回実行し、上位の結果を数秒で統合します。ディープリサーチエージェントがやることは、ジュニアアナリストが午後いっぱいかけてやる仕事に近いものです。質問をサブ質問に分解し、数十から数百回の検索を走らせ、ページを全文読み、引用をたどり、学びながら計画を更新し、脚注つきの構造化されたレポートを作り上げます。
チャット検索に「フィリップス曲線への主な批判は何か」と尋ねれば、3段落の要約が返ってきます。同じ質問をディープリサーチエージェントに投げれば、フリードマンの自然失業率仮説、1970年代のスタグフレーションによる破綻、合理的期待による修正、2008年以降のフラット化をめぐる論争、そして2023年から2025年の最近の論文までを網羅した15ページのレポートが返ってきます。しかもそれぞれにクリックできる出典がついています。
代償は時間です。実行には数分から1時間かかります。所要時間の目安を公開しているベンダーは Google だけで、ほとんどのタスクは20分以内、ハードな上限は60分としています。ですが、それこそが要点なのです。ひとつ投げておいて別の仕事をし、戻ってきたときには、手作業なら半日かかったはずのレポートができあがっています。AI エージェントを軸にリサーチの習慣を組み直す方法については、2026年版:AI を活用したリサーチワークフローの作り方をご覧ください。
直接対決:コンシューマー向け4ツール比較
以下が一覧表です。基盤モデルと価格は2026年9月時点のベンダー公式ページから読み取りました。このガイドの初版以降、他のどの列よりも変わったのが「基盤モデル」の列で、4社のうち3社では動く標的になっています。
| ツール | 基盤モデル(2026年9月) | 価格とアクセス | 公表されている実行時間 |
|---|---|---|---|
| OpenAI Deep Research | 非公開。「既定で最新モデル」 | Free と Go(月8ドル):Limited、Plus(月20ドル):Expanded、Pro(月100ドルから):Maximum | 5-30分(OpenAI、2025年2月) |
| Perplexity Deep Research | Claude Opus、Perplexity Computer 内でルーティング | Pro 月20ドル、Max 月200ドル | 2-4分(Perplexity、2025年2月) |
| Gemini Deep Research | Gemini 3.1 Pro | AI Plus 月4.99ドル、AI Pro 月19.99ドル、AI Ultra 月99.99ドルから | 通常20分、上限60分(API) |
| Claude Research | 非公開 | 全有料プラン:Pro 月20ドル、Max 月100または200ドル、Team、Enterprise | 未公表 |
この表には以前より「未公表」が増えていますが、それが正直な現状です。現行製品について明確な所要時間の上限を公開しているのは Google だけです。広く引用される OpenAI の「5分から30分」は2025年2月のローンチページに載ったままで、以後一度も言い直されていません。Perplexity の2分から4分も同じローンチ時の数字で、やはり更新されていません。つまり、このガイドが以前掲載していた「3分未満」は、その後2回作り直された製品を2025年2月の数字で説明していたことになります。Anthropic は Research が「数分で」答えを出すとしか述べていません。
それぞれを1段落でまとめると、次のようになります。
OpenAI Deep Research は、曖昧で答えの定まらない問いに対しては依然としてヘビー級です。レポートは長く、きれいな答えが存在しない問いほど推論の深さが目に見えて効いてきます。2026年に2つの変化がありました。ひとつは、価格ページが実行回数の記載をやめ、Limited、Expanded、Maximum という表記に変わったことです。いまだに出回っている「無料で5回、Plus で25回、Pro で250回」という数字は、2025年4月のブログ更新が出どころであって、OpenAI が現在プラン別に公開しているものではありません。もうひとつは、2026年9月10日に OpenAI が月200ドルの Pro ティアの新規登録を停止したことです。Pro には2つのティアがあり、100ドルで Plus の5倍、200ドルで20倍の利用枠が開きます。この停止により、新規顧客が購入できる最上位プランは100ドルのものになりました。
Perplexity Deep Research は、足元のエンジンが丸ごと入れ替わった製品です。ローンチ時は Perplexity 自社の Sonar モデルで動いていました。2026年2月以降、Advanced Deep Research モードは Claude Opus 上で動作しており、Max 加入者は Pro 加入者より新しい Opus のリビジョンを使えます。さらに2026年6月11日、Perplexity は Deep Research を Perplexity Computer の内部に移し、サブタスクを20を超えるフロンティアモデルに振り分けるようになりました。Perplexity は BrowseComp の40.7%から83.8%への跳ね上がりを、モデルの差し替えではなくこのアーキテクチャの変更に帰しています。Perplexity Deep Research を「Sonar」製品と呼んでいる記事を見かけたら、それは2026年2月より前に書かれたものです。Sonar はいまや API ラインの名称であって、コンシューマー向けエージェントの名前ではありません。
Gemini Deep Research は大手4社の中で最も強い公開結果を持っています。Google は2026年4月にエージェントを Gemini 3.1 Pro へ更新し、標準ティアと Max ティアに分割し、その両方を本物の API として公開しました。ウェブと並行して Gmail、Drive、Docs からも情報を引いてくる点は変わらず、エージェントが走り出す前に編集できるリサーチ計画も表示されます。Google は利用枠を回数ではなく倍率で公開しており、少なくともアップグレードで何が手に入るのかは分かります。
Claude Research は辛抱強いタイプで、矛盾するソースを早々に決着させず、並べたまま保持するのが得意です。訂正すべき点が2つあります。まず Research は Pro だけでなく、すべての有料 Claude プラン(Pro、Max、Team、Enterprise)で使えます。そして Anthropic のラインナップは Sonnet 5 と Opus 5 の先へ進み、2026年9月1日リリースの Claude Fable 5.1 を含むようになりました。アプリの Research をどのモデルが支えているのかを Anthropic は明かしていません。ただし文書化されているのは、Claude 4.6 以降が標準価格のまま100万トークンのフルコンテキストを備えているという点で、そのおかげで大きなソース群が切り詰められたり追加課金されたりすることはありません。
ChatGPT ディープリサーチの代替:他に誰が出しているのか
「ChatGPT ディープリサーチの代替」は、このテーマにたどり着く経路として最も多いもののひとつですが、上の4社比較ではその問いに答えられていません。ここでは、2026年9月時点で実際にリサーチエージェントを出しているのは誰か、そして出しているように見えるだけなのは誰かを整理します。
| 挑戦者 | 製品と API | 入口の価格 | 際立つ事実 |
|---|---|---|---|
| xAI Grok | マルチエージェントモード、grok-4.20-multi-agent(ベータ) | SuperGrok 月30ドル | HLE も BrowseComp もスコア未公開 |
| Moonshot Kimi | Deep Research(Kimi-Researcher)、専用エンドポイントなし | Plus 月19ドル | 他社が出さない実行単位のテレメトリを公開 |
| Manus | 自律エージェント、Wide Research、タスク型の REST | 月20ドル(4,000クレジット) | 名前のある公開ベンチマークを一切出さない |
| You.com | コンシューマー向け製品はほぼ消滅、Research API は健在 | 1,000件あたり12ドル(lite) | 価格差100倍にまたがる5段階の努力度ティア |
| Mistral | Vibe 内の Deep Research スキル、単独エンドポイントなし | Pro 月14.99ドル | 大手4社を除けば最安の有料ティア |
| DeepSeek | アプリにウェブ検索あり、API にエージェント機能なし | 無料 | API は渡したツールをすべて無視する |
xAI Grok は、みんながいまも検索しているあの機能を、ひっそりと改名しました。「DeepSearch」も「DeeperSearch」も、xAI の開発者ドキュメントのどこにも登場しません。いま存在するのはマルチエージェントモデル grok-4.20-multi-agent で、まだベータ表記のままです。reasoning.effort が low または medium なら4エージェント、high または xhigh なら16エージェントが選択されます。ドキュメントは、ディープリサーチには16を使えとはっきり書いています。品質で比較したい人にとっての落とし穴は、xAI が基盤となる Grok 4.6 について Humanity's Last Exam、BrowseComp、GAIA のいずれのスコアも公開していないことです。つまり、通常のベンチマーク表に載せる数字が存在しません。DeepSearchQA では81.6%を報告していますが、これは GPT-5.5 にも Claude Opus にも負けている数字です。
Moonshot の Kimi は最もよく文書化された挑戦者であり、同時にアジア圏外の人がまず使ったことのない存在でもあります。Deep Research モードは自社開発の Kimi-Researcher モデルで動き、Moonshot はアメリカのラボが出さないタスク単位のテレメトリを公開しています。1タスクあたり平均23の推論ステップ、74件の検索キーワードを計画し、206の URL を発見し、そのうちレポートに残るのは上位3.2%だけ、という具合です。実行には10分から25分かかり、有料ティアは月19ドルからです。Moonshot は呼び出せる検索と取得のエンドポイントを提供していますが、Deep Research エージェント自体を露出するものはありません。つまり、このリサーチ製品はコンシューマー専用です。
Manus はビジネスの物語としては面白く、技術的には最も中身の乏しい存在です。2025年12月に Meta が買収し、2026年4月27日に中国の国家発展改革委員会(NDRC)がこの取引を差し止め、2026年9月1日に Manus は独立した事業運営を再開したと発表しました。Wide Research モードは20のサブタスクを並行して走らせますが、手動で起動することはできません。引用する前に知っておくべきことがひとつあります。Manus は名前のついた公開ベンチマークをどこにも出しておらず、あるのは社内データとラベルされたチャートだけです。
You.com は事実上コンシューマー市場から撤退しました。リサーチエージェントの ARI はもうホームページに登場せず、価格ページに個人向けのサブスクリプションもありません。残っているのは、lite から frontier までの5段階の努力度を持つ、本当に出来の良い Research API です。価格は1,000リクエストあたり12ドルから1,200ドル。ひとつのエンドポイントで100倍の開きがあるというのは、このカテゴリー全体が収束してきた、ある性質の最も分かりやすい表れです。その話は次の API のセクションで拾います。
Mistral はリサーチエージェントを移動させ、そのアプリ自体も改名しました。Le Chat は2026年5月に Vibe となり、Chat タブの Deep Research は終了しました。いま起動しようとすると、Deep Research スキルがあらかじめ選択された状態で Work タブへリダイレクトされます。月14.99ドルの Mistral Pro は大手4社を除けば最安の有料ティアですが、Google の月4.99ドルの AI Plus はそれを下回ります。とはいえ、データ所在地の要件を抱えるヨーロッパのチームにとって、調達を通せる選択肢は Mistral だけ、ということもよくあります。
DeepSeek は有益な「陰性の結果」です。「ベストなディープリサーチツール」系の記事に必ず入っているにもかかわらず、DeepSeek はディープリサーチ製品を出していません。アプリにはウェブ検索と think モードがありますが、API ドキュメントは web_search をはじめとするすべてのツールを「無視される」と明記しています。つまり、エージェントとして組み上げる土台がありません。自分で与えたテキストに向けて使う安価で優秀な推論モデルではありますが、リサーチエージェントではないのです。同じことは Qoob と Arc Search にも言えます。どちらも比較の検索で頻繁に登場しますが、どちらも高速な回答検索アプリであって、30分かけて計画し閲覧するエージェントではありません。
オープンソースの選択肢と、ひとつの警告
自前でホストしたいなら、2026年の正直な答えはこうです。メンテナンスの継続性とベンチマーク性能は、いまや別々のリポジトリに分かれてしまっています。
活発にメンテナンスされていて、最初に試す価値があるもの。GPT Researcher(Apache-2.0、約29,500スター、2026年8月までリリース継続)は、設定ファイル内の廃止されたモデル名を差し替えることなく、今日クローンしてそのまま動かせる選択肢です。ByteDance の DeerFlow は約82,000スターで群を抜いて大きく、試すコストも最も安く済みます。DuckDuckGo とキー不要のリーダーを使い、検索 API キーをひとつも用意せずに動くからです。ただし2.0 での書き直しにより、ディープリサーチを数あるスキルのひとつとする汎用エージェントハーネスへと位置づけが変わりました。Alibaba の Tongyi DeepResearch は Apache-2.0 の信頼できるオープンウェイトの選択肢ですが、リポジトリは2026年2月以降沈黙しています。
ここからが警告です。2025年のおすすめリストで常に上位だった2つのプロジェクトが、死んでいるのにそう見えません。LangChain の open_deep_research は2026年8月21日にアーカイブされました。 GitHub にはアーカイブのバナーが出ますが、README 自体には何の告知もないため、チュートリアル経由でたどり着いた人にはこのプロジェクトが生きているように読めます。スタンフォードの STORM は2026年に146件のプルリクエストが開かれ、マージされたのはちょうどゼロ件です。最後のコミットは2025年9月で、ドキュメント化されたクイックスタートは2025年8月に廃止された Bing Search API に依存しています。STORM の論文はいまも読む価値があります。ソフトウェアを出発点にすべきではありません。
よく知られたプロジェクトを見渡すと、競争力のあるベンチマークスコアを出したオープンウェイトのエージェントは沈黙し、いまもコードを出し続けているものはベンチマークをほとんど公開しない、というパターンが見えます。メンテナンスの継続性で選び、性能は自分で測りましょう。
調べたい範囲がオープンなウェブではなく、すでに手元にある文書に限られるなら、それは勝者の顔ぶれが異なる別のツールカテゴリーです。その話は2026年の NotebookLMで扱っています。
ディープリサーチ API:実際に呼び出せるもの
比較記事がいつも飛ばしていて、開発者がいつも検索しているのがこの問いです。どのディープリサーチエージェントを自分のコードから呼べるのか、いくらかかるのか、引用の品質はどうなのか。その大半が2026年を通じて変わり、最大級の変更のひとつは2026年9月27日に訪れます。
| プロバイダー | ディープリサーチを呼べるか | 呼び出す対象 | 価格 |
|---|---|---|---|
| Google Gemini | はい、ターンキー | Interactions API 上の deep-research-preview-04-2026 または deep-research-max-preview-04-2026 | 1タスクあたり約1-3ドル、Max は約3-7ドル(プレビュー料金) |
| Perplexity | はい、ただし移行中 | 努力度プリセット付きの Agent API POST /v1/agent。sonar-deep-research は2026年9月27日にサポート終了 | 旧 Sonar:入力100万トークン2ドル、出力100万トークン8ドル、加えて引用100万トークン2ドルと推論100万トークン3ドル、さらに検索1,000件あたり5ドル |
| OpenAI | 専用モデルとしては提供なし | Responses API 上のフラッグシップモデルに web_search と高い推論努力度を組み合わせる、または新しい Agents API | モデルのトークン料金に加え、web_search が1,000コールあたり10ドル |
| Anthropic Claude | リサーチと銘打った API はなし | Messages API の web_search ツール、または Claude Managed Agents(ベータ) | 検索1,000件あたり10ドルとトークン料金。Managed Agents はセッション1時間あたり0.08ドルが加算 |
| You.com | はい | Research API、5段階の努力度 | 1,000件あたり12ドル(lite)から1,200ドル(frontier) |
| Exa | 自作型 | Search、Deep Search、Agent の各エンドポイント | Search は1,000件あたり7ドル、Deep Search は1,000件あたり12-15ドル、Agent は固定努力度でリクエストあたり0.012-1.00ドル |
| Tavily | 自作型 | Search と Research のエンドポイント | 月1,000クレジット無料、従量課金は1クレジット0.008ドル、Research の実行は4-250クレジット |
注目すべき点が4つあります。
いまやフロンティアラボのターンキー選択肢は Google であり、これは逆転です。 このカテゴリーの歴史のほとんどの期間、Gemini Deep Research はプログラムから呼べないコンシューマー機能でした。それが今では大手4社の中で最もきれいな選択肢になっています。Interactions API 上のディープリサーチモデルを呼び出す形で、background=true は任意ではなく必須です。そして Google は、タスクあたりの推定価格帯と実際の所要時間の上限の両方を公開しています。エンタープライズ向けのアクセスは Gemini Enterprise Agent Platform 経由で、これは2026年にこの用途の製品名として Vertex AI を置き換えたものです。Vertex を案内している古い記事は無視してください。
Perplexity のターンキー API は、まさにいま廃止されつつあります。 sonar-deep-research は2年間にわたって「とりあえず呼べるディープリサーチ API はどれか」への答えでしたが、Perplexity は2026年7月、Sonar の Chat Completions エンドポイントを 2026年9月27日 に廃止すると発表しました。後継は Agent API で、POST /v1/agent を呼び、努力度のプリセットを選びます。Perplexity は旧来のディープリサーチモデルを high に対応づけ、最良の結果には xhigh を勧めています。上の表にある Sonar の価格はすべて9月27日までしか有効ではないので、これから構築コストを見積もるなら Agent API で計算してください。ライフサイクルの形も変わっている点に注意してください。旧来の非同期エンドポイントは IN_PROGRESS のような大文字のステータスを使っていましたが、Agent API は別の小文字の一式を使います。つまり、片方に合わせて書いたポーリングループは、もう片方では静かに失敗します。
OpenAI はディープリサーチをモデルラインへ、そしてマネージドエージェントへと移しました。 専用の o3-deep-research と o4-mini-deep-research は2026年4月に非推奨となり、2026年7月23日に停止されました。代替の経路は、Responses API 上の現行フラッグシップモデルに web_search ツールを組み合わせ、バックグラウンドモードで動かすことです。2026年9月10日以降は、マネージドな Agents API もパブリックベータで提供されています。セッションのオーケストレーション、コンテキストの圧縮、リカバリーを OpenAI 側が担ってくれるものです。ひとつ注意すべき罠があります。OpenAI 自身のディープリサーチのガイドページと o3-deep-research のモデルページはどちらも古いままで、いまもこれらのモデルが利用可能であるかのように提示しており、非推奨一覧のページと矛盾しています。信じるべきは非推奨一覧のページです。
Anthropic はもう、すべてを自作させるわけではありません。 このガイドが以前掲載していた古い枠組みは、「Claude にリサーチ API はなく、ループは自分で組み立てる」というものでした。それはもう最新ではありません。Claude Managed Agents は2026年4月からパブリックベータです。長時間のセッション、Server-Sent Events、実行中の方向づけと中断、cron によるスケジュール実行、そして組み込みのウェブ検索、ウェブ取得、MCP を備え、課金はトークン費用に加えてセッション1時間あたり0.08ドルです。Anthropic 自身の計算例では、Opus での1時間のセッションが1ドルを大きく下回るとされています。またウェブ取得は、ウェブ検索と違って無料です。「ディープリサーチ」という名前のモデルは依然として存在しませんが、ハーネスはあるのです。
「引用つきのリサーチレポートに最適な API は何か」という問いに絞るなら、有効なアプローチは3つあります。Google と Perplexity は引用を最初から返してくれます。You.com、Exa、Tavily は出典が紐づいた結果を返すので、それを自分のモデルに流し込む形になります。これは実運用のリサーチ機能の大半が実際に採っているパターンで、コストと引用の書式を自分で制御できるからです。そして、ウェブ検索ツールを持つモデルであれば、プロンプトで指示すれば進行しながら引用を付けられます。監査証跡が必要なチームは自作のルートを好む傾向にあります。すべての主張が、モデルの記憶ではなく自分が取得した URL までたどれるからです。生のコンテキストサイズよりもグラウンディングと検索の品質が重要である理由については、Context Rot:なぜ巨大なコンテキストウィンドウより RAG なのかをご覧ください。
依存先のベンダーを選ぶ人向けに、所有関係についての注記が2つあります。Tavily は2026年2月に AI クラウドプロバイダーの Nebius に買収されたため、「独立した検索 API」という位置づけには注釈が必要です。また Exa は2026年4月1日に /research エンドポイントを廃止し、deep-reasoning タイプとして /search に統合しました。つまり、exa-research を呼べと書いてあるチュートリアルはすべて壊れています。
API でディープリサーチを自動化する方法
これらの API を呼ぶのは、チャット補完を呼ぶのとは違います。実行に数分から1時間かかるため、どのプロバイダーも非同期処理を避けて通らせてくれず、しかもそのやり方がそれぞれ違います。リサーチエージェントを製品やパイプラインに組み込むなら、ここが丸1日を持っていく部分です。
ブロッキング呼び出しではなく、バックグラウンド実行を前提にしてください。 Google はそれを明確に要求しています。ディープリサーチモデルは background=true でしか動かず、インタラクションをポーリングするか、ストリームを再開する形になります。OpenAI は Responses API でバックグラウンドモードに対応し、ポーリング、再開可能なストリーミング、そして Standard Webhooks 仕様に準拠したウェブフックを提供しています。Perplexity はポーリングを文書化していますが、ウェブフックはありません。xAI は例外です。スキーマには background が現れるものの「未対応」と記されており、実質的な非同期の経路はバッチ API になります。これは数分ではなく24時間以内に返ってくるものです。
トークンではなくタスク単位で予算を組み、検索の費用を確認してください。 リサーチ API の請求額が膨らむ原因は検索の追加料金にあります。これはトークン単位ではなくコール単位で課金されます。OpenAI はウェブ検索1,000コールあたり10ドル、Anthropic は検索1,000件あたり10ドル、Perplexity は廃止予定の Sonar ディープリサーチラインで1,000件あたり5ドル、xAI はツールコール1,000件あたり5ドルです。Google は有料ティアのプロジェクトに対して、Gemini 3.x 系モデル全体で月5,000回のグラウンディング検索を無料で提供し、それを超えると1,000件あたり14ドルを課金します。Deep Research のタスクは同じプールから1回あたりおよそ80回から160回の検索を消費するので、60タスク程度で枠を使い切ります。Perplexity 自身のサンプルレスポンスは、公開されている中で最も有用な計算例です。1回のディープリサーチ呼び出しが0.816ドルで、そのうち71%が推論トークン、出力はわずか11%でした。あなたが読むレポートは、請求書の中で最も安い部分なのです。
努力度のティアを前提にしてください。それがモデル ID を置き換えたからです。 これは、上で挙げた個々の変更の背後に隠れている構造的な転換です。OpenAI はリサーチ専用モデルを廃止し、フラッグシップと推論努力度の組み合わせに移りました。Perplexity は Sonar を廃止して Agent API のプリセットへ移行中です。Google は標準版と Max 版を提供しています。xAI は reasoning.effort を通じて4エージェントか16エージェントかを選ばせます。Exa、You.com、Tavily はいずれも、安い下限からリクエストあたりの上限まで、同じ形のはしごに価格を付けています。これらの API を前提に設計するなら、ハードコードするモデル名ではなく、リクエストごとに回せるダイヤルを前提に設計してください。
明確化のステップは自分で作る必要があります。OpenAI はこれを明言しています。API 経由のディープリサーチには明確化やプロンプト書き換えのステップが含まれず、モデルは完成したプロンプトが最初から渡されることを期待します。コンシューマー向けアプリは開始前に追加の質問をしてきますが、API はしません。標準的な対処法は、OpenAI 自身のクックブックが示しているとおり、小さく安価なモデルにリクエストを振り分けさせ、高価なエージェントが走り出す前にリサーチ用の指示へ書き換えさせることです。
ファクトチェックに限って言えば、検証はプロンプトではなくパイプラインの一段階です。OpenAI と Anthropic の公開クックブックの双方で、あるパターンが定着しています。出力を単独で成立する主張へ分解し、各主張をそれぞれきれいなコンテキストで検証し、その後に別個の懐疑役のパスで判定に異議を唱えさせる、というものです。Anthropic 版はその理由を率直に述べていて、「発見した内容をダブルチェックせよ」もまた単なる指示にすぎず、コンテキストが逼迫すると飛ばされてしまうと指摘しています。世間がずっと探し求めているリアルタイムのファクトチェッカーを作るなら、この分解こそがアーキテクチャであり、その下にある検索 API よりも、周囲の構造のほうが重要です。
ディープリサーチのベンチマーク:リーダーボードが示すもの
最もよく引用される数字は3つあります。Humanity's Last Exam、BrowseComp、そして SimpleQA です。これらは有用で、広く誤って引用されており、そしてほとんど誰も口にしない構造的な問題を2つ抱えています。
まず、1つ目から。出荷されているリサーチエージェント同士を、ツールありの条件で並べて順位づけする独立したリーダーボードは存在しません。 Scale 自身の評価はツールなしの条件で実施され、ベンダーのボードは自己申告で、唯一まともな第三者のハーネスが測っているのは、購入できる製品ではなく、購入できないモデルと検索の組み合わせです。あるベンダーのエージェントが「ツールあり」で50%台や60%台を記録しているのを見たとき、あなたが読んでいるのはそのベンダー自身のハーネス、検索予算、そして採点者です。だからといって数字が偽物になるわけではありません。比較できなくなるだけです。
2つ目の問題はティアのラベルです。このガイドは以前、HLE 54.6%と BrowseComp 85.9%を「Gemini Deep Research」として掲載していました。どちらの数字も、Google の高努力度ティアである Deep Research Max のもので、標準ティアはそれぞれ50.4%と61.9%です。ひとつの名前で売られている2つの製品のあいだに、BrowseComp で24ポイントの差があるということです。比較記事はこれを絶えず混同しています。知っておく価値があるのは、Google がこれらを2026年4月の発表でチャートとして公開し、引用できるテキストの形では出さなかったことです。下流で数字が崩れる一因はそこにあります。
| エージェントまたは構成 | HLE(ツールあり) | 報告元 | 時期 |
|---|---|---|---|
| Perplexity Sonar Deep Research | 21.1% | ベンダー | 2025年2月 |
| OpenAI Deep Research(o3) | 26.6% | ベンダー | 2025年2月 |
| Gemini Deep Research(3 Pro) | 46.4% | ベンダー | 2025年12月 |
| Gemini Deep Research(3.1 Pro) | 50.4% | ベンダー | 2026年4月 |
| Gemini Deep Research Max(3.1 Pro) | 54.6% | ベンダー | 2026年4月 |
| Kimi K3(Deep Research エージェントではなくモデル本体) | 56.0% | ベンダー | 2026年7月 |
| Claude Opus 5 + Perplexity 検索、25ターン | 77.4% | 第三者 | 2026年8月 |
腰を据えて考える価値があるのは、最後の行です。これは OpenRouter 自身のベンチマークハーネスによるもので、ベンダーの主張を集めるのではなく本番のエンドポイントを実際に走らせ、精度と並べてコストとレイテンシも公開しています。84問のサンプルで1問あたり0.46ドル、83秒です。これは購入できる製品ではありません。モデルと検索プロバイダーとターン予算を第三者が組み合わせたものであり、それが出荷済みのどのエージェントの自己申告値をも上回っています。測定者について注意点をひとつ。OpenRouter はベンチマーク対象のモデルと検索エンジンの多くを、自ら再販しています。
このカテゴリー全体で最も有用な発見も、同じハーネスから出ています。 BrowseComp において、同一の実行シリーズの中で、ある構成が検索1ターン制限で35.8%、25ターン制限で89.0%を記録しました。同じモデル、同じベンチマークです。周囲の足場、具体的には何回検索を許すかという設定だけが、結果を53ポイント動かしたのです。素のブラウジングモデルが BrowseComp で2%を下回る一方、その上に組んだエージェントが80%台を出すのはこれが理由で、「どのモデルが一番賢いか」がほぼ間違った問いである理由でもあります。買うべきは検索予算です。
コストの曲線も、マーケティングが示唆するより平坦です。同じ実行群において、BrowseComp のトップ構成は1問あたり0.99ドルでしたが、同じ検索プロバイダーと組み合わせた安価なモデルは0.076ドルで77.0%に達しました。精度は12ポイント低いだけで、費用はおよそ13分の1です。実務のほとんどでは、このトレードオフを選ぶのが明らかに正解です。
リサーチエージェントのために作られたベンチマーク
HLE と BrowseComp が測っているのは、エージェントが難しい事実を見つけられるかどうかです。レポートの出来が良いかどうかは測っていません。より新しい3つのベンチマークはそれを測っており、結果はずっと厳しいものになっています。
ResearchQA は、75分野にまたがる21,000件のクエリと160,000件のルーブリック項目を対象とした独立した学術的取り組みで、そのうち8分野については31名の博士号保持アノテーターが検証しています。その結果、テストした素の言語モデルと検索システムのうち、ルーブリックのカバー率70%に届いたものはひとつもありませんでした。それを上回ったのはディープリサーチ専用に作られたエージェントだけで、その最高でも75.3%止まりでした。さらに突き刺さるのは、そのトップのシステムでさえ、引用に関するルーブリック項目を完全に満たしたのは11%未満、限界と比較に関する項目はおよそ半分にとどまったことです。エージェントはソースを見つけてきます。しかし、そのソースが何を立証していないのかを述べることは、はるかに苦手なのです。
ResearchRubrics は2,800時間を超える専門家の労力の上に作られたベンチマークで、Gemini Deep Research と OpenAI Deep Research の両方を平均ルーブリック遵守率68%未満と評価しました。DeepResearch Bench II は、専門家による調査記事から抽出した9,430件の二値ルーブリックを持ち、2026年1月の時点で、最も強いモデルでさえその半分未満しか満たせないと報告しました。その後、ライブのリーダーボードはこの水準を超えて上昇しており、これはよくある軌跡です。
これらの数字をツール選びに使う前に、注意点がさらに2つあります。ルーブリックを採点するモデルが変わるだけでスコアは10ポイント以上動き、上位2つの順位が入れ替わることもあります。つまり、採点者が混在した表は、エージェントではなく採点者について語っているのです。そして、生きたウェブを閲覧するエージェントは、ベンチマーク自体の答えを取得できてしまいます。2026年のある研究は、これによる最大4%のスコアの水増しを計測しました。Google が公開している評価手法は現在、テスト中に Hugging Face のようなサイトをブロックしています。この問題が、対策を設計するに値するほど現実的だということです。
SimpleQA はいまや見出しではなく脚注に値します。Perplexity の93.9%は本物ですが、2025年2月の数字であり、上で述べたとおり、その形ではもう存在しない Sonar ベースの製品を説明したものです。
最も息の長い独立した知見は、同時に最も古いものでもあります。Columbia Journalism Review の Tow Center は8つの AI 検索エンジンを1,600件のクエリでテストし、60%を超える割合で正しい情報を取得できなかったことを発見しました。エラー率はエンジンによって37%から94%の幅がありました。この研究は2025年3月のもので、Tow Center はこの規模の再検証を公開していません。独立した評価がいかに手薄なままかを、それ自体が物語っています。
正直な読み方はこうです。ベンチマークは難易度の極端に高い領域ではツールを確実に順位づけしますが、そこから下ではひどく当てになりません。実際のプロンプトをひとつ用意し、最も安い有料ティアで2つのツールに通して比べてみてください。ベンチマークは示唆にすぎません。決め手はあなた自身のテストです。ベンチマークへの執着がなぜ判断を誤らせるのかについての長めの議論は、AI 思考の罠をご覧ください。
無料枠の現実
マーケティングページはどれも無料で使えることを強調します。2026年9月時点で「無料」が実際に何を意味するのかを見ていきましょう。正直な答えは、ひとつの告白から始まります。数字は良くなったのではなく、見つけにくくなったのです。
無料枠を持っているのは OpenAI だけで、しかもその大きさを示すのをやめました。 いまも出回っている「月5回無料、Plus で25回、Pro で250回」という数字は、2025年4月のブログ更新が出どころです。現在の価格ページは、Free と月8ドルの Go ティアが Limited、Plus が Expanded、Pro が Maximum と書いているだけです。ヘルプセンターは30日ごとにリセットされる製品内カウンターの存在を認めつつ、その初期値がいくつなのかは述べていません。現在公開されている唯一の数字はビジネス向けのレートカードにあり、ディープリサーチのタスク1件が50クレジットとされています。予測できる割り当てが必要なら、このベンダーが最も予測しにくい相手です。
Perplexity は Deep Research を有料の壁の向こうへ移しました。 無料アカウントで使えるのは検索です。Deep Research は Pro の機能であり、現在は Perplexity Computer の内部で動くため Pro と Max 限定です。このガイドは以前、無料ティアについて「1日5回」と書いていましたが、それはその後作り直された製品についての2025年の事実でした。
Gemini については、本当の話は無料枠ではなく安価なティアです。 Google はプランの割り当てを回数ではなく倍率で公開しており、上限は5時間ごとに回復します。そして自社のプランページでは Deep Research を有料ティアに置いています。Google を「お値打ち」の選択肢にしているのは無料枠ではなく、AI Plus が月4.99ドルという、他社の入口価格を大きく下回る点です。
Claude に無料の Research はありませんが、Pro 限定でもありません。 Research は無料プランでは使えず、すべての有料プランで使えます。月20ドルの Pro、月100ドルまたは200ドルの Max、さらに Team と Enterprise です。このガイドの以前の版は Pro 限定と説明していましたが、それは対象範囲を過小に伝えていました。
実務的な読み方はこうです。もはや、お金を払わずに本格的な仕事を任せられるディープリサーチツールは存在しません。ひとつだけ払うなら、ベンチマーク首位のエージェントに最も安くたどり着けるのは月4.99ドルの Gemini AI Plus で、金額あたりの実行量が最も多いのは月20ドルの Perplexity Pro です。曖昧な問いに対して最も深い出力がほしいなら、月20ドルの ChatGPT Plus が OpenAI Deep Research とバンドルの残り全部を買ってくれます。Claude Pro が最も理にかなうのは、すでに読み書きに Claude を使っていて、サブスクリプションをひとつにまとめたい場合です。
用途別のツールの選び方
これらすべてで数百件のクエリを走らせてみると、はっきりしたパターンが浮かび上がります。私ならいま、仕事をこう振り分けます。
学術文献レビュー。 Claude Research です。エージェントが20本以上の論文を同時に保持する必要があるとき、100万トークンのコンテキストが効いてきます。また Claude は、表面的に似ている主張を区別するのが目に見えて得意です。実行時間は長くかかりますが、文献レビューに時間的な切迫はありません。
市場規模の推定と競合インテリジェンス。 OpenAI Deep Research です。曖昧な戦略的問いに対する推論の深さが、ここではっきりと表れます。「この業界を理解する手助けをしてほしい」というプロンプトで、私が最も信頼しているのはこれです。
最も難しい事実の検索。 Gemini Deep Research Max です。ベンチマーク上位の顔ぶれが何かを示しているとすれば、それは Google の高努力度ティアが、無名でマルチホップな事実を見つけ出す点において出荷済み最強のエージェントだということです。Max ティアは意識して選んでください。標準ティアは実質的に別の製品です。
会議前の手短なブリーフィング。 Perplexity です。レポートは短めで百科事典的なので、論文ではなく状況把握がほしいときにちょうど合います。
自分の文書を含むリサーチ。 Gemini Deep Research です。Workspace 連携こそが他社に真似できない強みです。素材の半分が Drive、Gmail、昔の議事録の中にあるなら、他に比べられるものはありません。
開発者向けの統合と大量実行。 Google の Deep Research API がいまやターンキーの選択肢です。Perplexity の Sonar ラインは2026年9月27日に廃止され、OpenAI には専用のリサーチモデルがないからです。引用の書式とコストを自分で制御したいなら、Exa、Tavily、または You.com の Research API の上に自分でループを組みましょう。
製品に組み込む安価で大量のリサーチ。 中位のモデルに、良い検索プロバイダーと潤沢なターン予算を組み合わせる構成です。上で見たベンチマークの証拠は、これで精度の大半をごくわずかな費用で得られると示していますし、実運用の機能が実際に出荷しているのもほとんどこの構成です。
矛盾する証拠の統合。 Claude です。ソースが食い違っているとき、どちらかに早々に肩入れせず、その不一致そのものを表に出してくれる度合いが最も高いのが Claude です。
意外に思われるかもしれないパターンがひとつあります。支配的な単独のツールは存在しません。 重要度の高い仕事では、私は同じプロンプトを2つのエージェントに通します。サブスクリプション2つで月およそ40ドルですが、出力はどちらか単体より目に見えて優れています。AI を学習や仕事の習慣にもっと広くどう組み込むかを考えているなら、AI の学習モード比較が隣接する問いを扱っています。
欠けているピース:リサーチレポートを使える知識に変える
ここから先は、比較記事がほとんど触れない話です。エージェントが生み出すレポートは素材にすぎず、それをきちんと読み込むまでリサーチは終わっていません。
20ページの Claude Research の出力も、15ページの OpenAI Deep Research のレポートも、仕事の終わりではなく始まりです。一度読んで、結論を流し読みして、タブを閉じる。それでは、実際には学ばなかった何かを要約させるためにエージェントへお金を払っただけです。2025年の MIT メディアラボの研究(私たちの分析AI が学習に与える影響で追跡しています)は、ChatGPT を使う場合と使わない場合でエッセイを書く人の脳波を計測し、支援ありのグループで認知的な関与が著しく低いことを見出しました。これは読むことではなく書くことについての小規模なプレプリントですが、それが指し示す方向は、AI を使い込んでいる人なら誰でも思い当たるものです。
対処法は、研究者が何世紀も続けてきたことです。注釈をつけるのです。重要な主張にハイライトを引く。検証したいソースに印をつける。レポートをまたいで洞察をつなぐ。
ここに Glasp のウェブハイライターがワークフローの一部として収まります。リサーチは OpenAI、Perplexity、Gemini、Claude のどれで走らせてもかまいません。レポートを読みやすいページに貼り付けましょう。読みながら、ブラウザ上で直接ハイライトしましょう。引いたハイライトは Glasp のライブラリに同期され、その月に読んだ他のすべてと並んで、検索でき整理された形で残ります。
実際に機能する具体的なワークフローをいくつか紹介します。
ハイライトしてから、もう一度尋ねる。 レポートを読み、最も重要な10から15の主張にハイライトを引きます。そのハイライトを同じエージェントに貼り戻し、「これらの点をさらに掘り下げて」と指示します。一発勝負ではなく反復です。
トピックごとにレポートを重ねる。 同じテーマを2つのツール(たとえば OpenAI と Claude)で調べたとき、両方のレポートを Glasp でハイライトしておくと、どこで一致しどこで食い違うかが見えるようになります。不一致こそが最も面白い部分であることがよくあります。
テキストと並行して YouTube も使う。 最良のソースがポッドキャストや講演である場合、YouTube Summary がタイムスタンプ付きの文字起こしレベルの要約を提供します。テキストのディープリサーチレポートに、注釈をつけた3-4本の YouTube の講演を組み合わせると、どちらか単独よりも深くトピックを押さえられます。
ハイライトと対話する。 Glasp の AI チャットは、あなたの注釈をソースとして質問に答えてくれます。「エージェントは X について何と言っていたか」と「私は X について実際どう結論づけたか」の違いです。
学んだことを公開する。 Glasp のコミュニティには、似たテーマを調べている人がたくさんいます。ハイライトしたレポートを共有することは、リサーチをただ積み増すのではなく完了させるための強制力になります。手順ごとの解説は記事に正しく注釈をつける方法をご覧ください。
一度読んだだけのレポートは領収書であって、知識ではありません。エージェントの出力を、自分が本当に知っていることへと変換するのが、ハイライトして注釈をつけるという一手間です。
よくある質問
最も正確なディープリサーチツールはどれですか?
大手4社の中では、Google の Gemini Deep Research Max が Humanity's Last Exam で54.6%と首位です(Google、2026年4月)。この名前には注意してください。標準の Deep Research ティアは同じテストで50.4%であり、ほとんどの比較記事は Max の数字を無印の製品名のもとで引用しています。Moonshot の Kimi K3 はさらに高い56.0%を主張しています。これらはすべてベンダーの自己申告であり、第三者によるテストでは、誰も販売していないモデルと検索の組み合わせが、出荷済みのあらゆるエージェントを上回りました。実際に使ってみると、上位ツール間の精度差はリーダーボードが示唆するより小さいものです。
ChatGPT のディープリサーチの代替として最適なのは何ですか?
ほとんどの人にとっては Gemini Deep Research(公開ベンチマークの結果が最も良く、有料の入口が月4.99ドルと最安)か、より広く速い Perplexity です。大手4社の外がよければ、Moonshot の Kimi はよく文書化された Deep Research モードを持ち、Mistral は挑戦者の中で最安の月14.99ドル、xAI の Grok はマルチエージェントモードを提供しています。自前でホストしたいなら、活発にメンテナンスされているオープンソースの選択肢は GPT Researcher と ByteDance の DeerFlow です。2026年8月にアーカイブされた LangChain の open_deep_research と、1年以上プルリクエストをマージしていないスタンフォードの STORM は避けましょう。
最良のディープリサーチ API はどれですか?
ほとんどのチームにとっては、Interactions API 上の Google の Deep Research モデルです。フロンティアラボが提供するターンキーのリサーチ API の中で唯一廃止予定がなく、タスクあたりおよそ1-3ドル(Max なら3-7ドル)という価格の見積もりを公開し、実際の所要時間の上限も文書化しています。すでに Sonar を使っているなら、sonar-deep-research が2026年9月27日にサポート終了するため、Perplexity の Agent API が自然な移行先です。引用の書式とコストを自分で制御したいなら、完成したレポートを買うのではなく、Exa、Tavily、You.com の上に自分でループを組んでください。
最も速いディープリサーチ API はどれですか?
文書化という点で最も速いのは Google です。ほとんどの Deep Research タスクは20分以内に終わり、上限は60分です。他社は現行のレイテンシの数値を公開しておらず、それ自体が答えになっています。OpenAI は「数十分」としか言わず、Perplexity の2分から4分は2025年2月のローンチ時の数字です。速さが必要なら、レバーはベンダーではなく努力度です。これらの API はいずれもティアのダイヤルを露出しており、低いティアなら数秒から数分で返ってきます。自分のモデルに流し込むための出典つきの生の結果を数秒で得たいなら、Exa、Tavily、You.com の低い努力度レベルが高速な経路です。
ディープリサーチの実行にはどのくらい時間がかかりますか?
ベンダーが公開している数字だけを使うと、Google はほとんどのタスクが20分以内に終わり、実行を60分で打ち切るとしています。Moonshot は Kimi が10分から25分かかるとしています。OpenAI のローンチページはいまも5分から30分と書いており、この一文は2025年2月から改訂されていません。Perplexity の2分から4分も同じ月のものです。Anthropic は Research の答えが「数分で」届くとしか述べていません。古い数字は歴史的なものとして扱ってください。3つの製品はいずれも、その後作り直されています。
ディープリサーチツールを API 経由で使えますか?
使えます。ただし選択肢は2026年に大きく変わりました。Interactions API 上の Google の Deep Research モデルがターンキーの選択肢で、価格はタスクあたりおよそ1-3ドル、Max ティアで3-7ドルです。Perplexity の sonar-deep-research は開発者の定番でしたが、2026年9月27日にサポートを終了し、Agent API の努力度プリセットに置き換わります。OpenAI は専用の o3-deep-research と o4-mini-deep-research を2026年7月23日に廃止したため、現在は Responses API 上のフラッグシップモデルにウェブ検索ツールを組み合わせるか、2026年9月からパブリックベータの Agents API を使うことになります。Anthropic にはリサーチと銘打った API はありませんが、ベータの Claude Managed Agents があり、課金はトークンに加えてセッション1時間あたり0.08ドルです。Exa、Tavily、You.com が人気の自作型の選択肢です。
引用が最も優れているディープリサーチ API はどれですか?
Google と Perplexity は、完全に引用のついたレポートを最初から返します。すべての主張を URL までたどれる必要がある実運用のシステムでは、チームはたいてい Exa、Tavily、You.com の上に構築します。これらは出典が紐づいた結果を返すので、それを自分のモデルに流し込む形になり、書式を制御でき、監査証跡も示せます。ウェブ検索ツールを持つモデルであれば、プロンプトで指示すれば本文中に引用を入れられます。ただし、この点に関する独立した研究を念頭に置いてください。最も評価の高かったシステムでさえ、引用に関するルーブリック項目を完全に満たしたのは11%未満でした。引用が存在することと、引用が十分であることは同じではないのです。
無料のディープリサーチツールはありますか?
かろうじて、ですが、2026年に状況は悪くなりました。4社のうち無料アカウントにディープリサーチの割り当てを与えているのは OpenAI だけで、その説明は「Limited」、公開された回数はありません。Perplexity は Deep Research を Pro の向こうへ移し、Claude はそもそも無料で提供したことがなく、Google は有料プランに置いています。日常的に使うなら、現実的な入口は月4.99ドルの Gemini AI Plus か、大手3社のいずれかの月20ドルのプランです。本当に無料で、自分で動かす手間をいとわないなら、上で扱ったオープンソースのエージェントが正直な答えです。
ディープリサーチのレポートでハルシネーションを防ぐにはどうすればよいですか?
実用的な手立てが3つあります。第一に、引用されているソースの上位3つから5つは少なくともクリックし、その主張が本当にそのソースに書かれているかを確認してください。偽のソースをでっち上げるより、実在のソースを誤って引用するほうがはるかに多いからです。第二に、同じプロンプトを2つ目のツールにも通してください。食い違いが出たところは、たいていどちらかが間違えた場所です。第三に、これをソフトウェアに組み込むなら、検証をプロンプトの一行ではなく、パイプラインの独立した段階にしてください。主張を抽出し、きれいなコンテキストで検証し、その後に懐疑役のパスで判定に異議を唱えさせます。これが、OpenAI と Anthropic の公開クックブックの両方が行き着いたパターンです。
ディープリサーチツールは私のプライベートな文書を読めますか?
Gemini Deep Research の統合が最も深く、許可を与えれば Gmail、Drive、Docs にネイティブにアクセスします。Claude は Google Workspace のコネクターに対応しています。OpenAI Deep Research はセッション中にアップロードしたファイルを読めますが、クラウドストレージと直接は連携しません。Perplexity は主にウェブを相手にします。素材の大半が Google Workspace にあるなら、選ぶべきは明らかに Gemini です。
ディープリサーチのレポートを保存して再利用する最良の方法は何ですか?
レポートを PDF か Markdown で書き出し、読みやすいビューで開き、長い記事と同じようにハイライトしてください。Glasp はまさにこのワークフローのために作られています。ハイライトは、検索でき、他のハイライトとリンクでき、後から読み返せるライブラリに同期されます。ハイライトの一手間がなければ、ディープリサーチのレポートはたいてい一度読まれて忘れられます。これは、教育の世界で生成効果と呼ばれるものにつながります。能動的に処理した情報は、受動的に受け取った情報よりはるかによく定着するのです。
結論:リサーチ「ツール」ではなくリサーチ「スタック」を
OpenAI のローンチから19か月、このカテゴリーは一度輪郭がはっきりし、そして再編を始めました。ディープリサーチエージェントは勝者総取りの市場ではありません。何を調べているのか、どれだけ時間があるのか、素材がどこにあるのか、ボタンを押しているのか API を呼んでいるのか。正解がそれらによって変わる、混成の市場です。
いま、ほとんどのナレッジワーカーのために1つ選べと言われたら、Gemini です。公開ベンチマークの結果が最も良く、有料の入口は4.99ドルと最安で、フロンティアラボのリサーチ API の中で唯一、廃止のカウントダウンが動いていません。より重い仕事や、より曖昧な仕事には、OpenAI Deep Research か Claude Research を組み合わせてください。Sonar から移行する開発者は、9月27日より前に Perplexity の Agent API を確認しておくべきです。
より深いところで起きている変化は構造的なものです。専用のディープリサーチモデルは、どのラボでも退場しつつあります。OpenAI はリサーチモデルを廃止し、Perplexity は Sonar を廃止しつつあり、Google はモデルではなくエージェントを出荷し、Anthropic はマネージドなハーネスを出荷し、xAI はエージェント数を選ばせます。それらを置き換えたのが努力度のダイヤルです。何かを構築する人にとっては良い知らせです。努力度はリクエストごとに調整できるパラメーターだからです。そして、2026年で最も有用だったベンチマークの発見が「モデルはそのままに検索予算を上げるだけで精度が53ポイント動いた」であった理由も、ここにあります。
とはいえ、ツールの選択は、その出力をどう扱うかに比べれば重要度が下がります。私が見てきた最大の間違いは、ディープリサーチのレポートを完成した仕事として扱うことです。そうではありません。あれは素材です。本当の知識が築かれるのは、重要な主張にハイライトを引き、それを他に読んだものと結びつけ、そのテーマがまた出てきたときに戻ってくるときです。
Glasp はまさにそのワークフローのために設計されています。どんなレポートも、どんな記事も、どんな YouTube の文字起こしもハイライトできます。自分が本当に重要だと思ったものを集めた、検索できるライブラリを作りましょう。具体的な何かを思い出す必要が出てきたら、後からハイライトと対話できます。同じテーマを調べている人たちと成果を共有しましょう。
ディープリサーチエージェントはこれからも良くなり続け、API も増え続けるでしょう。その上にハイライトの層が乗らないものは、一度読まれて忘れられるレポートを生み続けます。2026年のリサーチワークフローを単一のツールを中心に組み立てるのはやめましょう。スタックを中心に組み立て、そのスタックの最後の輪が、自分自身の理解が記録される場所になるようにしてください。
まずは今週、実際のリサーチの問いをひとつ、4つのツールのうち2つに通してみてください。両方のレポートにハイライトを引きます。学んだことを比べます。それがワークフローです。それ以外はすべて、機能一覧にすぎません。