AI

딥 리서치 도구 비교: OpenAI vs Perplexity vs Gemini

이제 주요 AI 랩은 하나도 빠짐없이 "딥 리서치" 에이전트를 내놓고 있고, 대부분은 리서치 API까지 함께 제공합니다. 하나같이 몇 분 만에 박사급 보고서를 주겠다고 약속합니다. 1년 반 동안 실제로 써 본 결과, 그 차이는 마케팅이 암시하는 것보다 훨씬 구체적이었고, 벤치마크가 가리키는 지점에 있는 경우는 드물었습니다.

29분 읽기
핵심 요점
    • Perplexity Deep Research는 더 이상 Sonar 위에서 돌지 않습니다: 2026년 2월부터 Claude Opus 위에서 돌아가고, 2026년 6월부터는 Perplexity Computer 안에서 실행됩니다. Perplexity를 개발자들의 애용 도구로 만들었던 sonar-deep-research API는 2026년 9월 27일에 지원이 종료됩니다.
  • 전용 "딥 리서치 모델"은 사라지고 있습니다: OpenAI, Perplexity, Google, Anthropic, xAI 모두 하나의 리서치 모델 ID를 에이전트 세션과 노력(effort) 다이얼의 조합으로 대체했습니다. 이제는 노력 등급 자체가 제품입니다.
  • 공개된 벤치마크에서는 Google이 빅4 중 선두입니다: Deep Research Max는 Humanity's Last Exam에서 54.6%를 기록했고 표준 등급은 50.4%였습니다(Google, 2026년 4월). Moonshot의 Kimi K3는 그보다 높은 수치를 주장합니다. 등급 라벨을 꼼꼼히 읽으십시오. 벤더는 좀처럼 그러지 않습니다.
  • 검색 예산이 모델 선택을 이깁니다: 제3자 테스트에서 동일한 구성이 검색 1턴 제한에서는 BrowseComp 35.8%, 25턴에서는 89.0%를 기록했습니다. 같은 모델, 같은 벤치마크입니다.
  • 무료 등급은 나아진 게 아니라 모호해졌습니다: OpenAI 헬프 센터는 2026년 중 요금제별 딥 리서치 횟수 표기를 중단했고, 9월 10일에는 월 200달러 Pro 신규 가입을 중단했습니다. Gemini의 월 4.99달러 AI Plus는 이제 프런티어 랩을 통틀어 가장 저렴한 유료 진입점입니다.
  • 결과물은 보고서가 아니라 여러분의 이해입니다: 딥 리서치 에이전트를 Glasp 같은 하이라이트 워크플로와 묶으면, 20페이지짜리 보고서가 한 번 읽고 마는 PDF가 아니라 실제로 쓸 수 있는 지식이 됩니다.

딥 리서치라는 전환점

2026년 9월 현재 대부분의 사람에게 가장 무난한 선택은 Gemini Deep Research입니다. 공개된 벤치마크가 가장 강하고, 4.99달러로 유료 진입 가격이 가장 쌉니다. 월 20달러의 Perplexity Pro는 돈 대비 사용량이 가장 좋고, 모호한 작업에서 가장 깊이 있는 보고서를 내놓는 쪽은 OpenAI와 Claude입니다. 개발자라면 Google의 Deep Research API에서 시작하는 것이 맞습니다. 폐기 시계가 돌아가고 있지 않은 유일한 턴키 옵션이기 때문입니다. Perplexity는 2026년 9월 27일에 sonar-deep-research를 폐기하고, OpenAI는 7월에 전용 리서치 모델을 종료했습니다.

이 가이드의 나머지 부분은 그 결론이 가격, 벤치마크, API, 그리고 실제 업무 전반에서 어떻게 유지되는지 보여 줍니다.

이 카테고리 자체가 아직 두 살도 되지 않았습니다. 2025년 2월 2일, OpenAI가 Deep Research를 발표했습니다. 한 문장짜리 프롬프트를 받아 30분짜리 조사를 계획하고, 수십 개의 출처를 스스로 훑어 읽고, 인용이 달린 보고서를 들고 돌아오는 에이전트를 대부분의 사람이 처음 써 본 사례였습니다.

업계의 반응이 많은 것을 말해 줍니다. 6주 안에 Perplexity가 자체 Deep Research를 내놓았고(2월 14일), 몇 주 뒤에는 개발자들에게 Sonar Deep Research API를 열었습니다. 2024년 12월에 조용히 Gemini Deep Research를 출시했던 Google은 롤아웃에 속도를 냈고 백본을 계속 업그레이드했습니다. Anthropic은 2025년 5월 7일에 Claude의 웹 검색을 일반 공개하면서 같은 봄 기간에 Research 기능을 함께 묶어 내놓았습니다.

랩 네 곳, 제품 카테고리 하나, 두 분기. 우연히 벌어지는 일이 아닙니다. 2024년은 컨텍스트 윈도가 20만 토큰을 넘고, 도구 사용이 안정적으로 작동하기 시작하고, 에이전트 루프가 중간에 소리 없이 실패하는 일이 사라진 해였습니다. 딥 리서치는 그 세 가지 모두에 돈을 낼 만하다고 느끼게 만든 최초의 소비자용 앱이었습니다. 이는 에이전트 웹: MCP 프로토콜 전쟁의 내부에서 다루는 에이전트 프로토콜로의 더 큰 전환과 밀접하게 맞물려 있습니다.

글을 쓰거나, 공부하거나, 시장을 분석하거나, 제품을 평가하는 일을 한다면, 이 도구를 쓰지 않는 것만으로 이미 불리한 위치에 있습니다. 문제는 어느 것을, 언제 쓰느냐입니다.


"딥 리서치"가 실제로 하는 일

딥 리서치를 챗 검색과 혼동하기 쉽습니다. 질문을 입력하면 링크가 달린 답이 돌아오니까요. 하지만 작동 방식이 다릅니다.

챗 검색(브라우징이 켜진 일반 ChatGPT 같은 것)은 웹 쿼리를 한두 번 돌린 뒤 상위 결과를 몇 초 만에 종합합니다. 딥 리서치 에이전트는 주니어 애널리스트가 오후 내내 하는 일에 더 가깝습니다. 질문을 하위 질문으로 쪼개고, 수십에서 수백 번 검색하고, 페이지 전체를 읽고, 인용을 따라가고, 알아낸 내용에 맞춰 계획을 갱신하고, 각주가 달린 구조적 보고서를 만들어 냅니다.

챗 검색에 "필립스 곡선에 대한 주요 비판은 무엇인가?"라고 물으면 세 문단짜리 요약이 돌아옵니다. 같은 질문을 딥 리서치 에이전트에 던지면 프리드먼의 자연실업률 가설, 1970년대 스태그플레이션으로 인한 붕괴, 합리적 기대 이론에 따른 수정, 2008년 이후의 평탄화 논쟁, 2023-2025년의 최신 논문까지 다루는 15페이지짜리 보고서가 나오고, 항목마다 클릭할 수 있는 출처가 붙습니다.

대가는 시간입니다. 한 번 실행에 몇 분에서 한 시간이 걸리고, 시간 예산을 공개하는 벤더는 Google뿐입니다. 대부분의 작업은 20분 이내, 상한은 60분입니다. 바로 그 점이 핵심입니다. 하나 걸어 두고 다른 일을 하다가 돌아오면, 직접 모았다면 반나절이 걸렸을 보고서가 기다리고 있습니다. AI 에이전트를 중심으로 연구 습관을 다시 짜는 방법은 2026년 AI 기반 리서치 워크플로 만드는 법을 참고하십시오.


정면 비교: 소비자용 4대 도구

아래는 2026년 9월에 각 벤더의 자체 페이지에서 확인한 백본 모델과 가격을 정리한 표입니다. 이 가이드가 처음 나온 이후 다른 어떤 열보다 많이 바뀐 열이 하나 있습니다. 바로 "백본 모델" 열인데, 네 곳 중 세 곳에서 이제 움직이는 표적이 되었습니다.

도구백본 모델 (2026년 9월)가격과 이용 조건공개된 실행 시간
OpenAI Deep Research비공개, "기본적으로 최신 모델"Free와 Go(월 8달러): Limited(제한적), Plus(월 20달러): Expanded(확대), Pro(월 100달러부터): Maximum(최대)5-30분 (OpenAI, 2025년 2월)
Perplexity Deep ResearchClaude Opus, Perplexity Computer 안에서 라우팅Pro 월 20달러, Max 월 200달러2-4분 (Perplexity, 2025년 2월)
Gemini Deep ResearchGemini 3.1 ProAI Plus 월 4.99달러, AI Pro 월 19.99달러, AI Ultra 월 99.99달러부터보통 20분, 상한 60분 (API)
Claude Research비공개모든 유료 요금제: Pro 월 20달러, Max 월 100 또는 200달러, Team, Enterprise미공개

이 표에는 예전보다 "미공개"가 훨씬 많이 들어 있고, 그것이 솔직한 현재 상태입니다. 지금 판매 중인 제품에 대해 확정된 시간 예산을 공개하는 곳은 Google뿐입니다. 널리 인용되는 OpenAI의 "5분에서 30분"은 2025년 2월 출시 페이지에 적힌 문장이고 한 번도 다시 언급된 적이 없습니다. Perplexity 역시 같은 출시 시점에 2분에서 4분을 공개한 뒤 갱신하지 않았습니다. 그래서 이 가이드가 예전에 적었던 "3분 이내"는, 그 이후 두 번이나 다시 만들어진 제품을 두고 2025년 2월 수치를 그대로 옮겨 적은 셈이었습니다. Anthropic은 Research가 "몇 분 안에" 답을 준다고만 말합니다.

한 문단짜리 프로필은 이렇습니다.

OpenAI Deep Research는 모호하고 열린 질문에서 여전히 최강자입니다. 보고서가 길게 나오고, 깔끔한 정답이 없는 질문일수록 추론의 깊이가 눈에 띄게 드러납니다. 2026년에 두 가지가 바뀌었습니다. 가격 페이지가 실행 횟수를 알려 주기를 그만두고 이제는 Limited, Expanded, Maximum이라고만 적습니다. 그래서 아직도 떠도는 "무료 5회, Plus 25회, Pro 250회" 수치는 OpenAI가 현재 요금제별로 공개하는 값이 아니라 2025년 4월 블로그 업데이트에서 온 것입니다. 그리고 2026년 9월 10일, OpenAI는 월 200달러 Pro 등급의 신규 가입을 중단했습니다. Pro 등급은 두 가지입니다. 100달러는 Plus의 5배 사용량을, 200달러는 20배를 열어 주는데, 이번 중단으로 신규 고객이 살 수 있는 최상위 요금제는 100달러가 되었습니다.

Perplexity Deep Research는 밑에 깔린 엔진이 통째로 교체된 사례입니다. 처음에는 Perplexity 자체 Sonar 모델 위에서 출시되었습니다. 2026년 2월부터 Advanced Deep Research 모드는 Claude Opus 위에서 돌아가고, Max 구독자는 Pro 구독자보다 더 최신 Opus 리비전을 받습니다. 그리고 2026년 6월 11일, Perplexity는 Deep Research를 Perplexity Computer 안으로 옮겼습니다. 여기서는 하위 작업이 20개가 넘는 프런티어 모델에 걸쳐 분배됩니다. Perplexity는 BrowseComp 점수가 40.7%에서 83.8%로 뛴 것을 모델 교체가 아니라 이 아키텍처 변화 덕분이라고 설명합니다. Perplexity Deep Research를 "Sonar" 제품이라고 부르는 글을 봤다면, 그것은 2026년 2월 이전에 쓰인 글입니다. 이제 Sonar는 소비자용 에이전트가 아니라 API 라인의 이름입니다.

Gemini Deep Research는 빅4 중 공개된 성적이 가장 좋습니다. Google은 2026년 4월에 에이전트를 Gemini 3.1 Pro로 업그레이드하고, 표준 등급과 Max 등급으로 나눈 뒤, 둘 모두를 제대로 된 API로 열었습니다. 여전히 웹과 함께 여러분의 Gmail, Drive, Docs에서도 자료를 끌어오며, 에이전트가 실행되기 전에 손볼 수 있는 리서치 계획을 눈으로 보여 줍니다. Google은 사용 한도를 횟수가 아니라 배수로 공개하는데, 적어도 업그레이드하면 무엇을 얻는지는 알 수 있습니다.

Claude Research는 참을성 있는 쪽입니다. 모순되는 출처를 너무 일찍 정리해 버리는 대신 나란히 붙들고 가는 데 능합니다. 바로잡을 점이 두 가지 있습니다. Research는 Pro만이 아니라 모든 유료 Claude 요금제(Pro, Max, Team, Enterprise)에서 쓸 수 있고, Anthropic의 라인업은 Sonnet 5와 Opus 5를 지나 2026년 9월 1일에 출시된 Claude Fable 5.1까지 확장되었습니다. Anthropic은 앱에서 Research를 어떤 모델이 뒷받침하는지 밝히지 않습니다. 문서로 확인되는 것은 Claude 4.6 이후 모델이 표준 요금 그대로 100만 토큰 컨텍스트를 온전히 제공한다는 점이며, 덕분에 방대한 출처 묶음이 잘리거나 추가 요금을 물지 않습니다.


ChatGPT 딥 리서치 대안: 또 누가 만들고 있나

"ChatGPT 딥 리서치 대안"은 사람들이 이 주제에 도달하는 가장 흔한 경로 중 하나인데, 위의 4자 비교로는 답이 되지 않습니다. 2026년 9월 현재 실제로 리서치 에이전트를 내놓고 있는 곳과, 그런 것처럼 보이기만 하는 곳을 정리했습니다.

도전자제품과 API진입 가격구별되는 사실
xAI Grok멀티 에이전트 모드, grok-4.20-multi-agent (베타)SuperGrok 월 30달러HLE나 BrowseComp 점수를 공개하지 않음
Moonshot KimiDeep Research (Kimi-Researcher), 전용 엔드포인트 없음Plus 월 19달러아무도 공개하지 않는 실행별 텔레메트리를 공개
Manus자율 에이전트, Wide Research, 작업 단위 REST월 20달러 (크레딧 4,000개)이름 붙은 공개 벤치마크가 전혀 없음
You.com소비자 제품은 사실상 철수, Research API1,000건당 12달러 (lite)100배 가격 폭을 아우르는 5단계 노력 등급
MistralVibe의 Deep Research 스킬, 독립 엔드포인트 없음Pro 월 14.99달러빅4 밖에서 가장 저렴한 유료 등급
DeepSeek앱 안의 웹 검색, API에는 에이전트 요소 없음무료API가 전달된 모든 도구를 무시함

xAI Grok은 모두가 여전히 검색하는 그 기능의 이름을 조용히 바꿨습니다. "DeepSearch"와 "DeeperSearch"는 이제 xAI 개발자 문서 어디에도 나오지 않습니다. 지금 존재하는 것은 여전히 베타 딱지가 붙은 멀티 에이전트 모델 grok-4.20-multi-agent이며, reasoning.effort가 low나 medium에서는 에이전트 4개를, high나 xhigh에서는 16개를 선택합니다. 문서는 딥 리서치에는 16개를 쓰라고 분명히 안내합니다. 품질로 비교하려는 사람에게 걸리는 지점은 이것입니다. xAI는 기반 모델인 Grok 4.6에 대해 Humanity's Last Exam, BrowseComp, GAIA 점수를 하나도 공개하지 않았고, 그래서 통상적인 벤치마크 표에 넣을 값이 없습니다. DeepSearchQA에서 81.6%를 보고하긴 하지만, 여기서는 GPT-5.5와 Claude Opus 양쪽에 모두 집니다.

Moonshot의 Kimi는 문서화가 가장 잘된 도전자이면서, 아시아 밖 사람들 대부분이 한 번도 써 보지 않은 제품입니다. Deep Research 모드는 자체 개발한 Kimi-Researcher 모델 위에서 돌아가고, Moonshot은 미국 랩들이 공개하지 않는 작업별 텔레메트리를 공개합니다. 작업당 평균 추론 단계 23회, 계획된 검색 키워드 74개, 찾아낸 URL 206개이며, 그중 상위 3.2%만이 보고서에 살아남습니다. 실행에는 10분에서 25분이 걸리고 유료 등급은 월 19달러부터 시작합니다. Moonshot은 호출 가능한 search와 fetch 엔드포인트를 제공하지만 Deep Research 에이전트 자체를 노출하는 것은 없어서, 리서치 제품은 소비자용에 한정됩니다.

Manus는 사업 이야기로는 흥미롭고 기술 이야기로는 가장 빈약합니다. 2025년 12월 Meta가 인수했고, 2026년 4월 27일 중국 국가발전개혁위원회(NDRC)가 그 거래를 막았으며, Manus는 2026년 9월 1일 독립 운영을 재개했다고 발표했습니다. Wide Research 모드는 하위 작업 20개를 동시에 돌리지만, 수동으로 실행할 수는 없습니다. 인용하기 전에 알아 둘 점은, Manus가 이름 붙은 공개 벤치마크를 어디에도 공개하지 않고 내부 자료라고 표시한 차트만 내놓는다는 사실입니다.

You.com은 사실상 소비자 시장을 떠났습니다. 리서치 에이전트였던 ARI는 홈페이지에 더 이상 나오지 않고, 가격 페이지에는 소비자 구독이 없습니다. 남은 것은 lite부터 frontier까지 다섯 단계의 노력 수준을 제공하는, 진짜로 쓸 만한 Research API이며 1,000건당 12달러에서 1,200달러까지 가격이 매겨집니다. 단일 엔드포인트에서 100배의 가격 차이는 이 카테고리 전체가 수렴해 온 어떤 흐름을 가장 선명하게 보여 주는데, 아래 API 절에서 이어서 다룹니다.

Mistral은 리서치 에이전트를 옮기면서 앱 이름까지 바꿨습니다. Le Chat은 2026년 5월에 Vibe가 되었고, Chat 탭에서 Deep Research는 종료되었습니다. 지금 실행하려 하면 Deep Research 스킬이 미리 선택된 Work 탭으로 이동됩니다. 월 14.99달러인 Mistral Pro는 빅4 밖에서 가장 저렴한 유료 등급이지만 Google의 4.99달러 AI Plus가 그보다 더 쌉니다. 다만 데이터 소재지 요건이 있는 유럽 팀에게는 Mistral이 구매 심사를 통과하는 유일한 선택지인 경우가 많습니다.

DeepSeek은 유용한 반증 사례입니다. "최고의 딥 리서치 도구" 목록에 늘 들어가지만, DeepSeek은 딥 리서치 제품을 내놓지 않습니다. 앱에는 웹 검색과 think 모드가 있으나, API 문서는 web_search를 비롯한 모든 도구를 무시한다고 표시하고 있어 그 위에 에이전트를 올릴 여지가 없습니다. 직접 제공한 텍스트를 다루게 하기에는 훌륭하고 저렴한 추론 모델이지만, 리서치 에이전트는 아닙니다. Qoob과 Arc Search도 마찬가지입니다. 둘 다 비교 검색에 등장하지만, 30분 동안 계획을 세우고 웹을 훑는 에이전트가 아니라 빠른 답변 검색 앱입니다.

오픈소스 선택지, 그리고 한 가지 경고

직접 호스팅하고 싶다면, 2026년의 솔직한 답은 유지보수와 벤치마크 성능이 이제 서로 다른 저장소에 살고 있다는 것입니다.

활발히 유지되고 있어 먼저 시작해 볼 만한 것들입니다. GPT Researcher(Apache-2.0, 별 약 29,500개, 2026년 8월까지 릴리스 지속)는 설정 파일에서 폐기된 모델 이름을 먼저 갈아 끼우지 않고도 오늘 바로 클론해서 실행할 수 있는 프로젝트입니다. ByteDance의 DeerFlow는 별 약 82,000개로 압도적으로 가장 크고 시도 비용도 가장 쌉니다. DuckDuckGo와 키가 필요 없는 리더를 써서 검색 API 키 없이도 돌아가기 때문입니다. 다만 2.0 재작성 과정에서 딥 리서치를 여러 스킬 중 하나로 두는 범용 에이전트 하네스로 방향을 바꿨습니다. 알리바바의 Tongyi DeepResearch는 Apache-2.0으로 공개된 믿을 만한 오픈 웨이트 선택지지만, 저장소가 2026년 2월 이후 조용합니다.

이제 경고입니다. 2025년 추천 목록마다 상위에 올랐던 두 프로젝트가 죽었는데, 겉으로는 그렇게 보이지 않기 때문입니다. LangChain의 open_deep_research는 2026년 8월 21일에 아카이브되었습니다. GitHub에는 아카이브 배너가 뜨지만 README 자체에는 아무런 안내가 없어서, 튜토리얼을 따라 들어온 사람에게는 여전히 살아 있는 프로젝트처럼 읽힙니다. 스탠퍼드의 STORM은 2026년에 풀 리퀘스트 146건이 열렸는데 그중 정확히 0건이 머지되었습니다. 마지막 커밋은 2025년 9월이고, 문서에 적힌 퀵스타트는 2025년 8월에 종료된 Bing Search API에 의존합니다. STORM 논문은 여전히 읽을 가치가 있습니다. 다만 그 소프트웨어를 출발점으로 삼아서는 안 됩니다.

가장 잘 알려진 프로젝트들을 놓고 보면 패턴이 보입니다. 경쟁력 있는 벤치마크 점수를 냈던 오픈 웨이트 에이전트들은 조용해졌고, 아직 코드를 내놓고 있는 쪽은 벤치마크를 거의 공개하지 않습니다. 유지보수를 기준으로 고르고, 성능은 직접 측정하십시오.

리서치 대상이 열린 웹이 아니라 이미 가지고 있는 문서로 한정된다면, 그건 승자가 다른 별도의 도구 카테고리이며 2026년의 NotebookLM에서 다룹니다.


딥 리서치 API: 실제로 호출할 수 있는 것

비교 글들이 계속 건너뛰는 질문이자, 개발자들이 계속 검색하는 질문입니다. 어떤 딥 리서치 에이전트를 내 코드에서 호출할 수 있고, 비용은 얼마이며, 인용 품질은 어떤가. 이 대부분이 2026년 사이에 바뀌었고, 가장 큰 변화 중 하나는 2026년 9월 27일에 일어납니다.

제공자딥 리서치 호출 가능?무엇을 호출하나가격
Google Gemini예, 턴키Interactions API의 deep-research-preview-04-2026 또는 deep-research-max-preview-04-2026작업당 약 13달러, Max는 약 37달러 (프리뷰 요금)
Perplexity예, 단 이전 중노력 프리셋을 쓰는 Agent API POST /v1/agent, sonar-deep-research는 2026년 9월 27일 지원 종료레거시 Sonar: 입력 100만 토큰당 2달러, 출력 100만 토큰당 8달러, 인용 토큰 100만당 2달러와 추론 토큰 100만당 3달러 추가, 검색 1,000건당 5달러
OpenAI전용 모델 형태로는 아님Responses API에서 web_search와 높은 추론 노력을 쓰는 플래그십 모델, 또는 새 Agents API모델 토큰 요금에 더해 web_search 1,000회당 10달러
Anthropic Claude리서치 전용 API 없음Messages API의 web_search 도구, 또는 Claude Managed Agents (베타)검색 1,000건당 10달러와 토큰 요금, Managed Agents는 세션 시간당 0.08달러 추가
You.com예Research API, 5단계 노력 수준1,000건당 12달러(lite)에서 1,200달러(frontier)까지
Exa직접 조립Search, Deep Search, Agent 엔드포인트Search 1,000건당 7달러, Deep Search 1,000건당 1215달러, Agent는 고정 노력 기준 요청당 0.0121.00달러
Tavily직접 조립Search와 Research 엔드포인트월 1,000 크레딧 무료, 종량제 크레딧당 0.008달러, Research는 4~250 크레딧 소모

눈에 띄는 점이 네 가지 있습니다.

이제 프런티어 랩 중 턴키 옵션을 제공하는 곳은 Google이며, 이는 역전입니다. 이 카테고리의 역사 대부분에서 Gemini Deep Research는 프로그래밍 방식으로 호출할 수 없는 소비자 기능이었습니다. 지금은 빅4 중 가장 깔끔합니다. Interactions API에서 딥 리서치 모델을 호출하는데, background=true가 선택이 아니라 필수이며, Google은 작업당 예상 가격대와 실제 시간 예산을 함께 공개합니다. 엔터프라이즈 접근은 Gemini Enterprise Agent Platform을 통하는데, 이는 2026년에 이 제품의 이름으로서 Vertex AI를 대체했으므로 Vertex를 가리키는 오래된 글은 무시하십시오.

Perplexity의 턴키 API는 바로 지금 폐기되는 중입니다. sonar-deep-research는 2년 동안 "그냥 호출할 수 있는 딥 리서치 API가 뭐냐"는 질문의 답이었고, Perplexity는 2026년 7월에 Sonar Chat Completions 엔드포인트가 2026년 9월 27일에 폐기된다고 발표했습니다. 대체재는 Agent API로, POST /v1/agent를 호출하고 노력 프리셋을 고르면 됩니다. Perplexity는 기존 딥 리서치 모델을 high에 대응시키면서, 최고 결과를 원하면 xhigh를 쓰라고 안내합니다. 위 표의 Sonar 가격은 모두 9월 27일까지만 유효하므로, 구축 비용을 산정한다면 Agent API 기준으로 계산하십시오. 라이프사이클의 모양 자체가 바뀐 점도 알아 두십시오. 레거시 비동기 엔드포인트는 IN_PROGRESS 같은 대문자 상태를 쓰고 Agent API는 다른 소문자 집합을 쓰기 때문에, 한쪽을 기준으로 작성한 폴링 루프는 다른 쪽에서 조용히 실패합니다.

OpenAI는 딥 리서치를 모델 라인으로 옮겼다가, 다시 매니지드 에이전트로 옮겼습니다. 전용 모델이던 o3-deep-research와 o4-mini-deep-research는 2026년 4월에 폐기 예고되었고 2026년 7월 23일에 종료되었습니다. 대체 경로는 Responses API에서 web_search 도구를 켠 현행 플래그십 모델을 백그라운드 모드로 돌리는 것입니다. 2026년 9월 10일부터는 퍼블릭 베타인 매니지드 Agents API도 있는데, 여기서는 세션 오케스트레이션, 컨텍스트 압축, 복구를 OpenAI가 대신 처리합니다. 함정 하나를 짚어 두겠습니다. OpenAI 자체 딥 리서치 가이드 페이지와 o3-deep-research 모델 페이지는 둘 다 갱신되지 않은 채 해당 모델을 여전히 사용 가능한 것처럼 안내하고 있어 폐기 안내 페이지와 모순됩니다. 폐기 안내 페이지를 믿으십시오.

Anthropic은 이제 전부 직접 만들라고 하지 않습니다. 이 가이드가 예전에 적었던 설명은 Claude에는 리서치 API가 없으니 루프를 직접 조립해야 한다는 것이었습니다. 그건 철 지난 이야기입니다. Claude Managed Agents는 2026년 4월부터 퍼블릭 베타입니다. 장시간 세션, 서버 전송 이벤트, 조종과 중단, cron 스케줄 배포, 그리고 내장된 웹 검색, 웹 페치, MCP를 제공하며 토큰 비용에 세션 시간당 0.08달러가 더해집니다. Anthropic 자체 예시는 한 시간짜리 Opus 세션을 1달러가 채 안 되는 비용으로 계산하고, 웹 검색과 달리 웹 페치는 비용이 들지 않습니다. 여전히 "딥 리서치"라는 이름의 모델은 없지만, 하네스는 존재합니다.

"인용이 달린 리서치 보고서에 가장 좋은 API"라는 질문에 한정하면 세 가지 접근이 통합니다. Google과 Perplexity는 인용을 기본으로 제공합니다. You.com, Exa, Tavily는 출처가 달린 결과를 주고 그걸 여러분의 모델에 넣게 하는데, 실제 프로덕션 리서치 기능 대부분이 이 패턴으로 만들어집니다. 비용과 인용 형식을 직접 통제할 수 있기 때문입니다. 그리고 웹 검색 도구를 가진 모델이라면 어느 것이든 프롬프트로 지시하면 진행하면서 인용을 붙일 수 있습니다. 감사 추적이 필요한 팀은 직접 만드는 쪽을 선호하는 경향이 있는데, 모든 주장이 모델의 기억이 아니라 실제로 가져온 URL로 추적되기 때문입니다. 원시 컨텍스트 크기보다 그라운딩과 검색 품질이 더 중요한 이유는 컨텍스트 로트: 거대한 컨텍스트 윈도보다 RAG가 여전히 나은 이유를 보십시오.

의존할 벤더를 고르는 사람이라면 소유권과 관련한 두 가지를 기억해 두십시오. Tavily는 2026년 2월 AI 클라우드 제공업체 Nebius에 인수되었으므로 "독립 검색 API"라는 설명에는 단서가 필요합니다. 그리고 Exa는 2026년 4월 1일에 /research 엔드포인트를 제거하고 deep-reasoning 타입으로 /search에 통합했습니다. 따라서 exa-research를 호출하라고 알려 주는 튜토리얼은 이미 깨져 있습니다.


API로 딥 리서치를 자동화하는 법

이런 API를 호출하는 일은 챗 컴플리션을 호출하는 것과 다릅니다. 한 번 실행에 몇 분에서 한 시간이 걸리므로 모든 제공자가 비동기를 다루게 만드는데, 그 방식이 저마다 다릅니다. 리서치 에이전트를 제품이나 파이프라인에 붙이려 한다면, 하루를 잡아먹는 지점이 바로 여기입니다.

블로킹 호출이 아니라 백그라운드 실행을 전제로 하십시오. Google은 아예 필수로 요구합니다. 딥 리서치 모델은 background=true에서만 동작하고, 인터랙션을 폴링하거나 스트림을 재개하는 방식입니다. OpenAI는 Responses API에서 백그라운드 모드를 지원하며 폴링, 재개 가능한 스트리밍, 그리고 Standard Webhooks 규격에 따른 웹훅을 제공합니다. Perplexity는 폴링만 문서화하고 웹훅은 없습니다. xAI가 예외입니다. 스키마에 background가 나오기는 하지만 미지원으로 표시되어 있어서, 실제 비동기 경로는 배치 API이며 이는 몇 분이 아니라 24시간 안에 결과를 돌려줍니다.

토큰이 아니라 작업 단위로 예산을 잡고, 검색 비용을 확인하십시오. 리서치 API 청구서는 검색 부가 요금에서 나옵니다. 이 요금은 토큰이 아니라 호출당으로 매겨집니다. OpenAI는 웹 검색 1,000회당 10달러, Anthropic은 검색 1,000건당 10달러, Perplexity는 폐기 예정인 Sonar 딥 리서치 라인에서 1,000건당 5달러, xAI는 도구 호출 1,000건당 5달러를 받습니다. Google은 유료 등급 프로젝트에 Gemini 3.x 모델 전체에 걸쳐 월 5,000회의 무료 그라운딩 검색을 주고 그 뒤에는 1,000건당 14달러를 받는데, Deep Research 작업이 같은 풀에서 건당 대략 80회에서 160회를 소모하므로 약 60작업이면 소진됩니다. 지금까지 공개된 것 중 가장 유용한 실제 예시는 Perplexity 자체의 샘플 응답입니다. 딥 리서치 호출 한 번에 0.816달러가 들었고, 그중 71%가 추론 토큰이었으며 출력은 11%에 불과했습니다. 여러분이 읽는 보고서는 청구서에서 가장 싼 부분입니다.

노력 등급을 전제하십시오. 그것이 모델 ID를 대체했으니까요. 이것이 위의 개별 변화들 뒤에 숨은 구조적 전환입니다. OpenAI는 플래그십 모델과 추론 노력의 조합을 위해 리서치 모델을 폐기했습니다. Perplexity는 Agent API 프리셋을 위해 Sonar를 폐기하는 중입니다. Google은 표준과 Max 변형을 내놓습니다. xAI는 reasoning.effort로 에이전트 4개냐 16개냐를 고르게 합니다. Exa, You.com, Tavily 모두 저렴한 바닥부터 요청당 상한까지 같은 모양의 사다리로 가격을 매깁니다. 이런 API를 전제로 설계한다면, 하드코딩할 모델 이름이 아니라 요청마다 돌릴 수 있는 다이얼을 염두에 두고 설계하십시오.

질문을 명확히 하는 단계는 여러분이 직접 만들어야 합니다. OpenAI는 이 점을 명시합니다. API를 통한 딥 리서치에는 질문 확인이나 프롬프트 재작성 단계가 포함되지 않으며, 모델은 처음부터 완성된 프롬프트를 기대합니다. 소비자용 앱은 시작 전에 후속 질문을 던지지만 API는 그러지 않습니다. 표준적인 해법은 OpenAI 자체 쿡북이 보여 주는 대로, 값싼 작은 모델이 요청을 분류하고 리서치 지시문으로 다시 써 준 다음에야 비싼 에이전트를 돌리는 것입니다.

팩트체크에 한정하면, 검증은 프롬프트가 아니라 파이프라인의 한 단계입니다. OpenAI와 Anthropic이 공개한 쿡북 양쪽에서 하나의 패턴이 자리 잡았습니다. 출력을 독립적인 주장 단위로 분해하고, 각 주장을 깨끗한 컨텍스트에서 개별 검증한 뒤, 별도의 회의론자 패스가 그 판정에 이의를 제기하게 하는 것입니다. Anthropic 버전은 그 이유를 직설적으로 설명합니다. "결과를 다시 확인하라"도 결국 하나의 지시문일 뿐이며, 컨텍스트 압박이 커지면 건너뛰게 된다는 것입니다. 사람들이 계속 찾는 실시간 팩트체커를 만든다면, 그 분해가 곧 아키텍처이고, 그 아래에 깔린 검색 API보다 그것을 둘러싼 구조가 더 중요합니다.


딥 리서치 벤치마크: 리더보드가 보여 주는 것

가장 많이 인용되는 수치는 세 가지, Humanity's Last Exam과 BrowseComp, SimpleQA입니다. 쓸모가 있고, 널리 잘못 인용되며, 거의 아무도 언급하지 않는 구조적 문제를 두 가지 안고 있습니다.

첫 번째부터 짚겠습니다. 출시된 리서치 에이전트들을 도구까지 켠 상태로 서로 줄 세우는 독립 리더보드가 없습니다. Scale의 자체 평가는 도구 없는 변형을 돌리고, 벤더 보드는 자기 보고이며, 진지한 제3자 하네스 하나는 구매할 수 있는 제품이 아니라 구매할 수 없는 모델과 검색의 조합을 벤치마킹합니다. 어떤 벤더의 에이전트가 "도구 사용" 조건에서 50%대나 60%대를 기록했다고 나오면, 여러분은 그 벤더 자신의 하네스와 검색 예산과 심판을 읽고 있는 것입니다. 그렇다고 그 수치가 가짜라는 뜻은 아닙니다. 서로 비교할 수 없다는 뜻입니다.

두 번째 문제는 등급 라벨입니다. 이 가이드도 예전에 HLE 54.6%와 BrowseComp 85.9%를 "Gemini Deep Research"로 적었습니다. 두 수치 모두 Google의 고노력 등급인 Deep Research Max의 것이고, 표준 등급은 각각 50.4%와 61.9%입니다. 하나의 이름으로 팔리는 두 제품 사이에 BrowseComp 24점 차이가 있는 셈인데, 비교 글들은 이를 끊임없이 뭉뚱그립니다. Google이 이 수치를 2026년 4월 발표에서 인용 가능한 본문이 아니라 차트 안에 실었다는 점도 알아 둘 만합니다. 아래로 내려가면서 수치가 뒤엉키는 이유 중 하나입니다.

에이전트 또는 구성HLE (도구 사용)보고 주체시점
Perplexity Sonar Deep Research21.1%벤더2025년 2월
OpenAI Deep Research (o3)26.6%벤더2025년 2월
Gemini Deep Research (3 Pro)46.4%벤더2025년 12월
Gemini Deep Research (3.1 Pro)50.4%벤더2026년 4월
Gemini Deep Research Max (3.1 Pro)54.6%벤더2026년 4월
Kimi K3 (Deep Research 에이전트가 아니라 모델)56.0%벤더2026년 7월
Claude Opus 5 + Perplexity 검색, 25턴77.4%제3자2026년 8월

마지막 줄은 곱씹어 볼 가치가 있습니다. 이 수치는 벤더의 주장을 모으는 대신 실제 프로덕션 엔드포인트를 돌리는 OpenRouter 자체 벤치마크 하네스에서 나왔고, 정확도와 함께 비용과 지연 시간을 같이 공개합니다. 84문항 샘플에서 문항당 0.46달러, 83초였습니다. 이것은 살 수 있는 제품이 아닙니다. 제3자가 조립한 모델과 검색 제공자와 턴 예산의 조합일 뿐인데, 출시된 모든 에이전트의 자기 보고 수치를 이깁니다. 측정 주체에 대한 단서가 하나 있습니다. OpenRouter는 자신이 벤치마킹하는 모델과 검색 엔진 대부분을 재판매합니다.

이 카테고리 전체에서 가장 유용한 발견 역시 같은 하네스에서 나왔습니다. BrowseComp에서 한 구성이 검색 1턴 제한에서는 35.8%, 25턴 제한에서는 89.0%를 기록했습니다. 같은 실행 계열 안에서 말입니다. 같은 모델, 같은 벤치마크입니다. 주변 스캐폴딩, 구체적으로는 검색을 몇 번 허용하느냐가 결과를 53점이나 움직였습니다. 평범한 브라우징 모델이 BrowseComp에서 2%도 못 넘기는데 그 위에 올린 에이전트가 80%대를 기록하는 이유가 이것이며, "어느 모델이 가장 똑똑한가"가 거의 틀린 질문인 이유이기도 합니다. 검색 예산을 사십시오.

비용 곡선도 마케팅이 암시하는 것보다 완만합니다. 같은 실행에서 BrowseComp 최상위 구성은 문항당 0.99달러가 들었고, 같은 검색 제공자와 짝지은 저렴한 모델은 0.076달러에 77.0%를 기록했습니다. 정확도 12점을 내주고 비용은 대략 13분의 1인 셈입니다. 실제 업무 대부분에서는 이 교환이 명백히 옳습니다.

리서치 에이전트를 위해 만들어진 벤치마크

HLE와 BrowseComp는 에이전트가 어려운 사실을 찾아낼 수 있는지를 잽니다. 보고서가 좋은지는 재지 않습니다. 그걸 재는 더 새로운 벤치마크가 셋 있는데, 훨씬 덜 우호적인 결과를 내놓습니다.

ResearchQA는 75개 분야에 걸쳐 21,000개 쿼리와 160,000개 루브릭 항목을 다루고 그중 여덟 개 분야를 31명의 박사급 주석자가 검증한 독립 학술 프로젝트인데, 시험한 일반 언어 모델과 검색 시스템 중 루브릭 커버리지 70%에 도달한 것은 하나도 없었다는 결과를 내놓았습니다. 그보다 나은 성적을 낸 쪽은 딥 리서치 전용으로 만들어진 에이전트뿐이었고, 그중 최고도 75.3%에서 멈췄습니다. 더 뼈아픈 점은, 그 최상위 시스템조차 인용 관련 루브릭 항목의 11% 미만만 온전히 충족했고 한계와 비교 항목은 대략 절반만 충족했다는 사실입니다. 에이전트는 출처를 찾아냅니다. 그 출처가 무엇을 입증하지 못하는지 말하는 일에서는 훨씬 서툽니다.

ResearchRubrics는 전문가 노동 2,800시간 이상을 들여 만들어졌는데, Gemini Deep Research와 OpenAI Deep Research 둘 다 평균 루브릭 준수율 68% 미만에 놓았습니다. 전문가의 탐사 기사에서 뽑아낸 9,430개 이진 루브릭으로 구성된 DeepResearch Bench II는 2026년 1월에, 가장 강한 모델조차 그중 절반도 채우지 못했다고 보고했습니다. 이후 라이브 리더보드는 그 선을 넘어섰는데, 흔히 보이는 궤적입니다.

이 수치들로 도구를 고르기 전에 두 가지를 더 조심하십시오. 어떤 모델이 루브릭을 채점하느냐에 따라 점수가 10점 넘게 움직이고 상위 두 자리의 순서까지 바뀔 수 있습니다. 그러니 심판이 뒤섞인 표는 에이전트가 아니라 심판에 대해 말해 주는 표입니다. 그리고 라이브 웹을 훑는 에이전트는 벤치마크 자체의 정답을 가져올 수 있습니다. 2026년의 한 연구는 이로 인한 점수 부풀림을 최대 4%까지 측정했습니다. Google이 공개한 평가 방법론은 이제 테스트 중 Hugging Face 같은 사이트를 차단하는데, 이는 이 문제가 공학적으로 대응할 만큼 실재한다는 뜻입니다.

SimpleQA는 이제 헤드라인이 아니라 각주에 어울립니다. Perplexity의 93.9%는 진짜지만 2025년 2월 수치이고, 앞서 다뤘듯 그 형태로는 더 이상 존재하지 않는 Sonar 기반 제품을 설명합니다.

가장 오래 살아남은 독립적 발견은 동시에 가장 오래된 것이기도 합니다. 컬럼비아 저널리즘 리뷰의 Tow Center는 AI 검색 엔진 여덟 개를 1,600개 쿼리로 테스트해, 이들이 60%가 넘는 경우에 정확한 정보를 찾아내지 못했고 엔진에 따라 오류율이 37%에서 94%까지 걸쳐 있음을 확인했습니다. 이 연구는 2025년 3월의 것이며 Tow Center는 같은 규모의 후속 연구를 내놓지 않았는데, 그 자체가 독립 평가가 얼마나 빈약한지를 말해 줍니다.

솔직하게 읽자면 이렇습니다. 벤치마크는 난이도의 극단적 상단에서는 도구의 순위를 안정적으로 매기고, 그 아래에서는 형편없이 매깁니다. 같은 실제 프롬프트를 두 도구의 가장 저렴한 유료 등급에 각각 돌려 보고 비교하십시오. 벤치마크는 참고일 뿐이고, 결정적인 것은 여러분 자신의 테스트입니다. 벤치마크 집착이 왜 사람을 오도하는지에 대한 더 긴 논의는 AI 사고의 함정을 보십시오.


무료 등급 현실 점검

마케팅 페이지는 하나같이 무료 이용을 앞세웁니다. 2026년 9월에 "무료"가 실제로 무엇을 뜻하는지 정리했는데, 솔직한 답은 인정에서 시작합니다. 수치는 나아진 게 아니라 찾기가 더 어려워졌습니다.

무료 사용량이 있는 곳은 OpenAI뿐이고, 얼마인지는 더 이상 밝히지 않습니다. 아직도 도는 "월 무료 5회, Plus 25회, Pro 250회" 수치는 2025년 4월 블로그 업데이트에서 온 것입니다. 현재 가격 페이지는 Free와 월 8달러 Go 등급에 Limited, Plus에 Expanded, Pro에 Maximum이라고 적고, 헬프 센터는 30일마다 초기화되는 제품 내 카운터가 있다고만 확인해 줄 뿐 시작값이 얼마인지는 말하지 않습니다. 현재 공개된 유일한 수치는 비즈니스 요금표에 있으며, 딥 리서치 작업 한 건에 50크레딧이 듭니다. 예측 가능한 할당량이 필요하다면 이곳이 가장 예측하기 어려운 벤더입니다.

Perplexity는 Deep Research를 유료 장벽 뒤로 옮겼습니다. 무료 계정은 검색만 됩니다. Deep Research는 Pro 기능이고, 이제 Perplexity Computer 안에서 돌기 때문에 Pro와 Max 전용입니다. 이 가이드도 예전에 무료 등급에 "하루 5회"라고 적었는데, 그것은 이후 다시 만들어진 제품을 두고 말한 2025년의 사실이었습니다.

Gemini에서 진짜 이야깃거리는 저렴한 등급이지 무료 등급이 아닙니다. Google은 요금제 사용량을 횟수가 아니라 배수로 공개하고 한도는 다섯 시간마다 갱신되며, 자체 요금제 페이지는 Deep Research를 유료 등급에 두고 있습니다. Google을 가성비 선택지로 만드는 것은 무료 사용량이 아니라 AI Plus가 월 4.99달러, 즉 다른 모든 곳의 진입 가격보다 한참 낮다는 사실입니다.

Claude에는 무료 Research가 없지만, Pro 전용도 아닙니다. Research는 무료 요금제에서 쓸 수 없고 모든 유료 요금제에서 쓸 수 있습니다. Pro 20달러, Max 100달러 또는 200달러, 그리고 Team과 Enterprise입니다. 이 가이드의 이전 버전은 Pro 전용이라고 설명했는데, 이는 대상 범위를 축소해 말한 것이었습니다.

실용적으로 읽으면, 이제 돈을 내지 않고 실제 업무에 기댈 수 있는 딥 리서치 도구는 없습니다. 하나만 결제한다면, 월 4.99달러인 Gemini AI Plus가 벤치마크 선두 에이전트에 닿는 가장 싼 길이고, 월 20달러 Perplexity Pro는 돈 대비 사용량이 가장 좋습니다. 모호한 질문에 가장 깊은 결과물을 원한다면 월 20달러 ChatGPT Plus가 OpenAI Deep Research와 나머지 번들 전부를 사 줍니다. Claude Pro는 이미 읽고 쓰는 데 Claude를 쓰고 있고 구독을 하나로 묶고 싶을 때 가장 합리적입니다.


어떤 일에 어떤 도구를 쓸까

이 도구들 전부에 걸쳐 수백 건의 쿼리를 돌려 보면 분명한 패턴이 드러납니다. 지금이라면 저는 이렇게 일을 배분하겠습니다.

학술 문헌 리뷰. Claude Research입니다. 에이전트가 논문 20편 이상을 동시에 붙들고 있어야 할 때 100만 토큰 컨텍스트가 의미를 갖고, Claude는 겉으로 비슷해 보이는 주장들을 구분하는 데 눈에 띄게 낫습니다. 실행은 더 오래 걸리지만 문헌 리뷰는 시간에 쫓기는 작업이 아닙니다.

시장 규모 산정과 경쟁 정보 수집. OpenAI Deep Research입니다. 모호한 전략적 질문에서 추론의 깊이가 여기서 분명히 드러납니다. "이 산업을 이해할 수 있게 도와 달라" 같은 프롬프트에서 제가 가장 신뢰하는 도구입니다.

가장 어려운 사실 검색. Gemini Deep Research Max입니다. 벤치마크 선두가 알려 주는 것이 있다면, 잘 알려지지 않은 다단계 사실을 찾아내는 데서는 Google의 고노력 등급이 출시된 에이전트 중 가장 강하다는 점입니다. 표준 등급은 의미 있게 다른 제품이므로 Max 등급을 의식적으로 선택하십시오.

회의 전 빠른 브리핑. Perplexity입니다. 보고서가 더 짧고 백과사전에 가까운데, 에세이가 아니라 방향 감각이 필요할 때 딱 그런 형태가 좋습니다.

내 문서를 포함한 리서치. Gemini Deep Research입니다. Workspace 통합이 해자입니다. 자료의 절반이 Drive, Gmail, 오래된 회의록에 있다면 견줄 만한 것이 없습니다.

개발자 연동과 대량 실행. 이제 턴키 선택지는 Google의 Deep Research API입니다. Perplexity의 Sonar 라인은 2026년 9월 27일에 폐기되고 OpenAI에는 전용 리서치 모델이 없기 때문입니다. 인용 형식과 비용을 통제하고 싶다면 Exa, Tavily, 또는 You.com의 Research API 위에 루프를 직접 만드십시오.

제품 안에서 돌리는 저렴한 대량 리서치. 중간 등급 모델에 좋은 검색 제공자와 넉넉한 턴 예산을 붙이는 구성입니다. 위의 벤치마크 근거에 따르면 이 조합이 비용의 일부만으로 정확도 대부분을 가져다주며, 실제 프로덕션 기능 대부분이 이 구성으로 출시됩니다.

모순되는 근거의 종합. Claude입니다. 출처들이 엇갈릴 때, 성급히 한쪽 편을 들기보다 그 불일치를 드러내려는 의지가 가장 강합니다.

의외일 수 있는 패턴이 하나 있습니다. 어느 한 도구도 지배적이지 않습니다. 저는 중요한 작업에서는 같은 프롬프트를 두 에이전트에 돌립니다. 구독 두 개에 월 40달러 정도가 들지만, 결과물은 어느 한쪽만 쓸 때보다 눈에 띄게 좋습니다. AI가 공부나 업무 루틴에 어떻게 들어맞는지를 더 넓게 고민하고 있다면, AI 학습 모드 비교가 그 인접 질문을 다룹니다.


빠진 조각: 리서치 보고서를 쓸 수 있는 지식으로 바꾸기

비교 글이 거의 언급하지 않는 부분이 여기 있습니다. 에이전트가 만들어 낸 보고서는 원재료이며, 제대로 읽기 전까지 리서치는 끝나지 않았습니다.

20페이지짜리 Claude Research 결과물이나 15페이지짜리 OpenAI Deep Research 보고서는 일의 끝이 아니라 시작입니다. 한 번 읽고, 결론만 훑고, 탭을 닫는다면, 실제로 배우지 못한 것을 요약하라고 에이전트에 돈을 낸 셈입니다. 2025년 MIT 미디어랩 연구(AI가 학습에 미치는 영향 분석에서 추적하고 있습니다)는 ChatGPT를 쓸 때와 쓰지 않을 때 에세이를 쓰는 사람들의 EEG 활동을 측정해, 도움을 받은 집단에서 인지적 관여가 뚜렷이 낮아지는 것을 확인했습니다. 읽기가 아니라 쓰기를 다룬 소규모 프리프린트였지만, 그것이 가리키는 방향은 AI를 많이 쓰는 사람이라면 누구나 알아보는 방향입니다.

해법은 연구자들이 수백 년 동안 해 온 일, 즉 주석입니다. 중요한 주장에 하이라이트를 긋고, 검증하고 싶은 출처에 표시를 남기고, 보고서를 가로질러 통찰을 연결하십시오.

바로 여기에 Glasp의 웹 하이라이터가 워크플로에 들어맞습니다. 리서치는 OpenAI, Perplexity, Gemini, Claude 어디서 돌려도 됩니다. 보고서를 읽기 좋은 페이지에 붙여 넣으세요. 읽으면서 브라우저에서 바로 하이라이트해 보세요. 하이라이트는 Glasp 라이브러리로 동기화되어, 그달에 읽은 나머지 모든 것과 함께 검색 가능하고 정리된 상태로 쌓입니다.

실제로 잘 통하는 워크플로 몇 가지입니다.

하이라이트한 뒤 다시 물어보기. 보고서를 읽고 가장 중요한 주장 10~15개를 하이라이트해 보세요. 그 하이라이트를 같은 에이전트에 다시 붙여 넣고 "이 지점들을 더 깊이 파 달라"고 요청하면 됩니다. 한 방이 아니라 반복입니다.

주제별로 보고서 쌓기. 같은 주제를 두 도구로(예를 들어 OpenAI와 Claude로) 리서치했다면, 두 보고서를 Glasp에서 하이라이트해 두면 어디서 수렴하고 어디서 갈라지는지 볼 수 있습니다. 불일치 지점이 가장 흥미로운 부분인 경우가 많습니다.

텍스트와 함께 YouTube 쓰기. 최고의 출처가 팟캐스트나 강연일 때는 YouTube Summary가 타임스탬프가 달린 트랜스크립트 수준의 요약을 제공합니다. 텍스트 딥 리서치 보고서 하나에 주석을 단 YouTube 강연 서너 개를 붙이면, 어느 한쪽만 쓸 때보다 주제를 더 촘촘하게 덮을 수 있습니다.

내 하이라이트와 대화하기. Glasp의 AI 챗은 여러분의 주석을 출처로 삼아 질문에 답할 수 있습니다. "에이전트가 X에 대해 뭐라고 했지?"와 "나는 X에 대해 실제로 어떤 결론에 이르렀지?"의 차이입니다.

배운 것을 공개하기. Glasp의 커뮤니티에는 비슷한 주제를 조사하는 사람들이 가득합니다. 하이라이트한 보고서를 공유하는 일은 리서치를 더 쌓아 두기만 하지 않고 끝내게 만드는 강제 장치입니다. 단계별 안내는 글에 제대로 주석 다는 법을 보십시오.

한 번 읽고 만 보고서는 지식이 아니라 영수증입니다. 에이전트의 출력을 실제로 아는 것으로 바꾸는 단계가 바로 하이라이트와 주석입니다.


자주 묻는 질문

어떤 딥 리서치 도구가 가장 정확한가요?

빅4 중에서는 Google의 Gemini Deep Research Max가 Humanity's Last Exam 54.6%로 앞섭니다(Google, 2026년 4월). 이름을 조심하십시오. 표준 Deep Research 등급은 같은 시험에서 50.4%를 기록했는데, 비교 글 대부분이 Max 수치를 일반 제품명으로 인용합니다. Moonshot의 Kimi K3는 그보다 높은 56.0%를 주장합니다. 이 모두가 벤더 자기 보고이며, 제3자 테스트에서는 아무도 판매하지 않는 모델과 검색의 조합이 출시된 모든 에이전트를 앞질렀습니다. 실제로 써 보면 상위 도구들 사이의 정확도 차이는 리더보드가 시사하는 것보다 작습니다.

ChatGPT 딥 리서치의 가장 좋은 대안은 무엇인가요?

대부분의 사람에게는 공개 벤치마크 성적이 가장 좋고 유료 진입이 월 4.99달러로 가장 싼 Gemini Deep Research, 또는 더 폭넓고 빠른 Perplexity입니다. 빅4 밖에서 찾는다면, Moonshot의 Kimi는 문서화가 잘된 Deep Research 모드를 갖췄고, Mistral은 월 14.99달러로 도전자 중 가장 저렴하며, xAI의 Grok은 멀티 에이전트 모드를 제공합니다. 직접 호스팅하고 싶다면 GPT Researcher와 ByteDance의 DeerFlow가 활발히 유지되는 오픈소스 선택지입니다. 2026년 8월에 아카이브된 LangChain의 open_deep_research와, 1년 넘게 풀 리퀘스트를 하나도 머지하지 않은 스탠퍼드의 STORM은 피하십시오.

가장 좋은 딥 리서치 API는 무엇인가요?

대부분의 팀에게는 Interactions API의 Google Deep Research 모델입니다. 프런티어 랩이 내놓은 턴키 리서치 API 중 폐기되지 않는 유일한 선택지이고, 작업당 대략 13달러(Max는 37달러)라는 가격 추정치를 공개하며, 실제 시간 예산도 문서화합니다. 이미 Sonar를 쓰고 있다면 Perplexity의 Agent API가 자연스러운 착지점입니다. sonar-deep-research는 2026년 9월 27일에 지원이 끝나기 때문입니다. 인용 형식과 비용을 통제하고 싶다면, 완성된 보고서를 사기보다 Exa, Tavily, You.com 위에 루프를 직접 만드십시오.

가장 빠른 딥 리서치 API는 무엇인가요?

문서상으로 가장 빠른 곳은 Google입니다. 대부분의 Deep Research 작업이 20분 안에 끝나고 상한은 60분입니다. 다른 어느 곳도 현행 지연 시간 수치를 공개하지 않는데, 그 자체가 답이기도 합니다. OpenAI는 "수십 분"이라고만 말하고, Perplexity의 2분에서 4분은 2025년 2월 출시 시점의 수치입니다. 속도가 필요하다면 지렛대는 벤더가 아니라 노력입니다. 이제 이 API들은 모두 등급 다이얼을 노출하고, 낮은 등급은 몇 초에서 몇 분 안에 응답합니다. 여러분의 모델에 넣을 출처 달린 원시 결과를 몇 초 안에 받고 싶다면 Exa, Tavily, You.com의 낮은 노력 등급이 빠른 길입니다.

딥 리서치 실행에는 얼마나 걸리나요?

벤더가 공개한 수치만 쓰자면 이렇습니다. Google은 대부분의 작업이 20분 안에 끝나며 상한은 60분이라고 말합니다. Moonshot은 Kimi가 10분에서 25분 걸린다고 말합니다. OpenAI의 출시 페이지는 여전히 5분에서 30분이라고 적고 있는데, 2025년 2월 이후 고치지 않은 문장입니다. Perplexity의 2분에서 4분도 같은 달의 수치입니다. Anthropic은 Research의 답이 "몇 분 안에" 온다고만 말합니다. 세 제품 모두 그 이후 다시 만들어졌으므로, 오래된 수치는 역사적 기록으로 취급하십시오.

딥 리서치 도구를 API로 쓸 수 있나요?

가능하며, 2026년에 선택지가 크게 바뀌었습니다. Interactions API의 Google Deep Research 모델이 턴키 옵션이고, 작업당 대략 13달러, Max 등급은 37달러입니다. Perplexity의 sonar-deep-research는 개발자들이 가장 선호하던 선택지였지만 2026년 9월 27일에 지원이 끝나고 Agent API의 노력 프리셋으로 대체됩니다. OpenAI는 전용 모델 o3-deep-research와 o4-mini-deep-research를 2026년 7월 23일에 폐기했으므로, 이제는 Responses API에서 웹 검색 도구를 켠 플래그십 모델을 돌리거나 2026년 9월부터 퍼블릭 베타인 Agents API를 쓰면 됩니다. Anthropic에는 리서치 전용 API가 없지만 베타인 Claude Managed Agents가 있고, 토큰 비용에 세션 시간당 0.08달러가 더해집니다. Exa, Tavily, You.com은 직접 만드는 쪽에서 인기 있는 선택지입니다.

인용이 가장 좋은 딥 리서치 API는 무엇인가요?

Google과 Perplexity는 인용이 완전히 달린 보고서를 기본으로 반환합니다. 모든 주장을 URL까지 추적해야 하는 프로덕션 시스템이라면 보통 Exa, Tavily, You.com 위에 구축합니다. 출처가 달린 결과를 받아 자기 모델에 넣기 때문에 형식을 직접 통제하고 감사 추적도 보여 줄 수 있습니다. 웹 검색 도구를 가진 모델이라면 어느 것이든 프롬프트로 지시하면 본문에 인용을 달 수 있습니다. 다만 이에 관한 독립 연구를 기억하십시오. 가장 좋은 평가를 받은 시스템조차 인용 루브릭 항목의 11% 미만만 온전히 충족했습니다. 인용이 붙어 있다는 것과 인용이 충분하다는 것은 다릅니다.

무료 딥 리서치 도구가 있나요?

간신히 있고, 2026년에 더 나빠졌습니다. 네 곳 중 무료 계정에 딥 리서치 사용량을 여전히 주는 곳은 OpenAI뿐이며, 횟수를 공개하지 않은 채 "Limited"라고만 표현합니다. Perplexity는 Deep Research를 Pro 뒤로 옮겼고, Claude는 한 번도 무료로 제공한 적이 없으며, Google은 유료 요금제에 둡니다. 꾸준히 일에 쓰려면 현실적인 진입점은 월 4.99달러 Gemini AI Plus나 빅3 중 한 곳의 20달러 요금제입니다. 정말로 무료인 것을 원하고 직접 돌리는 수고를 감수할 수 있다면, 위에서 다룬 오픈소스 에이전트들이 솔직한 답입니다.

딥 리서치 보고서의 환각은 어떻게 막나요?

실용적인 방법이 세 가지 있습니다. 첫째, 인용된 출처 중 적어도 상위 세 개에서 다섯 개를 클릭해 그 주장이 실제로 출처 안에 있는지 확인하십시오. 가짜 출처를 지어내는 것보다 진짜 출처를 잘못 인용하는 경우가 훨씬 많습니다. 둘째, 같은 프롬프트를 두 번째 도구에도 돌리십시오. 불일치가 생긴 지점이 보통 둘 중 하나가 틀린 곳입니다. 셋째, 이것을 소프트웨어로 만든다면 검증을 프롬프트 속 한 줄이 아니라 별도의 파이프라인 단계로 두십시오. 주장을 하나씩 추출하고, 깨끗한 컨텍스트에서 검증한 다음, 회의론자 패스가 그 판정에 이의를 제기하게 하십시오. OpenAI와 Anthropic이 공개한 쿡북이 함께 수렴한 패턴입니다.

딥 리서치 도구가 내 비공개 문서를 읽을 수 있나요?

Gemini Deep Research의 통합이 가장 깊어서, 허가를 받으면 Gmail, Drive, Docs에 네이티브로 접근합니다. Claude는 Google Workspace 커넥터를 지원합니다. OpenAI Deep Research는 세션 중에 업로드한 파일을 읽을 수 있지만 클라우드 스토리지와 직접 연동되지는 않습니다. Perplexity는 주로 웹을 대상으로 동작합니다. 자료 대부분이 Google Workspace에 있다면 Gemini가 당연한 선택입니다.

딥 리서치 보고서를 저장하고 재사용하는 가장 좋은 방법은 무엇인가요?

보고서를 PDF나 마크다운으로 내보내고, 읽기 좋은 화면에서 열어, 긴 글을 읽듯 하이라이트하십시오. Glasp는 바로 이 워크플로를 위해 만들어졌습니다. 하이라이트는 검색하고, 다른 하이라이트와 연결하고, 다시 찾아볼 수 있는 라이브러리로 동기화됩니다. 하이라이트 단계가 없으면 딥 리서치 보고서 대부분은 한 번 읽히고 잊힙니다. 이는 교육자들이 생성 효과라고 부르는 것과 이어집니다. 능동적으로 처리한 정보는 수동적으로 받아들인 정보보다 훨씬 오래 남습니다.


결론: 리서치 도구가 아니라 리서치 스택

OpenAI의 출시로부터 19개월이 지나면서 이 카테고리는 정리되었다가 다시 재편되기 시작했습니다. 딥 리서치 에이전트는 승자 독식 시장이 아닙니다. 무엇을 조사하는지, 시간이 얼마나 있는지, 자료가 어디에 있는지, 버튼을 누르는지 아니면 API를 호출하는지에 따라 정답이 달라지는 혼합 시장입니다.

지금 대부분의 지식 노동자에게 하나만 고르라면 Gemini입니다. 공개된 벤치마크 성적이 가장 좋고, 유료 진입이 4.99달러로 가장 싸며, 폐기 시계가 돌아가지 않는 유일한 프런티어 랩 리서치 API입니다. 더 무겁거나 더 모호한 작업이라면 OpenAI Deep Research나 Claude Research와 함께 쓰십시오. Sonar에서 이전하는 개발자라면 9월 27일 전에 Perplexity의 Agent API를 살펴보십시오.

더 깊은 변화는 구조적입니다. 전용 딥 리서치 모델은 모든 랩에서 퇴장하는 중입니다. OpenAI는 리서치 모델을 폐기했고, Perplexity는 Sonar를 폐기하는 중이며, Google은 모델이 아니라 에이전트를 내놓고, Anthropic은 매니지드 하네스를 내놓으며, xAI는 에이전트 개수를 고르게 합니다. 그 자리를 대신한 것이 노력 다이얼입니다. 무언가를 만드는 사람에게는 좋은 소식입니다. 노력은 요청마다 조절할 수 있는 파라미터이기 때문이고, 2026년의 가장 유용한 벤치마크 발견이 모델은 그대로 둔 채 검색 예산을 올리는 것만으로 정확도가 53점 움직였다는 사실인 이유이기도 합니다.

그러나 도구 선택보다 중요한 것은 그 출력으로 무엇을 하느냐입니다. 사람들이 저지르는 가장 큰 실수는 딥 리서치 보고서를 완성된 작업물로 취급하는 것입니다. 그렇지 않습니다. 원재료입니다. 실제 지식은 중요한 주장에 하이라이트를 긋고, 그것을 이전에 읽은 것들과 연결하고, 나중에 그 주제가 다시 나왔을 때 되짚어볼 때 만들어집니다.

Glasp가 설계된 워크플로가 바로 그것입니다. 어떤 보고서든, 어떤 글이든, 어떤 YouTube 트랜스크립트든 하이라이트할 수 있습니다. 스스로 중요하다고 판단한 것들로 검색 가능한 라이브러리를 쌓아 보세요. 구체적인 무언가를 떠올려야 할 때 나중에 자기 하이라이트와 대화하면 됩니다. 같은 주제를 조사하는 다른 사람들과 작업을 공유해 보세요.

딥 리서치 에이전트는 계속 좋아질 것이고, API도 계속 늘어날 것입니다. 그 위에 하이라이트 계층을 얹지 않는 쪽은 한 번 읽히고 잊히는 보고서를 계속 만들어 낼 것입니다. 2026년의 리서치 워크플로를 하나의 도구를 중심으로 짜지 마세요. 스택을 중심으로 짜고, 그 스택의 마지막 고리는 여러분 자신의 이해가 기록되는 자리여야 합니다.

이번 주에 진짜 리서치 질문 하나를 네 도구 중 두 곳에 돌려 보는 것부터 시작해 보세요. 두 보고서를 모두 하이라이트해 보세요. 무엇을 배웠는지 비교해 보면 됩니다. 그것이 워크플로입니다. 나머지는 전부 기능 목록일 뿐입니다.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it