딥 리서치의 순간
그냥 고를 것만 알고 싶다면 짧은 답은 이렇습니다. 2026년 대부분의 사람에게 Perplexity Pro는 가격과 속도 면에서 가장 균형 잡힌 딥 리서치 도구이고, OpenAI와 Claude는 어렵거나 모호한 작업에서 가장 깊이 있는 보고서를 만들며, Gemini는 소스 자료가 Google에 있거나 호출 가능한 API가 필요할 때 승리합니다. 개발자라면 Perplexity의 Sonar Deep Research와 Google의 Deep Research API가 오늘 실제로 그 위에서 개발할 수 있는 두 가지입니다. OpenAI는 2026년 7월에 전용 딥 리서치 모델을 폐기했고 Anthropic은 애초에 하나도 내놓지 않았기 때문입니다. 이 가이드의 나머지는 그 결론이 가격, 속도, 벤치마크, 실제 작업 전반에서 어떻게 유지되는지 보여 줍니다.
이 범주 자체가 겨우 18개월밖에 되지 않았습니다. 2025년 2월 2일, OpenAI는 Deep Research를 발표했습니다. 이것은 대부분의 사람이 써 본 첫 에이전트로, 한 문장짜리 프롬프트를 받아 30분짜리 조사를 계획하고, 스스로 수십 개의 소스를 탐색한 뒤, 인용이 달린 보고서를 들고 돌아올 수 있었습니다.
업계의 반응은 시사하는 바가 컸습니다. 6주 이내에 Perplexity가 자체 Deep Research를 내놓았고(2월 14일), 몇 주 뒤 개발자에게 Sonar Deep Research API를 개방했습니다. 2024년 12월 Gemini Deep Research를 조용히 출시했던 Google은 배포를 가속했고 백본을 계속 업그레이드했습니다. Anthropic은 2025년 5월 7일에 Claude의 웹 검색을 일반 공개하며, 같은 봄 시기에 Research 기능을 함께 패키징했습니다.
4개 랩, 하나의 제품 범주, 한 분기. 이건 우연이 아닙니다. 2024년은 컨텍스트 윈도가 200K 토큰을 넘어서고, 도구 사용이 신뢰할 만해졌으며, 에이전트 루프가 중간에 조용히 실패하는 일이 멈춘 해였습니다. 딥 리서치는 이 세 가지 모두를 돈 낼 가치가 있게 느끼게 만든 첫 소비자용 앱이었습니다. 이는 우리가 에이전틱 웹: MCP 프로토콜 전쟁의 내막에서 다룬 에이전트 프로토콜로의 더 큰 전환과 밀접하게 얽혀 있습니다.
글을 쓰거나, 공부하거나, 시장을 분석하거나, 제품을 평가한다면, 이 중 하나를 쓰지 않는 것만으로도 이미 불리한 위치에 있습니다. 문제는 어느 것을, 그리고 언제 쓰느냐입니다.
"딥 리서치"가 실제로 하는 일
딥 리서치를 채팅 검색과 혼동하기 쉽습니다. 질문을 입력하면 링크가 달린 답을 받으니까요. 하지만 작동 방식은 다릅니다.
채팅 검색(브라우징이 켜진 일반 ChatGPT 같은 것)은 웹 쿼리를 한두 번 돌린 뒤 상위 결과를 몇 초 만에 종합합니다. 딥 리서치 에이전트는 주니어 분석가가 오후 내내 하는 일에 더 가까운 작업을 합니다. 질문을 하위 질문으로 쪼개고, 수십 또는 수백 건의 검색을 돌리며, 전체 페이지를 읽고, 인용을 따라가고, 배우면서 계획을 갱신하며, 각주가 달린 구조화된 보고서를 만듭니다.
채팅 검색에 "필립스 곡선에 대한 주요 비판은 무엇인가?"라고 물으면 세 문단짜리 요약을 받습니다. 같은 질문을 딥 리서치 에이전트에게 던지면, 프리드먼의 자연실업률 가설, 1970년대 스태그플레이션 붕괴, 합리적 기대 수정론, 2008년 이후의 곡선 평탄화 논쟁, 2023~2025년의 최근 논문들을 각각 클릭할 수 있는 소스와 함께 다룬 15페이지짜리 보고서를 받습니다.
트레이드오프는 시간입니다. 실행은 도구와 깊이에 따라 3분에서 45분 사이가 걸립니다. 그게 바로 핵심입니다. 하나를 큐에 넣고, 다른 일을 하다가, 수작업으로 짜맞췄다면 반나절이 걸렸을 보고서를 받으러 돌아오면 됩니다. AI 에이전트를 중심으로 리서치 습관을 재구성하는 방법에 관해서는 2026년 AI 기반 리서치 워크플로 구축하기를 참고하세요.
정면 대결: 소비자용 4개 도구 비교
여기 매트릭스가 있습니다. 백본 모델과 가격은 2026년 8월 현재 제품 페이지에 대조해 확인했습니다.
| 도구 | 백본 모델 (2026) | 가격 및 한도 | 일반적 속도 |
|---|---|---|---|
| OpenAI Deep Research | GPT-5.x 추론 | 무료: 월 5회; Plus ($20/월): 월 25회; Pro ($100 또는 $200/월): 월 250회 | 5~30분 |
| Perplexity Deep Research | Sonar | 무료: 하루 5회; Pro ($20/월); Max (~$200/월); 개발자용 Sonar API | 3분 미만 |
| Gemini Deep Research | Gemini 3.1 Pro | AI Plus ($4.99/월); AI Pro ($19.99/월): 더 높은 한도; AI Ultra ($99.99 또는 $199.99/월) | 5~15분 |
| Claude Research | Sonnet 5 / Opus 5, 1M ctx | Pro ($20/월) 및 Max ($100 또는 $200/월)에 포함 | 5~45분 |
한 문단짜리 프로필:
OpenAI Deep Research는 헤비급입니다. 실행은 더 느리고, 보고서는 가장 길며, 추론은 모호한 주제에서 눈에 띄게 깊습니다. 원래는 커스텀 o3 모델에서 돌아갔고 지금은 OpenAI의 GPT-5.x 추론 라인에 얹혀 있습니다. Plus의 월 25회 한도가 진짜 제약입니다. 헤비 유저는 일주일 만에 다 써 버리는데, 그래서 OpenAI가 2026년에 기존 $200 Pro 플랜을 $100과 $200 티어로 나눈 것입니다.
Perplexity Deep Research는 속도 챔피언입니다. 대부분의 실행이 2~3분 안에 끝납니다. 보고서는 더 짧고 백과사전적이어서, 에세이보다는 브리핑에 이상적입니다. 또한 4개 중 리서치 에이전트가 제대로 된 개발자 API로 출시된 유일한 도구입니다.
Gemini Deep Research는 2026년에 가장 요란한 성과를 냈습니다. Google은 2026년 4월에 소비자용 에이전트를 Gemini 3.1 Pro로 업그레이드했고, 결정적으로 Deep Research API를 노출해 개발자가 동일한 기능을 호출할 수 있게 했습니다. 여전히 웹과 함께 여러분의 Gmail, Drive, Docs에서 자료를 끌어오며, 에이전트가 실행되기 전에 편집할 수 있는 리서치 계획을 눈에 보이게 표시합니다.
Claude Research는 참을성 있는 도구입니다. 실행이 흔히 30~45분 쪽 끝에 도달하며, 출력물이 그것을 반영합니다. 장문이고, 뉘앙스가 있으며, 모순되는 증거를 저울질하는 데 능합니다. Claude의 현행 모델(Sonnet 5, Opus 5)은 표준 가격으로 1M 토큰 컨텍스트를 갖추고 있어, 큰 소스 세트가 잘려 나가지 않습니다.
딥 리서치 API: 실제로 호출할 수 있는 것
이것이 비교 기사들이 계속 건너뛰는 질문이자, 개발자들이 계속 검색하는 질문입니다. 어떤 딥 리서치 에이전트를 여러분의 코드에서 호출할 수 있는지, 얼마나 빠른지, 인용은 얼마나 좋은지. 2026년에 지형이 크게 바뀌었으니, 현재 그림은 이렇습니다.
| 제공사 | 호출 가능한 딥 리서치? | 무엇을 호출하나 | 가격 |
|---|---|---|---|
| Perplexity | 예, 목적에 맞게 설계됨 | sonar-deep-research | 입력 100만당 $2, 출력 100만당 $8, 추가로 인용 100만당 $2 + 추론 토큰 100만당 $3, 추가로 검색 1,000건당 $5 |
| Google Gemini | 예, 2026년 신규 | Interactions API를 통한 Deep Research (백그라운드 모드) | deep-research-preview 작업당 deep-research-max 작업당 |
| OpenAI | 더 이상 전용 모델로는 아님 | web_search 도구를 갖춘 Responses API 상의 GPT-5.x | GPT-5.x 토큰 요금에 검색 도구 비용 추가; 기존 o3-deep-research($10/$40 per 1M)와 o4-mini-deep-research($2/$8 per 1M)는 2026년 7월 23일 종료 |
| Anthropic Claude | 전용 에이전트 없음 | Messages API web_search 도구, 또는 Claude Agent SDK | 검색 1,000건당 $10 + 모델 토큰 비용 |
| Exa | 직접 구축형 | Search / Deep Search / Agent 엔드포인트 | Search 1,000건당 $7; Deep Search 1,000건당 $12; Agent 엔드포인트 요청당 $0.012~$1.00 |
| Tavily | 직접 구축형 | Search / Research 엔드포인트 | 무료 월 1,000 크레딧; PAYG 크레딧당 $0.008; Research 실행당 15~250 크레딧 |
세 가지가 두드러집니다.
Perplexity는 여전히 유일한 턴키 딥 리서치 API입니다. sonar-deep-research에 프롬프트를 보내면 오케스트레이션 없이 인용이 달린 보고서를 돌려받습니다. 가격이 특이해 보이는 이유는, 다른 모두가 묻어 두는 숨은 비용을 정직하게 드러내기 때문입니다. 인용 토큰과 추론 토큰이 별도로 청구되고, 웹 검색은 토큰 비용에 더해 1,000건당 $5입니다. "가장 빠른 딥 리서치 API"를 찾고 있다면 이것이 직접적인 답입니다. 다른 것들이 5~45분 걸리는 데 반해 Sonar는 대부분의 실행을 3분 이내에 끝내기 때문입니다.
OpenAI는 딥 리서치를 자사의 일반 모델 라인으로 옮겼습니다. 전용 o3-deep-research와 o4-mini-deep-research 모델은 진짜로 훌륭했지만, OpenAI는 2026년 4월에 이들을 폐기 예고하고 2026년 7월 23일에 종료했습니다. 대체 경로는 Responses API에서 GPT-5.x 모델을 web_search 도구(선택적으로 원격 MCP 서버나 파일 검색 포함)와 함께 백그라운드 모드로 돌리는 것입니다. 더 많은 제어권을 얻고 여전히 딥 리서치 동작에 도달할 수 있지만, 처음부터 끝까지 알아서 해 주는 한 모델을 호출하는 대신 루프를 직접 조립하게 됩니다.
Google은 2026년에 조용히 문을 열었습니다. 이 범주가 존재한 대부분의 기간 동안 Gemini Deep Research는 프로그래밍적으로 호출할 수 없는 소비자용 기능이었습니다. 그것이 Google의 Interactions API를 통한 Deep Research API로 바뀌었고, Vertex AI에 대한 엔터프라이즈 지원도 발표되었습니다. Grounding with Google Search(Gemini 3.x 모델에서 월 5,000회 무료 검색, 이후 1,000건당 $14)와 결합하면, 이제 Google은 인용을 Google의 색인에 묶고 싶은 팀에게 진짜 선택지가 됩니다.
"인용이 달린 리서치 보고서를 위한 최고의 API"라는 쿼리에 특정해 말하면, 세 가지 접근이 통합니다. Perplexity는 인용을 기본으로 제공하며 강한 인용 정확도를 보고합니다. Exa와 Tavily는 여러분이 직접 모델에 넣는, 소스가 명시된 원시 검색 결과를 제공하는데, 이것이 사실 대부분의 프로덕션 딥 리서치 기능이 실제로 구축되는 패턴입니다. 비용과 인용 서식을 여러분이 제어하기 때문입니다. 그리고 웹 검색 도구를 갖춘 어떤 모델(Claude, GPT-5.x, Gemini)이든 여러분이 프롬프트로 지시하면 진행하면서 인용할 수 있습니다. 감사 추적이 필요한 기업은 대개 Exa나 Tavily 경로를 선호하는데, 모든 주장이 모델의 기억이 아니라 여러분이 가져온 URL로 거슬러 올라가기 때문입니다. 왜 그라운딩과 검색 품질이 순수 컨텍스트 크기보다 더 중요한지는 컨텍스트 로트: 왜 RAG는 여전히 거대한 컨텍스트 윈도를 이기는가를 참고하세요.
벤치마크: HLE, BrowseComp, SimpleQA
가장 많이 인용되는 숫자는 셋입니다. Humanity's Last Exam, BrowseComp, SimpleQA. 이들은 유용하지만, 동시에 과잉 해석되기도 합니다.
**Humanity's Last Exam (HLE)**는 Scale AI와 Center for AI Safety가 2025년 초에 공개한, 전문가가 답할 수 있는 한계 언저리에 있는 약 2,500문항짜리 다분야 벤치마크입니다. 점수는 이 범주가 얼마나 빠르게 움직였는지를 이야기해 줍니다.
| 에이전트 | HLE (도구 사용) | 보고 시점 |
|---|---|---|
| Perplexity Sonar Deep Research | 21.1% | 2025년 2월 |
| OpenAI Deep Research (o3) | 26.6% | 2025년 2월 |
| Gemini Deep Research (3 Pro) | 46.4% | 2025년 12월 |
| Gemini Deep Research Max (3.1 Pro) | 54.6% | 2026년 4월 |
1년 남짓 만에, 출시된 최고 에이전트가 HLE 점수를 두 배 넘게 끌어올렸습니다. HLE가 잘 측정하는 것은 진짜로 어려운 질문에 대한 분야 간 종합 능력입니다. 측정하지 못하는 것은 에이전트가 여러분이 실제로 하는 작업을 잘하느냐입니다. 대부분의 실제 리서치는 박사급 물리학이 아닙니다. "이 주제의 최근 논쟁을 요약해 줘"나 "내 용도에 맞게 이 다섯 제품을 비교해 줘"인데, 여기서 도구 간 격차는 리더보드가 시사하는 것보다 훨씬 작습니다.
BrowseComp(OpenAI, 2025년 4월)는 이런 에이전트들에게 더 적절한 기준이 되었습니다. 끈기와 좋은 검색 전략에 보상을 주는 1,266개의 어려운 다단계 브라우징 질문입니다. OpenAI Deep Research는 출시 당시 51.5%를 기록했고, Google의 Deep Research Max는 2026년 4월에 85.9%를 보고했습니다. 표준적인 데이터 포인트는 평범한 브라우징 모델이 같은 테스트에서 2% 미만을 기록했다는 것으로, 이는 이득의 거의 전부가 베이스 모델이 아니라 에이전트 스캐폴딩에서 온다는 뜻입니다.
SimpleQA는 Perplexity가 강한 성적을 낸 곳입니다. 이 벤치마크는 단문형 사실 정확도를 테스트하는데, Sonar Deep Research가 93.9%를 기록했습니다(Perplexity, 2025년 2월). 이는 "에이전트가 사실을 환각하는가?"에 대한 유용한 대리 지표이며, 출력물을 인용하려 할 때 매우 중요합니다. 이는 검색을 갖춘 에이전트의 수치이므로, 맨 모델이 기록하는 ~50%와는 비교할 수 없다는 점에 유의하세요.
정직한 해석은 이렇습니다. 벤치마크는 난이도의 극단적 최상단에서는 도구 순위를 신뢰성 있게 매기지만, 그 아래에서는 형편없이 매깁니다. 고르는 가장 좋은 방법은 무료 티어에서 동일한 실제 프롬프트를 두세 개 도구에 돌려 비교하는 것입니다. 벤치마크는 참고가 됩니다. 결정적인 것은 여러분 자신의 테스트입니다. 벤치마크 집착이 왜 오도하는지에 대한 더 긴 논의는 AI 사고의 함정을 참고하세요.
무료 티어 현실 점검
마케팅 페이지는 모두 무료 접근을 부각합니다. 이 도구들을 실제 작업에 써 보려 할 때 "무료"가 실제로 무엇을 뜻하는지 봅시다.
OpenAI Deep Research (무료: 월 5회). 평가하기엔 충분하지만, 의존하기엔 부족합니다. 프로젝트 하나가 흔히 실행 2~3회(첫 패스, 후속, 명확화)를 잡아먹습니다. 업무에 쓴다면 10일째면 한도에 부딪힙니다. 25회를 주는 월 $20의 Plus가 현실적인 시작 티어입니다.
Perplexity Deep Research (무료: 대략 하루 5회). 이 중 가장 넉넉합니다. Perplexity는 무료 사용자에게 하루 몇 회의 Deep Research 실행을 허용하는데, 그래도 대부분의 사람이 필요로 하는 것 이상으로 쌓입니다. 무료 티어 출력은 Pro보다 짧고, 더 새로운 Sonar 변형은 받지 못합니다. 가벼운 사용이라면 이것이 실제로 계속 쓰게 되는 무료 티어입니다.
Gemini Deep Research (무료: 제한적 접근). Google은 2026년에 플랜을 재편했고, 가장 저렴한 유료 티어인 Google AI Plus가 월 $4.99로 내려갔습니다. 이미 AI Pro를 결제하고 있지 않다면 Gemini가 저비용 진입점이 됩니다. 무료 접근은 존재하지만 유료 티어보다 덜 자주, 더 짧게 실행됩니다.
Claude Research (Pro 전용, 월 $20). Research 기능에는 전용 무료 티어가 없습니다. 무료 플랜에는 채팅과 웹 검색이 포함되지만, 다단계 리서치는 Pro 뒤에 있습니다. Pro에는 Claude의 Sonnet 5 접근도 포함되므로(상위 티어에서는 Opus 5), $20으로 시장에서 가장 강력한 장문 컨텍스트 독해 모델 중 하나를 얻는 셈입니다.
| 무료 티어 요약 | 실제 작업에 쓸 만한가? |
|---|---|
| OpenAI Deep Research (월 5회) | 평가용만 |
| Perplexity Deep Research (하루 5회) | 예, 가벼운 사용에는 |
| Gemini Deep Research (제한적) | 부분적, AI Plus나 Pro면 더 나음 |
| Claude Research | 무료 티어 없음 |
하나만 결제한다면 Perplexity Pro가 $20에서 가장 높은 볼륨 대비 가격 비율을 줍니다. 가장 똑똑한 출력만 원한다면 $20의 ChatGPT Plus가 OpenAI Deep Research 25회 실행에 더해 Plus 번들의 모든 것을 줍니다. Google Workspace 사용자이거나 월 비용이 가장 낮기를 원한다면 Gemini의 AI Plus와 AI Pro 티어가 자연스러운 선택입니다. 이미 읽고 쓰는 데 Claude를 쓰고 있고 통합된 구독 하나를 원한다면 Claude Pro가 가장 합리적입니다.
어떤 작업에 어떤 도구를
네 도구 전반에 걸쳐 수백 개의 쿼리를 돌려 보니 뚜렷한 패턴이 드러납니다. 지금이라면 저는 작업을 이렇게 배분하겠습니다.
학술 문헌 리뷰. Claude Research. 에이전트가 20편 넘는 논문을 작업 기억에 담아야 할 때 긴 컨텍스트 윈도가 중요하며, Claude는 피상적으로 비슷한 주장들을 구별하는 데 눈에 띄게 더 낫습니다. 실행은 더 오래 걸리지만, 문헌 리뷰는 시간에 쫓기는 작업이 아닙니다.
시장 규모 산정과 경쟁 인텔리전스. OpenAI Deep Research. 모호한 전략적 질문(어떤 시장이 왜 성장했는가, 무엇이 고객 이탈을 이끄는가)에 대한 추론의 깊이가 여기서 분명히 드러납니다. "이 산업을 이해하도록 도와줘" 류의 프롬프트에서 제가 가장 신뢰하는 도구입니다.
빠른 사실 브리핑. Perplexity Deep Research. 회의 전에 인용이 달린 두 페이지짜리 요약만 필요하다면, Perplexity의 3분 회전 속도는 이기기 어렵습니다. SimpleQA 스타일의 사실 정확도는 진짜 강점입니다.
구매 결정과 제품 비교. Perplexity 또는 Gemini. 둘 다 유용한 나란한 비교를 만들 만큼 충분한 실제 리뷰 데이터(포럼, YouTube 자막, 사양표)를 끌어옵니다. Gemini의 강점은 여러분 자신의 Gmail 영수증과 Drive 메모를 끌어온다는 점입니다.
여러분 자신의 문서를 다루는 리서치. Gemini Deep Research. Workspace 통합이 해자입니다. 소스 자료의 절반이 여러분의 Drive(회의 메모, PDF, 옛 이메일)에 있는 주제를 리서치한다면, 그 무엇도 비교가 되지 않습니다.
개발자 통합과 대량 실행. 턴키 에이전트로는 Perplexity Sonar Deep Research, 루프를 직접 구축하고 인용 서식을 제어하고 싶다면 Exa와 Tavily. Google의 새 Deep Research API는 결과를 Google의 색인에 묶고 싶을 때의 엔터프라이즈 선택지입니다.
모순되는 증거 종합. Claude. 소스들이 서로 어긋날 때(예: "섬유질은 게실염에 정말 좋은가?" 또는 "포모도로 기법은 효과가 있는가?"), Claude는 성급하게 한쪽을 고르기보다 그 불일치를 가장 기꺼이 드러내 줍니다.
사람들을 놀라게 할 수도 있는 한 가지 패턴: 단일 도구가 지배하지 않는다는 것입니다. 저는 이해관계가 큰 작업에서는 동일한 프롬프트를 두 에이전트에 돌립니다. 두 구독의 비용은 월 $40 정도이고, 그 이득은 어떤 단일 도구가 홀로 내놓는 것보다 눈에 띄게 나은 출력입니다. 채팅 검색과 딥 리서치는 점점 경쟁 제품이라기보다 여러분이 조합하는 스택처럼 느껴지기 시작합니다.
빠진 조각: 리서치 보고서를 쓸 수 있는 지식으로 바꾸기
거의 어떤 비교 기사도 언급하지 않는 것이 여기 있습니다. 에이전트가 만드는 보고서는 여러분 리서치의 결과물이 아닙니다. 여러분의 이해가 결과물입니다.
20페이지짜리 Claude Research 출력이나 15페이지짜리 OpenAI Deep Research 보고서는 작업의 끝이 아니라 시작입니다. 한 번 읽고, 결론만 훑고, 탭을 닫으면, 여러분은 실제로 배우지 않은 것을 요약하라고 에이전트에 돈을 낸 셈입니다. 수동적 AI 사용에 관한 2025년 MIT Media Lab 연구(AI가 학습에 미치는 영향에 대한 우리의 분석에서 추적함)는 헤비 ChatGPT 사용자가 능동적 학습자보다 자신이 "읽은" 것을 일관되게 덜 기억한다는 것을 보여 주었습니다.
해법은 연구자들이 수 세기 동안 해 온 것입니다. 주석을 다는 것. 중요한 주장에 하이라이트를 치세요. 검증하고 싶은 소스에 표시를 남기세요. 보고서 전반에 걸쳐 통찰을 연결하세요.
여기가 Glasp의 웹 하이라이터가 워크플로에 들어맞는 지점입니다. OpenAI, Perplexity, Gemini, Claude에서 리서치를 돌리세요. 보고서를 읽기 좋은 페이지에 붙여 넣으세요. 읽으면서 브라우저에서 직접 하이라이트를 치세요. 여러분의 하이라이트는 그달에 읽은 다른 모든 것과 나란히, 검색 가능하고 정리된 상태로 Glasp 라이브러리에 동기화됩니다.
효과가 있는 몇 가지 구체적인 워크플로:
하이라이트한 다음, 다시 질의하기. 보고서를 읽고 가장 중요한 10~15개 주장에 하이라이트를 치세요. 그 하이라이트를 "이 구체적인 지점들을 더 깊이 파 줘"와 함께 같은 에이전트에 다시 붙여 넣으세요. 한 번에 끝내는 것이 아니라 반복적으로.
주제별로 보고서 쌓기. 같은 주제를 두 도구(가령 OpenAI와 Claude)에서 리서치할 때, 두 보고서를 Glasp에서 하이라이트하면 어디서 수렴하고 어디서 갈라지는지 볼 수 있습니다. 불일치가 종종 가장 흥미로운 부분입니다.
텍스트와 함께 YouTube 쓰기. 최고의 소스가 팟캐스트나 강연일 때, YouTube Summary는 타임스탬프가 달린 자막 수준의 요약을 줍니다. 텍스트 딥 리서치 보고서를 주석이 달린 3~4개의 YouTube 강연과 짝지으면 어느 하나만 볼 때보다 주제를 더 철저히 다룹니다.
하이라이트와 대화하기. Glasp의 AI 채팅은 여러분의 주석을 소스로 삼아 질문에 답할 수 있습니다. 이는 "에이전트가 X에 대해 뭐라고 했지?"와 "나는 X에 대해 실제로 어떤 결론을 내렸지?"의 차이입니다.
배운 것을 게시하기. Glasp의 커뮤니티에는 비슷한 주제를 리서치하는 다른 사람들이 가득합니다. 하이라이트한 보고서를 공유하는 것은 리서치를 더 큐에 쌓기만 하는 것이 아니라 마무리하도록 강제하는 장치입니다. 단계별 가이드는 글에 제대로 주석 다는 법을 참고하세요.
한 번 읽고 마는 보고서는 지식이 아니라 영수증입니다. 하이라이트하고 주석을 다는 단계가 에이전트 출력을 여러분이 실제로 아는 무언가로 바꿔 주는 것입니다.
자주 묻는 질문
어떤 딥 리서치 도구가 가장 정확한가요?
가장 최근 공개된 벤치마크에서 Google의 Gemini Deep Research Max가 Humanity's Last Exam에서 54.6%로 앞섭니다(Google, 2026년 4월). 이 범주 출시 당시 OpenAI Deep Research가 기록한 26.6%(OpenAI, 2025년 2월)에서 크게 도약한 것입니다. 단문형 사실 정확도에서는 Perplexity Sonar가 SimpleQA에서 93.9%를 기록했는데(2025년 2월), 훌륭한 수준입니다. 실사용에서는 상위 도구 간 정확도 차이가 벤치마크가 시사하는 것보다 작습니다. 더 큰 차이는 깊이 대 속도입니다.
가장 빠른 딥 리서치 API는 무엇인가요?
Perplexity의 sonar-deep-research가 가장 빠른 턴키 선택지로, OpenAI·Gemini·Claude가 5~45분 걸리는 데 반해 대부분의 실행을 3분 이내에 끝냅니다. 가격은 입력 100만 토큰당 $2, 출력 100만 토큰당 $8에 별도의 인용·추론 토큰 요금과 검색 1,000건당 $5가 더해집니다. 직접 루프를 구축하기 위해 개별 검색의 순수 속도를 원한다면, Exa와 Tavily는 소스가 달린 결과를 몇 초 만에 반환합니다.
딥 리서치 실행은 얼마나 걸리나요?
Perplexity는 대부분의 실행을 3분 이내에 끝냅니다. Gemini는 보통 515분 걸립니다. OpenAI Deep Research는 쿼리 복잡도에 따라 530분 걸립니다. Claude Research는 어려운 프롬프트에서 5~45분까지 늘어날 수 있습니다. 지금 당장 답이 필요하면 Perplexity. 기다릴 수 있으면 Claude나 OpenAI가 대개 더 철저한 보고서를 만듭니다.
딥 리서치 도구를 API로 쓸 수 있나요?
예, 그리고 선택지가 2026년에 바뀌었습니다. Perplexity의 sonar-deep-research가 유일한 턴키 딥 리서치 API로, 한 번의 호출로 인용이 달린 보고서를 반환합니다. Google은 이제 Interactions API와 Vertex AI를 통해 Deep Research API를 노출합니다. OpenAI는 전용 o3-deep-research와 o4-mini-deep-research 모델을 2026년 7월 23일에 폐기했으므로, 이제 대신 Responses API에서 웹 검색 도구를 갖춘 GPT-5.x 모델을 돌립니다. Anthropic은 전용 리서치 에이전트를 제공하지 않지만, Messages API 웹 검색 도구(검색 1,000건당 $10)와 Claude Agent SDK로 직접 하나 만들 수 있습니다. Exa와 Tavily는 인기 있는 "직접 구축형" AI용 검색 API입니다.
어떤 API가 최고의 인용을 주나요?
기본 제공 인용이라면 Perplexity의 Sonar Deep Research가 완전히 인용된 보고서를 반환하며 강한 인용 정확도를 보고합니다. 모든 주장이 URL로 거슬러 올라가야 하는 프로덕션 시스템이라면, 팀들은 보통 Exa나 Tavily 위에 구축합니다. 이들은 여러분이 직접 모델에 넣는, 소스가 명시된 검색 결과를 반환하므로 서식을 제어하고 감사 추적을 보여 줄 수 있습니다. 웹 검색 도구를 갖춘 어떤 모델(Claude, GPT-5.x, Gemini)이든 여러분이 프롬프트로 지시하면 인라인으로 인용할 수 있습니다.
진짜로 무료인 딥 리서치 도구가 있나요?
예, 하지만 한도가 있습니다. OpenAI는 무료 사용자에게 월 5회의 Deep Research 실행을 줍니다. Perplexity는 무료 티어에서 하루 5회를 주는데, 가장 넉넉한 허용치입니다. Gemini는 제한적인 무료 Deep Research 접근을 가지며, 가장 저렴한 유료 티어(Google AI Plus)는 이제 월 $4.99부터 시작합니다. Claude는 무료 티어에서 Research를 제공하지 않습니다. 가벼운 사용이라면 Perplexity Free가 대부분의 필요를 충족합니다. 정기적인 작업이라면 월 $20의 Pro 플랜이 현실적인 진입점입니다.
딥 리서치 보고서에서 환각을 어떻게 멈추나요?
세 가지 실용적 전술이 있습니다. 첫째, 항상 상위 3~5개 인용 소스를 클릭해 주장이 그 소스에 실제로 있는지 확인하세요(환각은 가짜 소스를 지어내는 것보다 실제 소스를 잘못 인용하는 데서 더 자주 옵니다). 둘째, 같은 프롬프트를 두 번째 도구에 돌려 비교하세요. 가령 Claude와 OpenAI의 불일치는 종종 둘 중 하나가 무언가를 틀린 지점입니다. 셋째, 이해관계가 큰 사실 쿼리에는 Perplexity를 선호하세요. 93.9%의 SimpleQA 점수가 단문형 사실에 대한 진짜 보정을 반영하기 때문입니다.
딥 리서치 도구가 내 비공개 문서를 읽을 수 있나요?
Gemini Deep Research가 가장 깊은 통합을 갖춰, (허가를 받아) 여러분의 Gmail, Drive, Docs에 네이티브로 접근합니다. Claude Research는 Google Workspace 커넥터를 지원합니다. OpenAI Deep Research는 세션 중에 업로드한 파일을 읽을 수 있지만 클라우드 스토리지와 직접 통합되지는 않습니다. Perplexity는 주로 웹을 상대로 작동합니다. 소스 자료가 대부분 Google Workspace에 있다면 Gemini가 명백한 선택입니다.
딥 리서치 보고서를 저장하고 재사용하는 가장 좋은 방법은?
보고서를 PDF나 Markdown으로 내보내고, 읽기 좋은 뷰로 열어, 여느 긴 글처럼 하이라이트하세요. Glasp는 정확히 이 워크플로를 위해 만들어졌습니다. 하이라이트가 검색하고, 다른 하이라이트에 연결하고, 다시 찾아볼 수 있는 라이브러리에 동기화됩니다. 하이라이트 단계가 없으면 대부분의 딥 리서치 보고서는 한 번 읽히고 잊힙니다. 이는 교육자들이 "생성 효과"라고 부르는 것과 관련됩니다. 능동적으로 처리한 정보는 수동적으로 받은 정보보다 훨씬 잘 기억됩니다.
결론: 리서치 도구가 아니라 리서치 스택
OpenAI의 출시로부터 1년 반이 지나, 이 범주는 명확해졌습니다. 딥 리서치 에이전트는 승자독식 시장이 아닙니다. 정답은 무엇을 리서치하는지, 시간이 얼마나 있는지, 소스 자료가 어디에 있는지, 그리고 버튼을 누르는지 API를 호출하는지에 따라 달라지는 혼합입니다.
2026년 대부분의 지식 노동자를 위해 하나만 골라야 한다면, Perplexity Pro입니다. $20에서의 볼륨 대비 가격 비율이 이 그룹에서 최고이고, 실행이 평범한 업무 리듬 안에 들어갈 만큼 빠르며, SimpleQA 정확도가 진짜로 강합니다. 더 무겁거나 더 모호한 작업이라면 OpenAI Deep Research나 Claude Research와 짝지으세요. 개발자라면 Perplexity의 Sonar Deep Research와 Google의 새 Deep Research API가 오늘 그 위에서 개발할 수 있는 두 가지입니다.
하지만 도구 선택은 그 출력으로 무엇을 하느냐보다 덜 중요합니다. 사람들이 저지르는 가장 큰 실수는 딥 리서치 보고서를 완성된 작업으로 취급하는 것입니다. 그렇지 않습니다. 그것은 원자재입니다. 실제 지식은 중요한 주장에 하이라이트를 치고, 그것을 여러분이 읽은 다른 것들에 연결하며, 그 주제가 다시 나올 때 나중에 되돌아올 때 만들어집니다.
그것이 Glasp가 설계된 워크플로입니다. 어떤 보고서, 어떤 글, 어떤 YouTube 자막이든 하이라이트하세요. 여러분이 실제로 중요하다고 생각한 것의 검색 가능한 라이브러리를 구축하세요. 나중에 구체적인 무언가를 떠올려야 할 때 하이라이트와 대화하세요. 같은 리서치를 하는 다른 사람들과 작업을 공유하세요.
딥 리서치 에이전트는 계속 더 좋아질 것이고, API는 계속 늘어날 것입니다. 그 위에 하이라이트 계층을 더하지 않는 것들은 계속 한 번 읽히고 잊히는 보고서를 만들어 낼 것입니다. 여러분의 2026년 리서치 워크플로를 단일 도구를 중심으로 짜지 마세요. 스택을 중심으로 짜되, 그 스택의 마지막 고리가 여러분 자신의 이해가 기록되는 지점이 되도록 하세요.
이번 주에 실제 리서치 질문 하나를 네 도구 중 둘에 돌려 보는 것부터 시작하세요. 두 보고서를 하이라이트하세요. 배운 것을 비교하세요. 그것이 워크플로입니다. 나머지는 전부 기능 목록일 뿐입니다.