AI

Herramientas de deep research: OpenAI vs Perplexity vs Gemini

Todos los grandes laboratorios de IA lanzan ya un agente de "deep research", y la mayoría publica además una API de investigación. Todos prometen informes de nivel doctoral en minutos. Después de año y medio de uso real, las diferencias son mucho más concretas de lo que sugiere el marketing, y casi nunca están donde apuntan los benchmarks.

29 min de lectura
Puntos clave
    • Perplexity Deep Research ya no funciona sobre Sonar: desde febrero de 2026 corre sobre Claude Opus, y desde junio de 2026 se ejecuta dentro de Perplexity Computer. La API sonar-deep-research, la que convirtió a Perplexity en la favorita de los desarrolladores, deja de tener soporte el 27 de septiembre de 2026.
  • El "modelo de deep research" dedicado está desapareciendo: OpenAI, Perplexity, Google, Anthropic y xAI han sustituido el identificador de un único modelo de investigación por una sesión de agente más un regulador de esfuerzo. Los niveles de esfuerzo son el nuevo producto.
  • Google lidera entre los cuatro grandes en los benchmarks publicados: Deep Research Max reportó un 54.6% en Humanity's Last Exam frente al 50.4% del nivel estándar (Google, abril de 2026), y Kimi K3, de Moonshot, declara una cifra superior a ambas. Lee con cuidado las etiquetas de nivel, porque los fabricantes rara vez lo hacen.
  • El presupuesto de búsqueda pesa más que la elección del modelo: en pruebas de terceros, una misma configuración obtuvo un 35.8% en BrowseComp con un límite de 1 turno de búsqueda y un 89.0% con 25 turnos. Mismo modelo, mismo benchmark.
  • Los planes gratuitos se volvieron más vagos, no mejores: el centro de ayuda de OpenAI dejó de indicar cuántas ejecuciones de deep research incluye cada plan durante 2026, y la empresa pausó las nuevas altas del plan Pro de US$ 200 el 10 de septiembre. El AI Plus de Gemini, a US$ 4.99, es hoy la entrada de pago más barata de cualquier laboratorio de frontera.
  • El informe no es el resultado; tu comprensión sí lo es: combinar un agente de deep research con un flujo de subrayado como Glasp convierte informes de 20 páginas en conocimiento utilizable en lugar de PDFs que se leen una sola vez.

El momento del deep research

Para la mayoría de la gente, en septiembre de 2026 Gemini Deep Research es la mejor opción general: los benchmarks publicados más sólidos y la entrada de pago más barata, a US$ 4.99. Perplexity Pro, a US$ 20, da el mejor volumen por lo que cuesta, y OpenAI y Claude producen los informes más profundos en trabajos ambiguos. Los desarrolladores deberían empezar por la Deep Research API de Google, la única opción llave en mano que no tiene los días contados, porque Perplexity retira sonar-deep-research el 27 de septiembre de 2026 y OpenAI apagó sus modelos de investigación dedicados en julio.

El resto de esta guía muestra cómo se sostienen esos veredictos al mirar precios, benchmarks, APIs y trabajos reales.

La categoría en sí todavía no cumple dos años. El 2 de febrero de 2025, OpenAI anunció Deep Research. Fue el primer agente que la mayoría de la gente había usado capaz de tomar una instrucción de una sola frase, planificar una investigación de 30 minutos, navegar por decenas de fuentes por su cuenta y volver con un informe con citas.

La reacción del sector fue reveladora. En seis semanas, Perplexity lanzó su propio Deep Research (el 14 de febrero) y, semanas después, abrió la API Sonar Deep Research a los desarrolladores. Google, que había lanzado Gemini Deep Research discretamente en diciembre de 2024, aceleró su despliegue y siguió mejorando el motor de base. Anthropic puso la búsqueda web de Claude a disposición general el 7 de mayo de 2025 y empaquetó la función Research en esa misma ventana de primavera.

Cuatro laboratorios, una categoría de producto, dos trimestres. Eso no ocurre por casualidad. 2024 fue el año en que las ventanas de contexto superaron los 200K tokens, el uso de herramientas se volvió fiable y los bucles agénticos dejaron de fallar en silencio a mitad de camino. El deep research fue la primera aplicación de consumo que hizo que esas tres cosas parecieran dignas de pagarse. Está muy ligado al giro más amplio hacia los protocolos de agentes que cubrimos en La web agéntica: dentro de las guerras del protocolo MCP.

Si escribes, estudias, analizas mercados o evalúas productos, ya estás en desventaja si no usas una de estas herramientas. La pregunta es cuál y cuándo.


Qué hace realmente el "deep research"

Es fácil confundir el deep research con una búsqueda conversacional. Escribes una pregunta, obtienes una respuesta con enlaces. La mecánica es distinta.

Una búsqueda conversacional (como ChatGPT normal con navegación) lanza una o dos consultas web y sintetiza los primeros resultados en segundos. Un agente de deep research hace algo más parecido a lo que hace un analista junior en una tarde. Descompone tu pregunta en subpreguntas, ejecuta decenas o cientos de búsquedas, lee páginas completas, sigue las citas, actualiza su plan a medida que aprende y produce un informe estructurado con notas al pie.

Pregúntale a una búsqueda conversacional "¿cuáles son las principales críticas a la curva de Phillips?" y recibirás un resumen de tres párrafos. Hazle la misma pregunta a un agente de deep research y obtendrás un informe de 15 páginas que cubre la hipótesis de la tasa natural de Friedman, la ruptura estanflacionaria de los años setenta, las revisiones de las expectativas racionales, los debates sobre el aplanamiento posterior a 2008 y artículos recientes de 2023-2025, cada uno con una fuente en la que puedes hacer clic.

El precio a pagar es el tiempo. Las ejecuciones tardan desde minutos hasta una hora, y Google es el único proveedor que publica un presupuesto: la mayoría de las tareas dentro de 20 minutos, con un tope duro de 60. Ese es justamente el punto. Pones una en cola, trabajas en otra cosa y vuelves a un informe que a mano te habría llevado media jornada. Para profundizar en cómo reestructurar los hábitos de investigación alrededor de agentes de IA, consulta Cómo construir un flujo de investigación impulsado por IA en 2026.


Cara a cara: las 4 herramientas de consumo comparadas

Esta es la matriz, con el modelo de base y los precios leídos en las propias páginas de los fabricantes en septiembre de 2026. Una columna ha cambiado más que ninguna otra desde la primera versión de esta guía: la del "modelo de base", que hoy es un blanco móvil en tres de los cuatro.

HerramientaModelo de base (sept. 2026)Precio y accesoTiempo de ejecución publicado
OpenAI Deep ResearchNo divulgado; "el modelo más reciente por defecto"Free y Go (US$ 8/mes): Limitado; Plus (US$ 20/mes): Ampliado; Pro (desde US$ 100/mes): Máximo5-30 min (OpenAI, feb. 2025)
Perplexity Deep ResearchClaude Opus, enrutado dentro de Perplexity ComputerPro US$ 20/mes; Max US$ 200/mes2-4 min (Perplexity, feb. 2025)
Gemini Deep ResearchGemini 3.1 ProAI Plus US$ 4.99/mes; AI Pro US$ 19.99/mes; AI Ultra desde US$ 99.99/mes20 min típico, tope de 60 min (API)
Claude ResearchNo divulgadoTodos los planes de pago: Pro US$ 20/mes, Max US$ 100 o US$ 200/mes, Team, EnterpriseNo publicado

Esa tabla tiene más "no publicado" del que tenía antes, y ese es el estado honesto de las cosas. Solo Google publica un presupuesto de tiempo firme para un producto vigente. El famoso "de 5 a 30 minutos" de OpenAI está en su página de lanzamiento de febrero de 2025 y jamás se ha reformulado. Perplexity publicó de 2 a 4 minutos en ese mismo lanzamiento y tampoco lo ha actualizado, así que el "menos de 3 minutos" que esta guía solía imprimir era una cifra de febrero de 2025 que describía un producto reconstruido dos veces desde entonces. Anthropic solo dice que Research entrega respuestas "en minutos".

Los perfiles en un párrafo:

OpenAI Deep Research sigue siendo el peso pesado para preguntas ambiguas y abiertas. Los informes son largos y el razonamiento es visiblemente más profundo cuando la pregunta no tiene una respuesta limpia. En 2026 cambiaron dos cosas. La página de precios dejó de citar números de ejecuciones y ahora dice Limitado, Ampliado y Máximo, así que las cifras de "5 gratis, 25 en Plus, 250 en Pro" que todavía circulan vienen de una actualización de blog de abril de 2025 y no de nada que OpenAI publique hoy por plan. Y el 10 de septiembre de 2026, OpenAI pausó las nuevas altas de su nivel Pro de US$ 200. Hay dos niveles Pro: US$ 100 desbloquea 5x el uso de Plus y US$ 200 desbloquea 20x, y la pausa deja US$ 100 como el plan más alto que un cliente nuevo puede comprar.

Perplexity Deep Research es el que cambió de motor por debajo. Nació sobre los modelos Sonar propios de Perplexity. Desde febrero de 2026, el modo Advanced Deep Research corre sobre Claude Opus, con los suscriptores de Max recibiendo una revisión de Opus más nueva que los de Pro, y el 11 de junio de 2026 Perplexity trasladó Deep Research al interior de Perplexity Computer, que reparte subtareas entre más de 20 modelos de frontera. Perplexity atribuye el salto del 40.7% al 83.8% en BrowseComp a ese cambio de arquitectura y no al cambio de modelo. Si lees un artículo que llama a Perplexity Deep Research un producto "Sonar", se escribió antes de febrero de 2026. Sonar es hoy el nombre de la línea de API, no del agente de consumo.

Gemini Deep Research tiene los mejores resultados publicados de los cuatro grandes. Google actualizó el agente a Gemini 3.1 Pro en abril de 2026, lo dividió en un nivel estándar y uno Max, y expuso ambos mediante una API de verdad. Sigue leyendo de tu Gmail, Drive y Docs además de la web, y muestra un plan de investigación visible que puedes editar antes de que el agente arranque. Google publica las asignaciones como multiplicadores en vez de como cifras, lo que al menos te dice qué compra una mejora de plan.

Claude Research es el más paciente de todos, bueno para sostener fuentes contradictorias en paralelo en lugar de resolverlas demasiado pronto. Dos correcciones que vale la pena hacer: Research está disponible en todos los planes de pago de Claude (Pro, Max, Team y Enterprise), no solo en Pro, y la línea de Anthropic ya ha ido más allá de Sonnet 5 y Opus 5, e incluye ahora Claude Fable 5.1, publicado el 1 de septiembre de 2026. Anthropic no dice qué modelo sostiene Research dentro de las apps. Lo que sí documenta es que Claude 4.6 y posteriores llevan el contexto completo de 1M de tokens a precio estándar, de modo que los conjuntos grandes de fuentes no se truncan ni se recargan.


Alternativas al deep research de ChatGPT: quién más ofrece una

"Alternativa al deep research de ChatGPT" es una de las formas más comunes de llegar a este tema, y la comparación a cuatro bandas de arriba no responde a eso. Estos son los que de verdad ofrecen un agente de investigación en septiembre de 2026, y los que solo lo aparentan.

RetadorProducto y APIPrecio de entradaEl dato que lo distingue
xAI GrokModo multiagente; grok-4.20-multi-agent (beta)SuperGrok US$ 30/mesNo publica puntuación de HLE ni de BrowseComp
Moonshot KimiDeep Research (Kimi-Researcher); sin endpoint propioPlus US$ 19/mesPublica telemetría por ejecución que nadie más publica
ManusAgente autónomo, Wide Research; REST orientado a tareasUS$ 20/mes (4,000 créditos)No publica ningún benchmark público con nombre
You.comProducto de consumo casi desaparecido; Research APIUS$ 12 por cada 1,000 (lite)Cinco niveles de esfuerzo que abarcan un rango de precios de 100x
MistralHabilidad Deep Research dentro de Vibe; sin endpoint independientePro US$ 14.99/mesEl plan de pago más barato fuera de los cuatro grandes
DeepSeekBúsqueda web en la app; nada agéntico en la APIGratisLa API ignora todas las herramientas que le pases

xAI Grok rebautizó calladamente lo que todo el mundo sigue buscando. "DeepSearch" y "DeeperSearch" ya no aparecen en ningún lugar de la documentación para desarrolladores de xAI. Lo que existe ahora es un modelo multiagente, grok-4.20-multi-agent, todavía etiquetado como beta, donde reasoning.effort selecciona 4 agentes en low o medium y 16 en high o xhigh. La documentación te dice claramente que uses 16 para deep research. El problema para quien compare por calidad: xAI no publicó puntuación de Humanity's Last Exam, BrowseComp ni GAIA para el Grok 4.6 subyacente, así que no hay nada que poner en la tabla habitual de benchmarks. Sí reporta un 81.6% en DeepSearchQA, donde pierde tanto contra GPT-5.5 como contra Claude Opus.

Kimi, de Moonshot, es el retador mejor documentado y el que la mayoría de la gente fuera de Asia nunca ha probado. Su modo Deep Research corre sobre un modelo propio, Kimi-Researcher, y Moonshot publica telemetría por tarea que los laboratorios estadounidenses no dan: una media de 23 pasos de razonamiento, 74 palabras clave de búsqueda planificadas y 206 URLs encontradas por tarea, de las cuales solo un 3.2% llega al informe. Las ejecuciones tardan de 10 a 25 minutos y los planes de pago arrancan en US$ 19 al mes. Moonshot ofrece endpoints de búsqueda y de fetch que puedes llamar, pero nada que exponga el propio agente Deep Research, así que el producto de investigación es solo de consumo.

Manus es la historia de negocio más interesante y la más floja en lo técnico. Meta lo adquirió en diciembre de 2025, la NDRC de China bloqueó la operación el 27 de abril de 2026 y Manus anunció que había retomado operaciones independientes el 1 de septiembre de 2026. Su modo Wide Research ejecuta 20 subtareas en paralelo, aunque no puedes dispararlo manualmente. Conviene saberlo antes de citarlo: Manus no publica ningún benchmark público con nombre en ninguna parte, solo gráficos que etiqueta como internos.

You.com ha abandonado de hecho el mercado de consumo. ARI, su agente de investigación, ya no aparece en la portada, y no hay suscripción de consumo en la página de precios. Lo que queda es una Research API genuinamente buena con cinco niveles de esfuerzo, de lite a frontier, con precios de US$ 12 a US$ 1,200 por cada mil solicitudes. Una diferencia de 100x en un solo endpoint es la ilustración más clara de algo hacia lo que ha convergido toda esta categoría, y que retoma la sección de APIs más abajo.

Mistral movió su agente de investigación y renombró la app a su alrededor. Le Chat pasó a llamarse Vibe en mayo de 2026, y Deep Research desapareció de la pestaña Chat; si lo inicias ahora, te redirige a la pestaña Work con la habilidad Deep Research preseleccionada. A US$ 14.99 al mes, Mistral Pro es el plan de pago más barato fuera de los cuatro grandes, aunque el AI Plus de Google a US$ 4.99 lo deja por debajo, y para equipos europeos con requisitos de residencia de datos Mistral suele ser la única opción que pasa el filtro de compras.

DeepSeek es el resultado negativo útil. Pese a aparecer constantemente en listas de "mejores herramientas de deep research", DeepSeek no ofrece ningún producto de deep research. Su app tiene búsqueda web y un modo de pensamiento, pero su documentación de API marca web_search y cualquier otra herramienta como ignoradas, así que no hay nada agéntico sobre lo que construir. Es un modelo de razonamiento barato y excelente que puedes apuntar a texto que tú le entregues, y no es un agente de investigación. Lo mismo vale para Qoob y Arc Search: ambos aparecen en consultas comparativas y ambos son apps de búsqueda de respuesta rápida, no agentes que planifican y navegan durante media hora.

Las opciones de código abierto, y una advertencia

Si quieres autoalojar, la respuesta honesta en 2026 es que el mantenimiento y el rendimiento en benchmarks viven hoy en repositorios distintos.

Activamente mantenidos y buenos para empezar: GPT Researcher (Apache-2.0, unas 29,500 estrellas, con versiones publicadas hasta agosto de 2026) es el que puedes clonar y ejecutar hoy sin tener que reemplazar antes un nombre de modelo retirado en su configuración. DeerFlow, de ByteDance, es con diferencia el más grande, con unas 82,000 estrellas, y el más barato de probar, ya que funciona sin ninguna clave de API de búsqueda usando DuckDuckGo y un lector sin clave, aunque su reescritura 2.0 lo reposicionó como un marco general de agentes con el deep research como una habilidad más. Tongyi DeepResearch, de Alibaba, es la opción creíble de pesos abiertos bajo Apache-2.0, pero su repositorio lleva en silencio desde febrero de 2026.

Ahora la advertencia, porque dos proyectos que encabezaban todas las listas de recomendaciones de 2025 están muertos y no lo parecen. El open_deep_research de LangChain fue archivado el 21 de agosto de 2026. GitHub muestra el aviso de archivado, pero el propio README no lleva ninguna nota, así que el proyecto parece vivo para cualquiera que llegue desde un tutorial. STORM, de Stanford, tuvo 146 pull requests abiertos en 2026 y fusionó exactamente cero; su último commit fue de septiembre de 2025, y su guía rápida documentada depende de la Bing Search API, retirada en agosto de 2025. Los artículos de STORM siguen mereciendo la lectura. El software no debería ser tu punto de partida.

Entre los proyectos más conocidos, el patrón es que los agentes de pesos abiertos que lograron puntuaciones competitivas en benchmarks se han quedado callados, mientras que los que siguen publicando código casi no publican benchmarks. Elige por mantenimiento y luego mide por tu cuenta.

Si tu investigación se limita a documentos que ya tienes en lugar de a la web abierta, esa es otra categoría de herramientas con otros ganadores, que cubrimos en NotebookLM en 2026.


APIs de deep research: qué puedes llamar realmente

Esta es la pregunta que los artículos comparativos siguen saltándose, y la que los desarrolladores siguen buscando: qué agentes de deep research puedes llamar desde tu propio código, cuánto cuestan y qué tan buenas son las citas. Casi todo esto cambió a lo largo de 2026, y uno de los mayores cambios cae el 27 de septiembre de 2026.

Proveedor¿Deep research invocable?Qué llamasPrecio
Google GeminiSí, llave en manodeep-research-preview-04-2026 o deep-research-max-preview-04-2026 en la Interactions API~US$ 1 a US$ 3 por tarea; Max ~US$ 3 a US$ 7 por tarea (tarifas de preview)
PerplexitySí, pero en migraciónAgent API POST /v1/agent con presets de esfuerzo; sonar-deep-research pierde soporte el 27 de sept. de 2026Sonar heredado: US$ 2/1M de entrada, US$ 8/1M de salida, más US$ 2/1M de tokens de cita y US$ 3/1M de razonamiento, más US$ 5 por cada 1,000 búsquedas
OpenAINo como modelo dedicadoModelo insignia en la Responses API con web_search y esfuerzo de razonamiento alto, o la nueva Agents APITarifas de tokens del modelo más web_search a US$ 10 por cada 1,000 llamadas
Anthropic ClaudeSin API con marca de investigaciónHerramienta web_search de la Messages API, o Claude Managed Agents (beta)US$ 10 por cada 1,000 búsquedas más tokens; Managed Agents suma US$ 0.08 por hora de sesión
You.comSíResearch API, cinco niveles de esfuerzoDe US$ 12 (lite) a US$ 1,200 (frontier) por cada 1,000
ExaConstrúyelo túEndpoints Search, Deep Search y AgentSearch US$ 7 por cada 1,000; Deep Search de US$ 12 a US$ 15 por cada 1,000; Agent de US$ 0.012 a US$ 1.00 por solicitud con esfuerzo fijo
TavilyConstrúyelo túEndpoints Search y Research1,000 créditos gratis al mes; pago por uso a US$ 0.008/crédito; una ejecución de Research consume de 4 a 250 créditos

Cuatro cosas destacan.

Google es ahora la opción llave en mano de un laboratorio de frontera, y eso es un vuelco. Durante casi toda la vida de esta categoría, Gemini Deep Research fue una función de consumo que no podías llamar por programa. Hoy es la más limpia de los cuatro grandes: llamas a un modelo de deep research en la Interactions API, con background=true obligatorio en lugar de opcional, y Google publica tanto una banda de precio estimado por tarea como un presupuesto de tiempo real. El acceso empresarial pasa por la Gemini Enterprise Agent Platform, que sustituyó a Vertex AI como nombre de producto para esto en 2026, así que ignora los artículos antiguos que te mandan a Vertex.

La API llave en mano de Perplexity se está retirando justo ahora. sonar-deep-research fue durante dos años la respuesta a "qué API de deep research puedo simplemente llamar", y Perplexity anunció en julio de 2026 que los endpoints Sonar de Chat Completions se retiran el 27 de septiembre de 2026. El reemplazo es la Agent API, donde haces POST /v1/agent y eliges un preset de esfuerzo. Perplexity mapea el viejo modelo de deep research a high y señala xhigh para sus mejores resultados. Todos los precios de Sonar de la tabla de arriba valen solo hasta el 27 de septiembre, así que si estás presupuestando un desarrollo, presupuesta la Agent API. Ten en cuenta también que el ciclo de vida cambió de forma: el endpoint asíncrono heredado usaba estados en mayúsculas como IN_PROGRESS, mientras que la Agent API usa un conjunto distinto en minúsculas, lo que significa que un bucle de polling escrito contra uno falla en silencio contra el otro.

OpenAI movió el deep research hacia la línea de modelos y luego hacia un agente gestionado. Los modelos dedicados o3-deep-research y o4-mini-deep-research quedaron obsoletos en abril de 2026 y se apagaron el 23 de julio de 2026. Su ruta de reemplazo es un modelo insignia actual en la Responses API con la herramienta web_search en modo de segundo plano. Desde el 10 de septiembre de 2026 existe además una Agents API gestionada en beta pública, donde OpenAI se encarga por ti de la orquestación de la sesión, la compactación de contexto y la recuperación. Una trampa que conviene señalar: la propia página de la guía de deep research de OpenAI y su página del modelo o3-deep-research están desactualizadas y siguen presentando esos modelos como disponibles, contradiciendo la página de obsolescencias. Fíate de la página de obsolescencias.

Anthropic ya no te obliga a construirlo todo tú. El planteamiento antiguo, que esta guía solía imprimir, era que Claude no tiene API de investigación y que montas tu propio bucle. Eso quedó anticuado. Claude Managed Agents está en beta pública desde abril de 2026: sesiones de larga duración, server-sent events, capacidad de dirigir e interrumpir, despliegues programados por cron y búsqueda web, fetch web y MCP integrados, facturado al coste de tokens más US$ 0.08 por hora de sesión. El propio ejemplo trabajado de Anthropic deja una sesión de una hora con Opus muy por debajo de un dólar, y el fetch web, a diferencia de la búsqueda web, no cuesta nada. Sigue sin existir un modelo llamado "deep research", pero la infraestructura sí existe.

Para la pregunta concreta de "la mejor API para informes de investigación con citas", funcionan tres enfoques. Google y Perplexity te dan citas listas de fábrica. You.com, Exa y Tavily te dan resultados atribuidos a su fuente que alimentas a tu propio modelo, que es el patrón sobre el que realmente se construyen la mayoría de las funciones de investigación en producción, porque controlas el coste y el formato de las citas. Y cualquier modelo con una herramienta de búsqueda web puede citar sobre la marcha si se lo pides. Los equipos que necesitan trazabilidad para auditoría suelen preferir la vía de construirlo uno mismo, porque cada afirmación se remonta a una URL que descargaste y no a la memoria de un modelo. Para entender por qué el anclaje y la calidad de la recuperación importan más que el tamaño bruto del contexto, consulta Context Rot: por qué RAG sigue ganando a una ventana de contexto gigante.

Dos notas de propiedad para quien vaya a depender de un proveedor. Tavily fue adquirida por el proveedor de nube de IA Nebius en febrero de 2026, así que el discurso de "API de búsqueda independiente" necesita un asterisco. Y Exa eliminó su endpoint /research el 1 de abril de 2026, integrándolo en /search con un tipo deep-reasoning, lo que significa que cualquier tutorial que te diga que llames a exa-research está roto.


Cómo automatizar el deep research con una API

Llamar a una de estas APIs no se parece a llamar a un chat completion. Las ejecuciones tardan desde minutos hasta una hora, así que todos los proveedores te obligan a lidiar con la asincronía, y todos lo hacen de forma distinta. Si estás conectando un agente de investigación a un producto o a un pipeline, esta es la parte que te cuesta un día.

Asume ejecución en segundo plano, no una llamada bloqueante. Google lo exige de plano: los modelos de deep research solo funcionan con background=true, y haces polling de la interacción o retomas un stream. OpenAI soporta el modo de segundo plano en la Responses API con polling, streaming reanudable y webhooks según la especificación Standard Webhooks. Perplexity documenta polling y no tiene webhooks. xAI es la excepción. background aparece en su esquema pero está marcado como no soportado, así que la vía asíncrona real allí es la batch API, que devuelve en 24 horas en vez de en minutos.

Presupuesta por tarea, no por token, y revisa cuánto cuesta la búsqueda. Las facturas de las APIs de investigación salen de los recargos por búsqueda. Se cobran por llamada, no por token. OpenAI cobra US$ 10 por cada 1,000 llamadas de búsqueda web, Anthropic US$ 10 por cada 1,000 búsquedas, Perplexity US$ 5 por cada 1,000 en la línea de deep research de Sonar que se retira, y xAI US$ 5 por cada 1,000 llamadas de herramienta. Google da a los proyectos de nivel de pago 5,000 búsquedas de grounding gratis al mes en sus modelos Gemini 3.x y luego cobra US$ 14 por cada 1,000, y las tareas de Deep Research tiran de esa misma bolsa a razón de unas 80 a 160 búsquedas cada una, así que unas 60 tareas la agotan. La respuesta de ejemplo de la propia Perplexity es el caso trabajado más útil publicado: una sola llamada de deep research que cuesta US$ 0.816, de la cual el 71% fueron tokens de razonamiento y solo el 11% salida. El informe que lees es la parte más barata de la factura.

Espera niveles de esfuerzo, porque reemplazaron a los identificadores de modelo. Este es el cambio estructural que se esconde detrás de cada cambio individual de arriba. OpenAI retiró sus modelos de investigación en favor de un modelo insignia más esfuerzo de razonamiento. Perplexity está retirando Sonar en favor de presets de la Agent API. Google ofrece variantes estándar y Max. xAI te hace elegir 4 o 16 agentes mediante reasoning.effort. Exa, You.com y Tavily aplican todos el mismo tipo de escalera de precios, de un suelo barato a un techo por solicitud. Si estás diseñando alrededor de estas APIs, diseña para un regulador que puedas girar en cada solicitud, no para un nombre de modelo que dejas fijo en el código.

El paso de clarificación te toca construirlo a ti. OpenAI lo dice explícitamente: el deep research a través de la API no incluye ningún paso de clarificación ni de reescritura del prompt, y el modelo espera una instrucción completamente formada de entrada. Las apps de consumo te hacen preguntas de seguimiento antes de empezar; las APIs no. La solución estándar, que el propio recetario de OpenAI demuestra, es un modelo pequeño y barato que clasifica la petición y la reescribe como instrucción de investigación antes de que el agente caro llegue a ejecutarse.

Para la verificación de hechos en concreto, la comprobación es una etapa del pipeline y no una línea del prompt. Un patrón se ha asentado tanto en los recetarios publicados por OpenAI como en los de Anthropic: descompón la salida en afirmaciones independientes, verifica cada afirmación en su propio contexto limpio y luego deja que una pasada escéptica aparte cuestione los veredictos. La versión de Anthropic argumenta sin rodeos el porqué, señalando que "verifica tus hallazgos" también es solo una instrucción, y que bajo presión de contexto se acaba saltando. Si estás construyendo ese verificador de hechos en tiempo real que la gente no para de buscar, esa descomposición es la arquitectura, y la API de búsqueda que haya debajo importa menos que la estructura que la rodea.


Benchmarks de deep research: qué muestran las clasificaciones

Hay tres números que se citan más que ningún otro: Humanity's Last Exam, BrowseComp y SimpleQA. Son útiles, se citan mal constantemente y arrastran dos problemas estructurales que casi nadie menciona.

Empecemos por el primero. Ninguna clasificación independiente ordena entre sí a los agentes de investigación tal como se venden, con herramientas. La evaluación de la propia Scale usa una variante sin herramientas, los tableros de los fabricantes son autorreportados, y el único banco de pruebas serio de terceros mide configuraciones de modelo más búsqueda que no puedes comprar, no productos que sí puedes. Cuando ves al agente de un fabricante puntuando en los cincuenta o sesenta "con herramientas", estás leyendo el banco de pruebas, el presupuesto de búsqueda y el juez de ese fabricante. Eso no vuelve falsos los números. Los vuelve incomparables.

El segundo problema es el etiquetado de niveles. Esta guía imprimía antes 54.6% en HLE y 85.9% en BrowseComp como "Gemini Deep Research". Ambas cifras pertenecen a Deep Research Max, el nivel de mayor esfuerzo de Google, frente al 50.4% y el 61.9% del nivel estándar. Eso es una brecha de 24 puntos en BrowseComp entre dos productos vendidos bajo un mismo nombre, y los artículos comparativos los mezclan sin parar. Vale la pena saber que Google publicó estos datos en un gráfico dentro de su anuncio de abril de 2026 y no como texto citable, lo cual es parte de por qué se deforman aguas abajo.

Agente o configuraciónHLE (con herramientas)Reportado porCuándo
Perplexity Sonar Deep Research21.1%Fabricantefeb. 2025
OpenAI Deep Research (o3)26.6%Fabricantefeb. 2025
Gemini Deep Research (3 Pro)46.4%Fabricantedic. 2025
Gemini Deep Research (3.1 Pro)50.4%Fabricanteabr. 2026
Gemini Deep Research Max (3.1 Pro)54.6%Fabricanteabr. 2026
Kimi K3 (el modelo, no el agente Deep Research)56.0%Fabricantejul. 2026
Claude Opus 5 + búsqueda de Perplexity, 25 turnos77.4%Terceroago. 2026

Esa última fila es la que merece que te detengas. Viene del banco de pruebas de la propia OpenRouter, que ejecuta endpoints de producción en lugar de recopilar afirmaciones de fabricantes, y publica coste y latencia junto a la precisión: US$ 0.46 por pregunta, 83 segundos, sobre una muestra de 84 preguntas. No es un producto que puedas comprar. Es un modelo más un proveedor de búsqueda más un presupuesto de turnos, ensamblado por un tercero, y supera el número autorreportado de todos los agentes que sí se venden. Una salvedad sobre quién está midiendo: OpenRouter revende la mayoría de los modelos y motores de búsqueda que evalúa.

El hallazgo más útil de toda la categoría sale de ese mismo banco de pruebas. En BrowseComp, una configuración obtuvo un 35.8% con un límite de 1 turno de búsqueda y un 89.0% con un límite de 25 turnos, dentro de la misma serie de ejecuciones. Mismo modelo, mismo benchmark. El andamiaje a su alrededor, en concreto cuántas búsquedas se le permiten, movió el resultado 53 puntos. Por eso un modelo de navegación sin más puntúa por debajo del 2% en BrowseComp mientras que un agente construido sobre él puntúa en los ochenta, y por eso "qué modelo es más listo" está cerca de ser la pregunta equivocada. Compra presupuesto de búsqueda.

La curva de coste también es más plana de lo que sugiere el marketing. En esas mismas ejecuciones, la mejor configuración de BrowseComp costaba US$ 0.99 por pregunta, mientras que un modelo barato emparejado con el mismo proveedor de búsqueda llegó al 77.0% por US$ 0.076, unas 13 veces más barato a cambio de 12 puntos menos de precisión. Para la mayoría del trabajo real, ese canje es obviamente el correcto.

Los benchmarks hechos para agentes de investigación

HLE y BrowseComp miden si un agente es capaz de encontrar un dato difícil. No miden si el informe es bueno. Tres benchmarks más recientes sí lo hacen, y son bastante menos halagadores.

ResearchQA, un esfuerzo académico independiente que abarca 21,000 consultas y 160,000 ítems de rúbrica en 75 campos, validado por 31 anotadores con doctorado en ocho de ellos, encontró que ninguno de los modelos de lenguaje corrientes ni de los sistemas de recuperación que probó llegó al 70% de cobertura de rúbrica. Solo los agentes de deep research diseñados para ello lo superaron, y el mejor de ellos se quedó en el 75.3%. Más revelador aún: ese sistema puntero abordó por completo menos del 11% de los ítems de rúbrica sobre citas y aproximadamente la mitad de los ítems sobre limitaciones y comparaciones. Los agentes encuentran fuentes. Son mucho peores diciendo lo que las fuentes no establecen.

ResearchRubrics, construido sobre más de 2,800 horas de trabajo experto, dejó tanto a Gemini Deep Research como a OpenAI Deep Research por debajo del 68% de cumplimiento medio de rúbrica. DeepResearch Bench II, con 9,430 rúbricas binarias destiladas de artículos de investigación periodística experta, reportó en enero de 2026 que incluso los modelos más fuertes satisfacían menos de la mitad de ellas. Su clasificación en vivo ha superado esa marca desde entonces, lo cual es la trayectoria habitual.

Dos advertencias más antes de usar cualquiera de estos números para elegir herramienta. Qué modelo califica la rúbrica mueve las puntuaciones más de diez puntos, y puede reordenar los dos primeros puestos, así que cualquier tabla que mezcle jueces te está hablando de jueces y no de agentes. Y los agentes que navegan por la web en vivo pueden recuperar las propias respuestas de un benchmark: un estudio de 2026 midió hasta un 4% de inflación por esta vía. La metodología de evaluación publicada por Google ahora bloquea sitios como Hugging Face durante las pruebas, lo que te dice que el problema es lo bastante real como para tener que diseñar a su alrededor.

SimpleQA merece hoy una nota al pie más que un titular. El 93.9% de Perplexity es auténtico, pero data de febrero de 2025 y describe un producto basado en Sonar que, como se cubrió arriba, ya no existe con esa forma.

El hallazgo independiente más duradero es también el más antiguo. El Tow Center de la Columbia Journalism Review probó ocho motores de búsqueda con IA a lo largo de 1,600 consultas y encontró que fallaban al recuperar información correcta más del 60% de las veces, con tasas de error que iban del 37% al 94% según el motor. Ese estudio es de marzo de 2025 y el Tow Center no ha publicado una repetición a esa escala, lo cual es un comentario en sí mismo sobre lo escasa que sigue siendo la evaluación independiente.

La lectura honesta: los benchmarks ordenan las herramientas de forma fiable en el extremo más alto de dificultad y mal por debajo de él. Pasa el mismo prompt real por dos herramientas en su plan de pago más barato y compara. Los benchmarks son sugerentes. Tu propia prueba es decisiva. Para un argumento más largo sobre por qué la obsesión con los benchmarks confunde, consulta La trampa del pensamiento con IA.


Los planes gratuitos: un baño de realidad

Todas las páginas de marketing destacan el acceso gratuito. Esto es lo que significa "gratis" en septiembre de 2026, y la respuesta honesta empieza por una admisión: los números se volvieron más difíciles de encontrar, no mejores.

OpenAI es el único con una asignación gratuita, y dejó de decir de qué tamaño. Las cifras de "5 gratis al mes, 25 en Plus, 250 en Pro" que todavía circulan vienen de una actualización de blog de abril de 2025. La página de precios actual dice Limitado en Free y en el nivel Go de US$ 8 al mes, Ampliado en Plus y Máximo en Pro, y el centro de ayuda confirma que hay un contador dentro del producto que se reinicia cada 30 días sin decir en cuánto arranca. El único número publicado vigente está en la tarifa de empresa, donde una tarea de deep research cuesta 50 créditos. Si necesitas una cuota predecible, este es el proveedor menos predecible.

Perplexity movió Deep Research detrás del muro de pago. Las cuentas gratuitas tienen búsqueda. Deep Research es una función de Pro y, dado que ahora corre dentro de Perplexity Computer, es solo para Pro y Max. Esta guía solía imprimir "5 al día" para el plan gratuito, que era un dato de 2025 sobre un producto que ha sido reconstruido desde entonces.

El nivel barato de Gemini es la verdadera historia, y no es uno gratuito. Google publica las asignaciones de plan como multiplicadores en lugar de como cifras, con límites que se renuevan cada cinco horas, y sus propias páginas de planes sitúan Deep Research en los niveles de pago. Lo que hace de Google la opción de valor no es una asignación gratuita, sino que AI Plus cuesta US$ 4.99 al mes, muy por debajo del precio de entrada de todos los demás.

Claude no tiene Research gratuito, pero tampoco es solo para Pro. Research no está disponible en el plan gratuito y sí lo está en todos los planes de pago: Pro a US$ 20, Max a US$ 100 o US$ 200, más Team y Enterprise. Versiones anteriores de esta guía lo describían como exclusivo de Pro, lo que dejaba fuera a parte de quienes sí lo tienen.

La lectura práctica: ya no existe una herramienta de deep research en la que puedas apoyarte para trabajo real sin pagar. Si solo vas a pagar una, el AI Plus de Gemini a US$ 4.99 es la vía más barata hacia un agente líder en benchmarks, y Perplexity Pro a US$ 20 da el mejor volumen por lo que cuesta. Si quieres la salida más profunda en preguntas ambiguas, ChatGPT Plus a US$ 20 te compra OpenAI Deep Research y todo lo demás del paquete. Claude Pro tiene más sentido si ya usas Claude para leer y escribir y quieres una sola suscripción.


Qué herramienta para qué trabajo

Después de ejecutar cientos de consultas en todas ellas, emergen patrones claros. Así es como yo enrutaría el trabajo hoy.

Revisión de literatura académica. Claude Research. El contexto de 1M de tokens importa cuando el agente tiene que sostener más de 20 artículos a la vez, y Claude es notablemente mejor distinguiendo afirmaciones superficialmente parecidas. Las ejecuciones tardan más, pero las revisiones de literatura no son urgentes.

Dimensionamiento de mercado e inteligencia competitiva. OpenAI Deep Research. La profundidad de razonamiento en preguntas estratégicas ambiguas se nota claramente aquí. Es la que más confianza me da para prompts del tipo "ayúdame a entender este sector".

Recuperación factual más difícil. Gemini Deep Research Max. Si los líderes de los benchmarks te dicen algo, es que el nivel de alto esfuerzo de Google es el agente comercial más fuerte encontrando datos recónditos y de múltiples saltos. Usa el nivel Max deliberadamente, ya que el nivel estándar es un producto significativamente distinto.

Informes rápidos antes de una reunión. Perplexity. Los informes son más cortos y más enciclopédicos, que es lo que quieres cuando necesitas orientación y no un ensayo.

Investigación con tus propios documentos. Gemini Deep Research. La integración con Workspace es su foso defensivo. Si la mitad de tu material fuente está en Drive, Gmail y notas de reuniones antiguas, no hay nada comparable.

Integraciones de desarrollo y ejecuciones masivas. La Deep Research API de Google es ahora la opción llave en mano, ya que la línea Sonar de Perplexity se retira el 27 de septiembre de 2026 y OpenAI no tiene modelo de investigación dedicado. Si quieres control sobre el formato de las citas y sobre el coste, construye el bucle tú mismo sobre Exa, Tavily o la Research API de You.com.

Investigación barata y de alto volumen dentro de un producto. Un modelo de gama media emparejado con un buen proveedor de búsqueda y un presupuesto de turnos generoso. La evidencia de los benchmarks de arriba dice que así consigues casi toda la precisión a una fracción del coste, y es la configuración con la que realmente salen la mayoría de las funciones en producción.

Sintetizar evidencia contradictoria. Claude. Cuando las fuentes discrepan, Claude es el más dispuesto a sacar el desacuerdo a la superficie en lugar de elegir bando prematuramente.

Un patrón que puede sorprender: ninguna herramienta domina sola. Para trabajo de alto riesgo yo paso el mismo prompt por dos agentes. El coste ronda los US$ 40 al mes por dos suscripciones, y el resultado es visiblemente mejor que el de cualquiera de las dos por separado. Si estás decidiendo cómo encaja la IA en tu rutina de estudio o trabajo de forma más amplia, los modos de estudio con IA comparados cubren la pregunta vecina.


La pieza que falta: convertir informes de investigación en conocimiento utilizable

Esto es lo que casi ningún artículo comparativo menciona. El informe que produce el agente es materia prima, y la investigación no termina hasta que lo hayas leído como es debido.

Una salida de 20 páginas de Claude Research o un informe de 15 páginas de OpenAI Deep Research son el inicio del trabajo, no el final. Léelo una vez, ojea la conclusión, cierra la pestaña y habrás pagado a un agente para resumir algo que en realidad no aprendiste. Un estudio de 2025 del MIT Media Lab (recogido en nuestro análisis del impacto de la IA en el aprendizaje) midió la actividad EEG de personas que escribían ensayos con y sin ChatGPT, y encontró una implicación cognitiva marcadamente menor en el grupo asistido. Era un preprint pequeño sobre escritura y no sobre lectura, pero la dirección que señala es la que reconoce todo usuario intensivo de IA.

El remedio es lo que los investigadores llevan siglos haciendo: anotar. Subraya las afirmaciones que importan. Marca las fuentes que quieres verificar. Enlaza ideas entre informes.

Ahí es donde el subrayador web de Glasp encaja en el flujo de trabajo. Ejecuta tu investigación en OpenAI, Perplexity, Gemini o Claude. Pega el informe en una página legible. Subraya directamente en el navegador mientras lees. Tus subrayados se sincronizan con tu biblioteca de Glasp, buscables y organizados, junto a todo lo demás que hayas leído ese mes.

Algunos flujos concretos que funcionan:

Subraya y vuelve a preguntar. Lee el informe y subraya las 10-15 afirmaciones que más importan. Pega esos subrayados de vuelta en el mismo agente con un "profundiza en estos puntos concretos". Iterativo, no de un solo tiro.

Apila informes por tema. Cuando investigas el mismo tema con dos herramientas (digamos, OpenAI y Claude), subrayar ambos informes en Glasp te deja ver dónde convergen y dónde divergen. Los desacuerdos suelen ser la parte más interesante.

Usa YouTube junto al texto. Cuando las mejores fuentes son pódcast o charlas, YouTube Summary te da resúmenes a nivel de transcripción con marcas de tiempo. Combinar un informe de deep research en texto con 3-4 charlas anotadas de YouTube cubre un tema con más profundidad que cualquiera de los dos por separado.

Conversa con tus subrayados. El chat con IA de Glasp puede responder preguntas usando tus anotaciones como fuente. Es la diferencia entre "¿qué dijo el agente sobre X?" y "¿qué he concluido yo realmente sobre X?".

Publica lo que aprendiste. La comunidad de Glasp está llena de otras personas investigando temas parecidos. Compartir informes subrayados es un mecanismo que te obliga a terminar la investigación en lugar de limitarte a encolar más. Para una guía paso a paso, consulta Cómo anotar artículos de la forma correcta.

Un informe que lees una sola vez es un recibo, no conocimiento. El paso de subrayar y anotar es lo que convierte la salida de un agente en algo que de verdad sabes.


Preguntas frecuentes

¿Qué herramienta de deep research es la más precisa?

Entre los cuatro grandes, Gemini Deep Research Max, de Google, lidera con un 54.6% en Humanity's Last Exam (Google, abril de 2026). Ten cuidado con ese nombre: el nivel estándar de Deep Research obtuvo un 50.4% en la misma prueba, y la mayoría de los artículos comparativos citan la cifra de Max bajo el nombre simple del producto. Kimi K3, de Moonshot, declara una cifra todavía más alta, un 56.0%. Todas estas son cifras autorreportadas por los fabricantes, y en pruebas de terceros una configuración de modelo más búsqueda que nadie vende superó a todos los agentes comerciales. En el uso práctico, las diferencias de precisión entre las mejores herramientas son menores de lo que sugieren las clasificaciones.

¿Cuál es la mejor alternativa al deep research de ChatGPT?

Para la mayoría de la gente, Gemini Deep Research, que tiene los mejores resultados publicados en benchmarks y la entrada de pago más barata a US$ 4.99 al mes, o Perplexity, que es más amplia y más rápida. Si quieres algo fuera de los cuatro grandes: Kimi, de Moonshot, tiene un modo Deep Research bien documentado, el de Mistral es el más barato de los retadores a US$ 14.99 al mes, y Grok, de xAI, ofrece un modo multiagente. Si quieres autoalojar, GPT Researcher y DeerFlow, de ByteDance, son las opciones de código abierto activamente mantenidas. Evita el open_deep_research de LangChain, archivado en agosto de 2026, y STORM, de Stanford, que no fusiona un pull request desde hace más de un año.

¿Cuál es la mejor API de deep research?

Los modelos Deep Research de Google en la Interactions API, para la mayoría de los equipos. Es la única API de investigación llave en mano de un laboratorio de frontera que no está siendo retirada, publica una estimación de precio por tarea de aproximadamente US$ 1 a US$ 3 (o US$ 3 a US$ 7 para Max) y documenta un presupuesto de tiempo real. La Agent API de Perplexity es el destino natural si ya usas Sonar, dado que sonar-deep-research pierde soporte el 27 de septiembre de 2026. Si quieres control sobre el formato de las citas y sobre el coste, construye el bucle tú mismo sobre Exa, Tavily o You.com en lugar de comprar un informe terminado.

¿Cuál es la API de deep research más rápida?

Google es el más rápido a la hora de documentarlo: la mayoría de las tareas de Deep Research terminan en 20 minutos, con un tope de 60. Nadie más publica una cifra de latencia vigente, lo cual ya es una respuesta en sí misma. OpenAI solo dice "decenas de minutos", y los 2 a 4 minutos de Perplexity datan de su lanzamiento de febrero de 2025. Si necesitas velocidad, la palanca es el esfuerzo y no el proveedor: todas estas APIs exponen hoy un regulador de nivel, y los niveles bajos devuelven en segundos o en un par de minutos. Para obtener resultados con fuentes en segundos y alimentar tu propio modelo, los niveles de esfuerzo más bajos de Exa, Tavily y You.com son la vía rápida.

¿Cuánto tardan las ejecuciones de deep research?

Usando solo cifras que los fabricantes publican: Google dice que la mayoría de las tareas terminan en 20 minutos y limita las ejecuciones a 60. Moonshot dice que Kimi tarda de 10 a 25 minutos. La página de lanzamiento de OpenAI sigue diciendo de 5 a 30 minutos, una frase que no ha revisado desde febrero de 2025, y los 2 a 4 minutos de Perplexity vienen de ese mismo mes. Anthropic solo dice que las respuestas de Research llegan "en minutos". Trata las cifras antiguas como históricas, porque los tres productos han sido reconstruidos desde entonces.

¿Puedo usar las herramientas de deep research por API?

Sí, y las opciones cambiaron sustancialmente en 2026. Los modelos Deep Research de Google en la Interactions API son la opción llave en mano, con un precio de aproximadamente US$ 1 a US$ 3 por tarea y de US$ 3 a US$ 7 para el nivel Max. El sonar-deep-research de Perplexity era el favorito de los desarrolladores pero pierde soporte el 27 de septiembre de 2026, reemplazado por los presets de esfuerzo de la Agent API. OpenAI retiró sus modelos dedicados o3-deep-research y o4-mini-deep-research el 23 de julio de 2026, así que ahora ejecutas un modelo insignia en la Responses API con la herramienta de búsqueda web, o usas su Agents API, en beta pública desde septiembre de 2026. Anthropic no tiene API con marca de investigación pero sí ofrece Claude Managed Agents en beta, facturado a tokens más US$ 0.08 por hora de sesión. Exa, Tavily y You.com son las opciones populares para construirlo tú mismo.

¿Qué API de deep research tiene las mejores citas?

Google y Perplexity devuelven informes completamente citados de fábrica. Para sistemas en producción que necesitan que cada afirmación se remonte a una URL, los equipos suelen construir sobre Exa, Tavily o You.com, que devuelven resultados atribuidos a su fuente que alimentas a tu propio modelo, de modo que controlas el formato y puedes mostrar una traza de auditoría. Cualquier modelo con una herramienta de búsqueda web puede citar en línea si se lo pides. Ten presente la investigación independiente al respecto: el mejor sistema evaluado abordó por completo menos del 11% de los ítems de rúbrica sobre citas, así que la presencia de citas no equivale a que las citas sean suficientes.

¿Existe una herramienta de deep research gratuita?

Apenas, y empeoró en 2026. OpenAI es el único de los cuatro que todavía da a las cuentas gratuitas una asignación de deep research, descrita como "Limitada" y sin número publicado. Perplexity movió Deep Research detrás de Pro, Claude nunca lo ha ofrecido gratis y Google lo sitúa en los planes de pago. Para trabajo habitual, los puntos de entrada realistas son Gemini AI Plus a US$ 4.99 o un plan de US$ 20 de cualquiera de los tres grandes. Si quieres algo genuinamente gratuito y no te importa ejecutarlo tú mismo, los agentes de código abierto cubiertos arriba son la respuesta honesta.

¿Cómo evito las alucinaciones en los informes de deep research?

Tres tácticas prácticas. Primera, haz clic al menos en las tres a cinco fuentes citadas principales y confirma que la afirmación está realmente en la fuente, ya que citar mal una fuente real es mucho más común que inventarse una falsa. Segunda, pasa el mismo prompt por una segunda herramienta; los desacuerdos suelen ser el lugar donde una de las dos se equivocó. Tercera, si estás integrando esto en software, haz de la verificación una etapa separada del pipeline en vez de una línea de tu prompt: extrae cada afirmación, verifícala en un contexto limpio y luego deja que una pasada escéptica cuestione los veredictos. Ese es el patrón hacia el que convergieron tanto el recetario publicado por OpenAI como el de Anthropic.

¿Pueden las herramientas de deep research leer mis documentos privados?

Gemini Deep Research tiene la integración más profunda, con acceso nativo a tu Gmail, Drive y Docs con permiso. Claude soporta conectores de Google Workspace. OpenAI Deep Research puede leer archivos que subas durante una sesión pero no se integra directamente con el almacenamiento en la nube. Perplexity trabaja principalmente contra la web. Si tu material fuente está en gran parte en Google Workspace, Gemini es la elección obvia.

¿Cuál es la mejor forma de guardar y reutilizar informes de deep research?

Exporta el informe en PDF o Markdown, ábrelo en una vista legible y subráyalo como harías con cualquier artículo largo. Glasp está hecho exactamente para este flujo: los subrayados se sincronizan con una biblioteca que puedes buscar, enlazar con otros subrayados y revisitar. Sin un paso de subrayado, la mayoría de los informes de deep research se leen una vez y se olvidan. Esto conecta con lo que los educadores llaman el efecto de generación: la información que procesas activamente se retiene mucho mejor que la que recibes de forma pasiva.


Conclusión: el stack de investigación, no la herramienta de investigación

Diecinueve meses después del lanzamiento de OpenAI, la categoría se ha aclarado y luego ha empezado a reorganizarse. Los agentes de deep research no son un mercado en el que el ganador se lo lleva todo. Son una mezcla en la que la respuesta correcta depende de qué estés investigando, de cuánto tiempo tengas, de dónde viva tu material fuente y de si estás haciendo clic en un botón o llamando a una API.

Si tuviera que elegir uno para la mayoría de los trabajadores del conocimiento ahora mismo, sería Gemini: los mejores resultados publicados en benchmarks, la entrada de pago más barata a US$ 4.99 y la única API de investigación de un laboratorio de frontera que no tiene los días contados. Para trabajo más pesado o más ambiguo, combínalo con OpenAI Deep Research o Claude Research. Quien esté migrando desde Sonar debería mirar la Agent API de Perplexity antes del 27 de septiembre.

El cambio de fondo es estructural. El modelo de deep research dedicado va camino de desaparecer en todos los laboratorios: OpenAI retiró sus modelos de investigación, Perplexity está retirando Sonar, Google ofrece un agente en lugar de un modelo, Anthropic ofrece una infraestructura gestionada y xAI te hace elegir un número de agentes. Lo que los reemplazó es un regulador de esfuerzo. Eso son buenas noticias para quien construya, porque el esfuerzo es un parámetro que puedes ajustar en cada solicitud, y es la razón por la que el hallazgo más útil de los benchmarks de 2026 fue que subir el presupuesto de búsqueda movió la precisión 53 puntos mientras el modelo seguía siendo el mismo.

Pero la elección de herramienta importa menos que lo que haces con el resultado. El mayor error que veo cometer a la gente es tratar un informe de deep research como trabajo terminado. No lo es. Es materia prima. El conocimiento real se construye cuando subrayas las afirmaciones que importan, las enlazas con otras cosas que has leído y vuelves a ellas más tarde, cuando el tema reaparece.

Ese es el flujo para el que está diseñado Glasp. Subraya cualquier informe, cualquier artículo, cualquier transcripción de YouTube. Construye una biblioteca buscable de lo que de verdad te pareció importante. Conversa con tus subrayados más adelante, cuando necesites recordar algo concreto. Comparte tu trabajo con otras personas que investigan lo mismo.

Los agentes de deep research van a seguir mejorando, y las APIs van a seguir multiplicándose. Los que no reciban además una capa de subrayado por encima van a seguir produciendo informes que se leen una vez y se olvidan. No construyas tu flujo de investigación de 2026 alrededor de una sola herramienta. Constrúyelo alrededor de un stack, y asegúrate de que el último eslabón de ese stack sea aquel donde queda registrada tu propia comprensión.

Empieza esta semana pasando una pregunta de investigación real por dos de las cuatro herramientas. Subraya ambos informes. Compara lo que aprendiste. Ese es el flujo de trabajo. Todo lo demás es una lista de funciones.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it