AI

Herramientas de Deep Research: OpenAI vs Perplexity vs Gemini

Todos los grandes laboratorios de IA ofrecen ya un agente de "deep research" y, en 2026, la mayoría ofrece también una API de investigación. Todos prometen informes de nivel doctoral en minutos. Tras un año de uso real, las diferencias son mayores de lo que sugiere el marketing.

16 min de lectura
Puntos clave
    • OpenAI sigue liderando en razonamiento difícil, pero retiró su API dedicada: Deep Research obtuvo un 26,6 % en Humanity's Last Exam en su lanzamiento (OpenAI, feb. 2025). Los modelos de API independientes o3-deep-research y o4-mini-deep-research se cerraron el 23 de julio de 2026, así que el deep research por API ahora corre sobre modelos GPT-5.x con la herramienta de búsqueda web.
  • Perplexity es la que de verdad puedes usar para construir: Sonar Deep Research termina la mayoría de las ejecuciones en menos de 3 minutos y es el único gran actor con una API de investigación diseñada específicamente para ello, con un precio de $2 de entrada / $8 de salida por millón de tokens, más $5 por cada 1.000 búsquedas.
  • Gemini dio el mayor salto de 2026: Su agente Deep Research alcanzó un 54,6 % en Humanity's Last Exam (Google, abr. 2026) y se volvió invocable a través de la nueva Deep Research API, además de su acceso nativo a Gmail, Drive y Docs.
  • Claude es el corredor de fondo reflexivo, sin API de investigación: Las ejecuciones se extienden de 5 a 45 minutos en Sonnet 5 u Opus 5 con un contexto de 1M de tokens, pero tú mismo montas tu agente con la herramienta de búsqueda web y el Claude Agent SDK.
  • Los planes gratuitos son reales, pero limitados: 5 ejecuciones al mes en ChatGPT, 5 al día en Perplexity, acceso limitado en Gemini. Suficiente para evaluar, no para depender de ellos.
  • El informe no es el resultado, tu comprensión sí lo es: Combinar un agente de deep research con un flujo de trabajo de subrayado como Glasp convierte informes de 20 páginas en conocimiento utilizable en lugar de PDFs que se leen una sola vez.

El momento del deep research

Aquí tienes la respuesta corta si solo quieres una recomendación. Para la mayoría de la gente en 2026, Perplexity Pro es la mejor herramienta de deep research de propósito general por precio y velocidad; OpenAI y Claude producen los informes más profundos para trabajos difíciles o ambiguos; y Gemini gana cuando tu material de origen vive en Google o necesitas una API invocable. Si eres desarrollador, Sonar Deep Research de Perplexity y la Deep Research API de Google son las dos sobre las que puedes construir hoy, ya que OpenAI retiró sus modelos dedicados de deep research en julio de 2026 y Anthropic nunca lanzó uno. El resto de esta guía muestra cómo se sostienen esos veredictos a lo largo de precios, velocidad, benchmarks y tareas reales.

La categoría en sí apenas tiene 18 meses. El 2 de febrero de 2025, OpenAI anunció Deep Research. Fue el primer agente que la mayoría de la gente había usado que podía tomar una instrucción de una sola frase, planificar una investigación de 30 minutos, navegar por decenas de fuentes por su cuenta y volver con un informe citado.

La reacción del sector fue reveladora. En seis semanas, Perplexity lanzó su propio Deep Research (14 de febrero) y abrió la API de Sonar Deep Research a los desarrolladores semanas después. Google, que había lanzado Gemini Deep Research de forma discreta en diciembre de 2024, aceleró su despliegue y siguió mejorando la base. Anthropic puso la búsqueda web de Claude disponible de forma general el 7 de mayo de 2025, empaquetando la función Research en esa misma ventana de primavera.

Cuatro laboratorios, una categoría de producto, un trimestre. Eso no ocurre por accidente. 2024 fue el año en que las ventanas de contexto cruzaron los 200K tokens, el uso de herramientas se volvió fiable y los bucles agénticos dejaron de fallar en silencio a mitad de camino. El deep research fue la primera aplicación de cara al consumidor que hizo que los tres parecieran valer la pena pagar. Está estrechamente ligado al cambio más amplio hacia los protocolos de agentes que cubrimos en The Agentic Web: Inside the MCP Protocol Wars.

Si escribes, estudias, analizas mercados o evalúas productos, ya estás en desventaja si no usas una. La pregunta es cuál, y cuándo.


Qué hace realmente el "deep research"

Es fácil confundir el deep research con la búsqueda por chat. Escribes una pregunta, obtienes una respuesta con enlaces. La mecánica es distinta.

Una búsqueda por chat (como el ChatGPT normal con navegación) ejecuta una o dos consultas web y sintetiza los mejores resultados en segundos. Un agente de deep research hace algo más parecido a lo que hace un analista junior a lo largo de una tarde. Divide tu pregunta en subpreguntas, ejecuta decenas o cientos de búsquedas, lee páginas completas, sigue las citas, actualiza su plan a medida que aprende y produce un informe estructurado con notas al pie.

Pregúntale a una búsqueda por chat "¿cuáles son las principales críticas a la curva de Phillips?" y obtendrás un resumen de tres párrafos. Pregúntale lo mismo a un agente de deep research y obtendrás un informe de 15 páginas que cubre la hipótesis de la tasa natural de Friedman, la ruptura por la estanflación de los años 70, las revisiones de expectativas racionales, los debates sobre el aplanamiento posterior a 2008 y artículos recientes de 2023-2025, cada uno con una fuente en la que puedes hacer clic.

El compromiso es el tiempo. Las ejecuciones tardan entre 3 y 45 minutos según la herramienta y la profundidad. Ese es el punto. Pones una en cola, trabajas en otra cosa y vuelves a un informe que te habría llevado media jornada ensamblar a mano. Para más sobre cómo reestructurar los hábitos de investigación en torno a los agentes de IA, consulta How to Build an AI-Powered Research Workflow in 2026.


Cara a cara: las 4 herramientas de consumo comparadas

Aquí tienes la matriz, con el modelo que la respalda y los precios verificados frente a las páginas de producto actuales en agosto de 2026.

HerramientaModelo base (2026)Precio y límitesVelocidad típica
OpenAI Deep ResearchRazonamiento GPT-5.xGratis: 5/mes; Plus ($20/mes): 25/mes; Pro ($100 o $200/mes): 250/mes5-30 min
Perplexity Deep ResearchSonarGratis: 5/día; Pro ($20/mes); Max (~$200/mes); API Sonar para desarrolladoresMenos de 3 min
Gemini Deep ResearchGemini 3.1 ProAI Plus ($4,99/mes); AI Pro ($19,99/mes): topes más altos; AI Ultra ($99,99 o $199,99/mes)5-15 min
Claude ResearchSonnet 5 / Opus 5, ctx 1MIncluido en Pro ($20/mes) y Max ($100 o $200/mes)5-45 min

Los perfiles en un párrafo:

OpenAI Deep Research es el peso pesado. Las ejecuciones son más lentas, los informes son los más largos y el razonamiento es visiblemente más profundo en temas ambiguos. Originalmente funcionaba sobre un modelo o3 personalizado y ahora se asienta sobre la línea de razonamiento GPT-5.x de OpenAI. El tope de 25 al mes en Plus es la verdadera restricción. Los usuarios intensivos lo agotan en una semana, razón por la cual OpenAI dividió el antiguo plan Pro de $200 en niveles de $100 y $200 en 2026.

Perplexity Deep Research es el campeón de velocidad. La mayoría de las ejecuciones terminan en 2-3 minutos. Los informes son más cortos y más enciclopédicos, ideales para un briefing más que para un ensayo. Es también la única de las cuatro cuyo agente de investigación se ofrece como una API propia para desarrolladores.

Gemini Deep Research logró las mejoras más sonadas en 2026. Google actualizó el agente de consumo a Gemini 3.1 Pro en abril de 2026 y, algo crucial, expuso una Deep Research API para que los desarrolladores puedan invocar la misma capacidad. Sigue extrayendo datos de tu Gmail, Drive y Docs junto con la web, y muestra un plan de investigación visible que puedes editar antes de que el agente se ejecute.

Claude Research es el paciente. Las ejecuciones alcanzan con regularidad el extremo de los 30-45 minutos del rango, y el resultado lo refleja: extenso, matizado, bueno para sopesar evidencia contradictoria. Los modelos actuales de Claude (Sonnet 5, Opus 5) llevan un contexto de 1M de tokens a precio estándar, así que los grandes conjuntos de fuentes no se truncan.


APIs de deep research: qué puedes invocar de verdad

Esta es la pregunta que los artículos de comparación no dejan de saltarse, y la que los desarrolladores no dejan de buscar: qué agentes de deep research puedes invocar desde tu propio código, qué tan rápidos son y qué tan buenas son las citas. El panorama cambió con fuerza en 2026, así que aquí está la imagen actual.

Proveedor¿Deep research invocable?Qué invocasPrecio
PerplexitySí, diseñado a propósitosonar-deep-research$2/1M entrada, $8/1M salida, más $2/1M tokens de citas + $3/1M tokens de razonamiento, más $5 por 1.000 búsquedas
Google GeminiSí, nuevo en 2026Deep Research vía la Interactions API (modo background)deep-research-preview ~$1-3 por tarea; deep-research-max ~$3-7 por tarea (tarifas de preview)
OpenAIYa no como modelo dedicadoGPT-5.x en la Responses API con la herramienta web_searchTarifas por token de GPT-5.x más el coste de la herramienta de búsqueda; los antiguos o3-deep-research ($10/$40 por 1M) y o4-mini-deep-research ($2/$8 por 1M) se cerraron el 23 de julio de 2026
Anthropic ClaudeSin agente dedicadoHerramienta web_search de la Messages API, o el Claude Agent SDK$10 por 1.000 búsquedas más el coste de tokens del modelo
ExaConstrúyelo tú mismoEndpoints Search / Deep Search / AgentSearch $7 por 1.000; Deep Search $12 por 1.000; endpoint Agent $0,012-$1,00 por solicitud
TavilyConstrúyelo tú mismoEndpoints Search / Research1.000 créditos gratis/mes; PAYG $0,008/crédito; cada ejecución de Research consume 15-250 créditos

Tres cosas destacan.

Perplexity sigue siendo la única API de deep research lista para usar. Envías una instrucción a sonar-deep-research y recibes de vuelta un informe citado, sin necesidad de orquestación. El precio parece inusual porque es honesto sobre los costes ocultos que todos los demás entierran: los tokens de citas y los tokens de razonamiento se facturan por separado, y las búsquedas web cuestan $5 por cada mil además de la factura de tokens. Si estás buscando la "API de deep research más rápida", esta es la respuesta directa, porque Sonar termina la mayoría de las ejecuciones en menos de tres minutos donde las demás tardan de cinco a cuarenta y cinco.

OpenAI trasladó el deep research a su línea de modelos general. Los modelos dedicados o3-deep-research y o4-mini-deep-research eran genuinamente buenos, pero OpenAI los declaró obsoletos en abril de 2026 y los cerró el 23 de julio de 2026. La vía de reemplazo es ejecutar un modelo GPT-5.x en la Responses API con la herramienta web_search (y, opcionalmente, servidores MCP remotos o búsqueda de archivos) en modo background. Obtienes más control y aún puedes alcanzar el comportamiento de deep research, pero montas el bucle tú mismo en lugar de invocar un modelo que lo hace de principio a fin.

Google abrió la puerta discretamente en 2026. Durante la mayor parte de la vida de la categoría, Gemini Deep Research era una función de consumo que no podías invocar programáticamente. Eso cambió con la Deep Research API a través de la Interactions API de Google, con soporte empresarial anunciado para Vertex AI. Combinado con Grounding with Google Search (5.000 búsquedas gratis al mes en los modelos Gemini 3.x, luego $14 por 1.000), Google es ahora una opción real para equipos que quieren citas ligadas al índice de Google.

Para la consulta específica de la "mejor API para informes de investigación con citas", funcionan tres enfoques. Perplexity te da citas de fábrica y reporta una fuerte precisión de citas. Exa y Tavily te dan resultados de búsqueda en bruto, atribuidos a su fuente, que introduces en tu propio modelo, que es el patrón sobre el que están construidas en realidad la mayoría de las funciones de deep research en producción, porque controlas el coste y el formato de las citas. Y cualquier modelo con una herramienta de búsqueda web (Claude, GPT-5.x, Gemini) puede citar sobre la marcha si se lo pides. Las empresas que necesitan rastros de auditoría tienden a preferir la vía de Exa o Tavily porque cada afirmación se remonta a una URL que recuperaste, no a la memoria de un modelo. Para saber por qué el grounding y la calidad de la recuperación importan más que el tamaño bruto del contexto, consulta Context Rot: Why RAG Still Beats a Giant Context Window.


Benchmarks: HLE, BrowseComp y SimpleQA

Tres números se citan más que ninguno: Humanity's Last Exam, BrowseComp y SimpleQA. Son útiles, y también se sobreinterpretan.

Humanity's Last Exam (HLE), publicado por Scale AI y el Center for AI Safety a principios de 2025, es un benchmark multidominio de aproximadamente 2.500 preguntas en el límite exterior de lo que los expertos pueden responder. Las puntuaciones cuentan la historia de lo rápido que se movió esta categoría:

AgenteHLE (con herramientas)Reportado
Perplexity Sonar Deep Research21,1 %Feb 2025
OpenAI Deep Research (o3)26,6 %Feb 2025
Gemini Deep Research (3 Pro)46,4 %Dic 2025
Gemini Deep Research Max (3.1 Pro)54,6 %Abr 2026

En poco más de un año, el mejor agente lanzado más que duplicó su puntuación de HLE. Lo que HLE mide bien es la síntesis entre dominios sobre preguntas genuinamente difíciles. Lo que no mide es si el agente es bueno en el trabajo que tú realmente haces. La mayoría de la investigación real no es física de nivel doctoral. Es "resume los debates recientes sobre este tema" o "compara estos cinco productos para mi caso de uso", donde la brecha entre herramientas es mucho menor de lo que implica la tabla de clasificación.

BrowseComp (OpenAI, abril de 2025) se ha convertido en el estándar más relevante para estos agentes. Son 1.266 preguntas de navegación difíciles y de múltiples saltos que premian la persistencia y una buena estrategia de búsqueda. OpenAI Deep Research obtuvo un 51,5 % en su lanzamiento, y el Deep Research Max de Google reportó un 85,9 % en abril de 2026. El dato canónico es que un modelo de navegación simple obtuvo menos del 2 % en la misma prueba, así que casi toda la ganancia proviene del andamiaje del agente, no del modelo base.

SimpleQA es el punto fuerte de Perplexity. El benchmark prueba la precisión factual de formato corto, y Sonar Deep Research obtuvo un 93,9 % (Perplexity, feb. 2025). Ese es un indicador útil de "¿alucina hechos el agente?", que importa mucho cuando vas a citar el resultado. Ten en cuenta que es un número de agente-con-búsqueda, así que no es comparable con el ~50 % que obtiene un modelo pelado.

La lectura honesta: los benchmarks clasifican las herramientas de forma fiable en el extremo superior de dificultad y mal por debajo de él. La mejor manera de elegir es pasar la misma instrucción real por dos o tres herramientas en el plan gratuito y comparar. Los benchmarks son sugerentes. Tu propia prueba es decisiva. Para un argumento más largo sobre por qué la obsesión con los benchmarks confunde, consulta The AI Thinking Trap.


La realidad de los planes gratuitos

Todas las páginas de marketing destacan el acceso gratuito. Esto es lo que "gratis" significa en realidad cuando intentas usar estas herramientas para trabajo real.

OpenAI Deep Research (Gratis: 5/mes). Suficiente para evaluar, no para depender de él. Un solo proyecto a menudo se come 2-3 ejecuciones (pasada inicial, seguimiento, aclaración). Llegarás al tope hacia el día 10 si lo usas para trabajo. Plus a $20/mes por 25 ejecuciones es el nivel de inicio realista.

Perplexity Deep Research (Gratis: aproximadamente 5/día). El más generoso del grupo. Perplexity limita a los usuarios gratuitos a un puñado de ejecuciones de Deep Research al día, lo que aun así suma más de lo que la mayoría de la gente necesita. El resultado del plan gratuito es más corto que el de Pro, y no obtienes las variantes más nuevas de Sonar. Para uso casual, este es el plan gratuito que de verdad sigues usando.

Gemini Deep Research (Gratis: acceso limitado). Google reestructuró sus planes en 2026, y el nivel de pago más barato, Google AI Plus, bajó a $4,99/mes, lo que convierte a Gemini en el punto de entrada de bajo coste si no pagas ya por AI Pro. El acceso gratuito existe pero se ejecuta con menos frecuencia y de forma más corta que los niveles de pago.

Claude Research (solo Pro, $20/mes). Sin plan gratuito dedicado para la función Research. El plan gratuito incluye chat y búsqueda web, pero la investigación de múltiples pasos está tras Pro. Pro también incluye el acceso a Sonnet 5 de Claude (Opus 5 en los niveles superiores), así que los $20 te compran uno de los modelos de lectura de contexto largo más potentes del mercado.

Resumen de planes gratuitos¿Utilizable para trabajo real?
OpenAI Deep Research (5/mes)Solo evaluación
Perplexity Deep Research (5/día)Sí, para uso ligero
Gemini Deep Research (limitado)Parcial, mejor con AI Plus o Pro
Claude ResearchSin plan gratuito

Si solo pagas por uno, Perplexity Pro te da la mejor relación volumen-precio a $20. Si solo quieres el resultado más inteligente, ChatGPT Plus a $20 te da 25 ejecuciones de OpenAI Deep Research más todo lo demás del paquete Plus. Para usuarios de Google Workspace o el menor coste mensual, los niveles AI Plus y AI Pro de Gemini son la elección natural. Claude Pro tiene más sentido si ya usas Claude para leer y escribir y quieres una suscripción integrada.


Qué herramienta para qué tarea

Tras ejecutar cientos de consultas en las cuatro, emergen patrones claros. Así es como enrutaría el trabajo ahora.

Revisión de literatura académica. Claude Research. La ventana de contexto larga importa cuando el agente necesita mantener más de 20 artículos en memoria de trabajo, y Claude es notablemente mejor distinguiendo entre afirmaciones superficialmente similares. Las ejecuciones tardan más, pero las revisiones de literatura no son sensibles al tiempo.

Dimensionamiento de mercado e inteligencia competitiva. OpenAI Deep Research. La profundidad de razonamiento en preguntas estratégicas ambiguas (por qué creció un mercado, qué impulsa el cambio de clientes) se aprecia con claridad aquí. Es en la que más confío para instrucciones del tipo "ayúdame a entender este sector".

Briefings factuales rápidos. Perplexity Deep Research. Si solo necesitas un resumen citado de dos páginas antes de una reunión, los 3 minutos de respuesta de Perplexity son difíciles de superar. La precisión factual al estilo SimpleQA es una fortaleza genuina.

Decisiones de compra y comparaciones de productos. Perplexity o Gemini. Ambas incorporan suficientes datos de reseñas del mundo real (foros, transcripciones de YouTube, hojas de especificaciones) para producir comparaciones lado a lado útiles. La ventaja de Gemini es incorporar tus propios recibos de Gmail y notas de Drive.

Investigación que involucra tus propios documentos. Gemini Deep Research. La integración con Workspace es el foso. Si estás investigando un tema donde la mitad del material de origen está en tu Drive (notas de reuniones, PDFs, correos antiguos), nada más se compara.

Integraciones para desarrolladores y ejecuciones en masa. Perplexity Sonar Deep Research para un agente llave en mano, o Exa y Tavily si quieres construir el bucle tú mismo y controlar el formato de las citas. La nueva Deep Research API de Google es la elección empresarial cuando quieres resultados ligados al índice de Google.

Síntesis de evidencia contradictoria. Claude. Cuando las fuentes discrepan (p. ej., "¿es la fibra realmente buena para la diverticulitis?" o "¿funciona la técnica Pomodoro?"), Claude es el más dispuesto a sacar a la luz el desacuerdo en lugar de tomar partido prematuramente.

Un patrón que podría sorprender a la gente: ninguna herramienta única domina. Yo paso la misma instrucción por dos agentes para trabajo de alto riesgo. El coste es de unos $40/mes por dos suscripciones, y el beneficio es un resultado notablemente mejor que el que produce cualquier herramienta única por sí sola. La búsqueda por chat y el deep research empiezan a sentirse menos como productos que compiten y más como un stack que compones.


La pieza que falta: convertir los informes de investigación en conocimiento utilizable

Esto es lo que casi ningún artículo de comparación menciona. El informe que produce el agente no es el resultado de tu investigación. Tu comprensión lo es.

Un resultado de Claude Research de 20 páginas o un informe de OpenAI Deep Research de 15 páginas es el inicio del trabajo, no el final. Léelo una vez, hojea la conclusión, cierra la pestaña, y habrás pagado a un agente para que resuma algo que en realidad no aprendiste. El estudio de 2025 del MIT Media Lab sobre el uso pasivo de la IA (rastreado en nuestro análisis del impacto de la IA en el aprendizaje) mostró que los usuarios intensivos de ChatGPT retenían de forma consistente menos de lo que "leían" que los aprendices activos.

La solución es lo que los investigadores han hecho durante siglos: anotar. Subrayar las afirmaciones que importan. Marcar las fuentes que quieres verificar. Enlazar ideas entre informes.

Aquí es donde el subrayador web de Glasp encaja en el flujo de trabajo. Ejecuta tu investigación en OpenAI, Perplexity, Gemini o Claude. Pega el informe en una página legible. Subraya directamente en el navegador mientras lees. Tus subrayados se sincronizan con tu biblioteca de Glasp, buscable y organizada, junto a todo lo demás que hayas leído ese mes.

Algunos flujos de trabajo concretos que funcionan:

Subraya, luego vuelve a consultar. Lee el informe, subraya las 10-15 afirmaciones que más importan. Pega esos subrayados de vuelta en el mismo agente con "profundiza en estos puntos específicos". Iterativo en lugar de de una sola pasada.

Apila informes por tema. Cuando investigas el mismo tema con dos herramientas (por ejemplo, OpenAI y Claude), subrayar ambos informes en Glasp te permite ver dónde convergen y divergen. Los desacuerdos son a menudo las partes más interesantes.

Usa YouTube junto al texto. Cuando las mejores fuentes son pódcasts o charlas, YouTube Summary te da resúmenes a nivel de transcripción con marcas de tiempo. Combinar un informe de deep research en texto con 3-4 charlas de YouTube anotadas cubre un tema de forma más exhaustiva que cualquiera de los dos por separado.

Chatea con tus subrayados. El chat con IA de Glasp puede responder preguntas usando tus anotaciones como fuente. Es la diferencia entre "¿qué dijo el agente sobre X?" y "¿qué he concluido yo realmente sobre X?".

Publica lo que aprendiste. La comunidad de Glasp está llena de otras personas investigando temas similares. Compartir informes subrayados es una función forzosa para terminar la investigación, no solo para poner más en cola. Para una guía paso a paso, consulta How to Annotate Articles the Right Way.

Un informe que lees una vez es un recibo, no conocimiento. El paso de subrayar y anotar es lo que convierte el resultado del agente en algo que de verdad sabes.


Preguntas frecuentes

¿Qué herramienta de deep research es la más precisa?

En los últimos benchmarks publicados, Gemini Deep Research Max de Google lidera Humanity's Last Exam con un 54,6 % (Google, abr. 2026), un gran salto desde el 26,6 % que OpenAI Deep Research registró en el lanzamiento de la categoría (OpenAI, feb. 2025). Para la precisión factual de formato corto, Perplexity Sonar obtuvo un 93,9 % en SimpleQA (feb. 2025), que es excelente. En uso práctico, las diferencias de precisión entre las mejores herramientas son menores de lo que sugieren los benchmarks. La diferencia mayor es profundidad frente a velocidad.

¿Cuál es la API de deep research más rápida?

sonar-deep-research de Perplexity es la opción llave en mano más rápida, terminando la mayoría de las ejecuciones en menos de tres minutos donde OpenAI, Gemini y Claude tardan de cinco a cuarenta y cinco. Tiene un precio de $2 por millón de tokens de entrada y $8 por millón de tokens de salida, más cargos separados por tokens de citas y de razonamiento y $5 por cada 1.000 búsquedas. Si quieres velocidad bruta en búsquedas individuales para construir tu propio bucle, Exa y Tavily devuelven resultados con fuentes en segundos.

¿Cuánto tardan las ejecuciones de deep research?

Perplexity termina la mayoría de las ejecuciones en menos de 3 minutos. Gemini normalmente corre de 5 a 15 minutos. OpenAI Deep Research tarda de 5 a 30 minutos según la complejidad de la consulta. Claude Research puede extenderse de 5 a 45 minutos en instrucciones difíciles. Si necesitas una respuesta ahora, Perplexity. Si puedes esperar, Claude u OpenAI suelen producir informes más exhaustivos.

¿Puedo usar las herramientas de deep research vía API?

Sí, y las opciones cambiaron en 2026. sonar-deep-research de Perplexity es la única API de deep research llave en mano: una llamada devuelve un informe citado. Google ahora expone una Deep Research API a través de su Interactions API y Vertex AI. OpenAI retiró sus modelos dedicados o3-deep-research y o4-mini-deep-research el 23 de julio de 2026, así que ahora ejecutas un modelo GPT-5.x en la Responses API con la herramienta de búsqueda web en su lugar. Anthropic no ofrece un agente de investigación dedicado, pero puedes construir uno con la herramienta de búsqueda web de la Messages API ($10 por 1.000 búsquedas) y el Claude Agent SDK. Exa y Tavily son las populares APIs de "constrúyelo tú mismo" de búsqueda para IA.

¿Qué API da las mejores citas?

Para citas de fábrica, Sonar Deep Research de Perplexity devuelve un informe totalmente citado y reporta una fuerte precisión de citas. Para sistemas en producción que necesitan que cada afirmación se remonte a una URL, los equipos suelen construir sobre Exa o Tavily, que devuelven resultados de búsqueda atribuidos a su fuente que introduces en tu propio modelo, así que controlas el formato y puedes mostrar un rastro de auditoría. Cualquier modelo con una herramienta de búsqueda web (Claude, GPT-5.x, Gemini) puede citar en línea si se lo pides.

¿Hay alguna herramienta de deep research genuinamente gratuita?

Sí, pero con límites. OpenAI da a los usuarios gratuitos 5 ejecuciones de Deep Research al mes. Perplexity da 5 al día en el plan gratuito, la asignación más generosa. Gemini tiene acceso gratuito limitado a Deep Research, y su nivel de pago más barato (Google AI Plus) empieza ahora en $4,99/mes. Claude no ofrece Research en su plan gratuito. Para uso casual, Perplexity Free cubre la mayoría de las necesidades. Para trabajo regular, un plan Pro de $20/mes es el punto de entrada realista.

¿Cómo detengo las alucinaciones en los informes de deep research?

Tres tácticas prácticas. Primero, haz siempre clic al menos en las 3-5 fuentes citadas principales y verifica que la afirmación está en la fuente (las alucinaciones vienen más a menudo de citar mal una fuente real que de inventar una falsa). Segundo, pasa la misma instrucción por una segunda herramienta y compara. Los desacuerdos entre Claude y OpenAI, por ejemplo, suelen ser los lugares donde uno de ellos se equivocó en algo. Tercero, favorece a Perplexity para consultas factuales de alto riesgo, ya que su puntuación de 93,9 % en SimpleQA refleja una calibración genuina en hechos de formato corto.

¿Pueden las herramientas de deep research leer mis documentos privados?

Gemini Deep Research tiene la integración más profunda, con acceso nativo a tu Gmail, Drive y Docs (con permiso). Claude Research admite conectores de Google Workspace. OpenAI Deep Research puede leer archivos que subas durante una sesión, pero no se integra directamente con el almacenamiento en la nube. Perplexity trabaja principalmente contra la web. Si tu material de origen está en gran parte en Google Workspace, Gemini es la elección obvia.

¿Cuál es la mejor forma de guardar y reutilizar los informes de deep research?

Exporta el informe como PDF o Markdown, ábrelo en una vista legible y subráyalo como harías con cualquier artículo largo. Glasp está construido exactamente para este flujo de trabajo: los subrayados se sincronizan con una biblioteca que puedes buscar, enlazar con otros subrayados y revisitar. Sin un paso de subrayado, la mayoría de los informes de deep research se leen una vez y se olvidan. Esto se relaciona con lo que los educadores llaman el "efecto de generación": la información que procesas activamente se retiene mucho mejor que la información que recibes de forma pasiva.


Conclusión: el stack de investigación, no la herramienta de investigación

Un año y medio después del lanzamiento de OpenAI, la categoría se ha aclarado. Los agentes de deep research no son un mercado en el que el ganador se lo lleva todo. Son una mezcla donde la respuesta correcta depende de qué estés investigando, de cuánto tiempo tengas, de dónde vive tu material de origen y de si estás pulsando un botón o llamando a una API.

Si tuviera que elegir una para la mayoría de los trabajadores del conocimiento en 2026, es Perplexity Pro. La relación volumen-precio a $20 es la mejor del grupo, las ejecuciones son lo bastante rápidas para caber dentro de un ritmo de trabajo normal, y la precisión en SimpleQA es genuinamente fuerte. Para trabajo más pesado o más ambiguo, combínala con OpenAI Deep Research o Claude Research. Para desarrolladores, Sonar Deep Research de Perplexity y la nueva Deep Research API de Google son las dos sobre las que puedes construir hoy.

Pero la elección de herramienta importa menos que lo que haces con el resultado. El mayor error que veo cometer a la gente es tratar un informe de deep research como trabajo terminado. No lo es. Es materia prima. El conocimiento real se construye cuando subrayas las afirmaciones que importan, las enlazas con otras cosas que has leído y vuelves a ellas más tarde cuando el tema surge de nuevo.

Ese es el flujo de trabajo para el que Glasp está diseñado. Subraya cualquier informe, cualquier artículo, cualquier transcripción de YouTube. Construye una biblioteca buscable de lo que de verdad te pareció importante. Chatea con tus subrayados más tarde cuando necesites recordar algo específico. Comparte tu trabajo con otros que hacen la misma investigación.

Los agentes de deep research seguirán mejorando, y las APIs seguirán multiplicándose. Los que no obtengan también una capa de subrayado encima seguirán produciendo informes que se leen una vez y se olvidan. No construyas tu flujo de investigación de 2026 en torno a una única herramienta. Constrúyelo en torno a un stack, y asegúrate de que el último eslabón de ese stack sea aquel donde tu propia comprensión queda registrada.

Empieza pasando una pregunta de investigación real por dos de las cuatro herramientas esta semana. Subraya ambos informes. Compara lo que aprendiste. Ese es el flujo de trabajo. Todo lo demás es una lista de funciones.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it