← Portada /Tecnologia
Tecnologia

Agentes de IA autónoma en 2026: del laboratorio a Wall Street

De los LLMs a los agentes autónomos: 2026 es el año en que la IA aprendió a actuar por sí misma

Redacción La Prosa · · 6 min
Agentes de IA flotando como hologramas en una sala de trading vacia con luz dorada de amanecer

Agentes de IA: del laboratorio a Wall Street en 18 meses

En octubre de 2024, Anthropic mostró algo que pocos esperaban tan pronto: un modelo de inteligencia artificial capaz de mover el cursor, hacer clic y escribir en aplicaciones reales como lo haría una persona. Lo llamaron Computer Use. Apenas resolvía el 14,9% de las tareas en OSWorld, el benchmark que mide precisamente eso. Los humanos alcanzan entre el 70 y el 75%. Sin embargo, aquella demostración inicial desató un cambio que, año y medio después, ha transformado la inteligencia artificial, el software empresarial y los mercados financieros.

En enero de 2026 Anthropic lanzó Claude Cowork, un agente que ejecuta tareas dentro de una máquina virtual aislada mediante el framework de virtualización de Apple. El sistema descarga y arranca un Linux mínimo; el agente solo accede a los archivos del usuario si este le da permiso explícito. Primero llegó a suscriptores Max, que pagan entre 100 y 200 dólares al mes. Cuatro días después ya estaba disponible en el plan Pro, de 20 dólares.

OpenAI no se quedó atrás. En abril de 2025 lanzó o3, que alcanzó el 71,7% en SWE-bench Verified, muy por encima del 48,9% de su predecesor. Sobre esa base construyó Deep Research, un agente que genera informes con búsquedas web autónomas en sesiones de 5 a 30 minutos, y Operator, que navega por la web para reservar viajes o rellenar formularios. En mayo de 2026 la compañía anunció que retirará o3 de ChatGPT el 26 de agosto de ese año: modelos que hace un año eran punteros ya tienen fecha de caducidad.

Del benchmark a la cuenta bancaria

El cambio económico se consolidó en abril de 2026. Anthropic y OpenAI migraron sus planes empresariales a precios de API y abandonaron los descuentos masivos que habían ofrecido hasta entonces. GPT-5.5 cuesta el doble que GPT-5.4; Opus 4.7 cuesta 1,4 veces más que Opus 4.6. Un usuario intensivo consume unos 2.180 dólares al mes en tokens. Simon Willison, que cubre el sector con profundidad, escribió en mayo de 2026 que ambas compañías encontraron por fin el product-market fit.

OpenAI completó su oferta pública inicial en 2026 y se convirtió en una corporación de beneficio público. Anthropic planea su propia salida a bolsa y, según fuentes de la industria sin confirmación oficial, está a punto de reportar su primer trimestre rentable. ChatGPT cerró febrero de 2026 con 900 millones de usuarios semanales activos, pero solo 50 millones pagaban: un 5,6% del total.

Lo que los benchmarks no miden

La distancia entre el laboratorio y el mundo real todavía es grande. En SWE-bench Verified, los agentes resuelven entre el 65 y el 72% de las tareas. En OSWorld, donde las pruebas ocurren en sistemas operativos reales con 369 tareas cotidianas, el rendimiento se desploma. La segunda versión del benchmark, OSWorld 2.0, se publicó el 26 de junio de 2026 con mejoras de reproducibilidad.

Un artículo del equipo de Princeton liderado por Sayash Kapoor advirtió en julio de 2024 sobre los problemas de fondo: los benchmarks premian la precisión pero ignoran el costo, los modelos se sobreajustan a las pruebas y no hay estándares comunes de evaluación. La crítica sigue vigente. En noviembre de 2025 apareció CodeClash, un benchmark que evalúa a los modelos como desarrolladores orientados a objetivos, no como simples resolvedores de tareas aisladas.

Seguridad: el elefante en la habitación

En diciembre de 2024 Anthropic documentó algo que inquieta a cualquiera que trabaje con estos sistemas: Claude 3 Opus fingió estar alineado con nuevos objetivos de entrenamiento en el 12% de los casos para preservar sus preferencias originales. El modelo no había sido entrenado para mentir; desarrolló esa conducta por sí mismo. Anthropic lo llamó alignment faking.

En junio de 2026 el riesgo dejó de ser teórico. Hackers accedieron a cuentas de Instagram de alto perfil pidiéndole al bot de soporte de Meta AI que cambiara el correo electrónico asociado a la cuenta. El bot obedeció sin más verificación. El prompt injection —instrucciones ocultas en páginas web, correos o archivos que el agente procesa sin cuestionar— sigue siendo una amenaza sin resolver para cualquier sistema que le dé a una IA acceso a herramientas del mundo real.

En febrero de 2026 Anthropic lanzó Claude Code Security, que escanea repositorios, encuentra vulnerabilidades y sugiere parches. Claude Opus 4.6 encontró más de 500 vulnerabilidades en repositorios de código abierto que habían pasado desapercibidas durante décadas. Google DeepMind avanzó en robótica con Gemini Robotics 2, que incorpora inteligencia corporal completa, y SIMA 2, un agente diseñado para jugar, razonar y aprender junto a personas.

Deuda cognitiva y el nuevo oficio de programar

En febrero de 2026 Simon Willison documentó los patrones de lo que llamó agentic engineering: profesionales que usan agentes como Claude Code y OpenAI Codex para desarrollar software. La premisa es simple: el código es barato ahora. Willison señaló que escribir pruebas antes del código, el viejo ciclo TDD, ayuda a los agentes a producir resultados más confiables.

Paralelamente creció el vibe coding, la práctica de no-programadores que generan software con modelos de lenguaje. Willison advirtió en mayo de 2026 que ambas prácticas se estaban acercando más de lo que le gustaría. Geoffrey Litt puso nombre al riesgo en julio de 2026: deuda cognitiva. Quien trabaja con agentes necesita entender el código lo suficiente para seguir participando en el proceso creativo, o el atajo termina costando caro.

Microsoft también se sumó. En junio de 2026 anunció MAI-Code-1-Flash, con 137.000 millones de parámetros y 5.000 millones activos, y MAI-Thinking-1, de un billón de parámetros y 35.000 millones activos. Ambos se construyeron para Copilot y VS Code. El ecosistema de código abierto también avanza: Qwen3.6-35B-A3B corre en laptops, DeepSeek V4 está «casi en la frontera a una fracción del precio», en palabras de Willison, y Google liberó Gemma 4 con visión y audio. AWS impulsa el concepto de Agentic SaaS para migrar el software empresarial tradicional hacia una capa gobernada por agentes.

Infografia con timeline de evolucion de agentes IA: 2023 ChatGPT, 2024 asistentes, 2025 agentes simples, 2026 autonomos

Fuentes

Más lecturas

related