Publicidad
Google presentó Gemini 4 Argon: así funciona su nueva inteligencia artificial de frontera
Las ventajas del nuevo modelo de inteligencia artificial.
Google presentó Gemini 4 Argon, su nuevo modelo de inteligencia artificial de frontera, desarrollado para afrontar trabajos complejos y de larga duración en áreas como programación, investigación, finanzas, derecho, ciencia, matemáticas, operaciones empresariales y ciberseguridad.
El lanzamiento, realizado hace dos días, marcó una nueva etapa en la estrategia de la compañía: pasar de modelos centrados principalmente en responder instrucciones a sistemas capaces de desarrollar procesos completos durante periodos prolongados.
Lea también (Colombia entra en la carrera global por la inteligencia artificial: estos son sus avances y desafíos)
El modelo fue desarrollado por Google DeepMind y comenzó su despliegue de manera restringida entre usuarios y organizaciones seleccionados.
Una de las primeras áreas elegidas para probar sus capacidades fue la ciberseguridad, mediante Fairwind, el programa de Google que facilita herramientas avanzadas de defensa digital a especialistas y organizaciones de confianza.
La principal ventaja de Gemini 4 Argon estuvo en su capacidad para mantener el razonamiento, el contexto y la ejecución a lo largo de trabajos extensos de múltiples etapas.
Esto significó que el modelo no fue concebido únicamente para recibir una pregunta y producir una respuesta, sino para enfrentarse a una tarea, analizarla, dividirla en pasos, utilizar herramientas, comprobar resultados y continuar trabajando hasta completar procesos considerablemente más largos.
Google amplió, además, la capacidad de salida hasta un millón de tokens, frente a los 64.000 disponibles anteriormente. En términos prácticos, este incremento permitió que Argon desarrollara cadenas de trabajo mucho más extensas sin perder el hilo de la tarea.
La ventaja resultó especialmente importante para proyectos que involucran grandes repositorios de código, investigaciones financieras, expedientes jurídicos, documentos empresariales, estudios científicos o análisis de sistemas informáticos.
Otra de sus fortalezas estuvo precisamente en el trabajo con grandes cantidades de información. En lugar de fragmentar un proyecto complejo en numerosas consultas independientes, Argon fue diseñado para conservar y relacionar información durante procesos prolongados.
Esto permitió abordar tareas en las que era necesario revisar cientos o miles de elementos, establecer conexiones entre ellos y utilizar los resultados obtenidos en etapas anteriores para continuar el trabajo.
Google también orientó el modelo hacia lo que la industria denomina IA agéntica. En este esquema, la inteligencia artificial puede desarrollar secuencias de acciones para alcanzar un objetivo. Por ejemplo, ante un problema de programación, el sistema puede revisar código, identificar una falla, plantear una modificación, ejecutar pruebas, comprobar el resultado y continuar corrigiendo errores.
Esa capacidad tuvo una aplicación directa en ingeniería de software. Google informó que utilizó Gemini 4 Argon internamente para trabajos especializados de programación y para migraciones de grandes cantidades de código de C y C++ hacia Rust.
Entre los proyectos mencionados figuraron bibliotecas con decenas de miles de líneas y trabajos relacionados con más de 800.000 líneas de Zircon, el núcleo utilizado por el sistema operativo Fuchsia.
La compañía señaló que las modificaciones producidas por la inteligencia artificial fueron sometidas a controles automáticos y revisiones humanas antes de incorporarse a sistemas reales.
Este componente resultó relevante porque una mayor autonomía del modelo no eliminó la necesidad de supervisión en tareas que pueden afectar infraestructura tecnológica.
Argon también fue utilizado para buscar oportunidades de optimización de infraestructura informática. Según Google, agentes basados en el nuevo modelo analizaron datos de telemetría para localizar posibles reducciones en el consumo de memoria de sus centros de datos.
Las modificaciones implementadas permitieron liberar más de 300 TiB, mientras que la compañía estimó un potencial total de optimización de entre 500 TiB y 1 PiB.
Los resultados divulgados por Google mostraron otra de las ventajas que la compañía atribuyó al modelo: su desempeño en trabajo empresarial especializado.
En Vals Index, relacionado con tareas de conocimiento, Gemini 4 Argon obtuvo 68,9 %. En AutomationBench alcanzó 51,3 % y en Vals Finance Agent v2 registró 65,4 %.
En Harvey's Legal Agent Benchmark, una evaluación relacionada con tareas jurídicas, Argon consiguió 19,6 %. En la tabla publicada por Google, GPT-6 Astra registró 5,4 %, Claude Fable 5.1 obtuvo 6,7 % y Claude Opus 5.5 alcanzó 3,8 %.
Los datos correspondieron a las evaluaciones difundidas por la propia Google y no constituyeron una clasificación independiente de los modelos.
La programación fue otro de los apartados en los que Google reportó avances. Gemini 4 Argon obtuvo 77,9 % en DeepSWE v1.1, evaluación destinada a medir tareas prolongadas de ingeniería de software. En Vibe Code Bench alcanzó 91,9 %.
Los resultados, sin embargo, no mostraron superioridad en todas las pruebas. En FrontierSWE v2, Argon obtuvo 55 %, mientras GPT-6 Astra registró 65,5 %. En Terminal-bench 4.0, Gemini alcanzó 57,4 %, frente al 66,4 % reportado para Claude Opus 5.5.
Las diferencias mostraron que el desempeño dependió del tipo de tarea y de las condiciones particulares de cada evaluación.
Una de las ventajas más marcadas apareció en las pruebas de contexto prolongado. En GraphWalks, Gemini 4 Argon obtuvo 99,7 % en la evaluación de hasta 128.000 tokens.
En el segmento de entre 256.000 y un millón de tokens consiguió 84,2 %, frente al 71,8 % de GPT-6 Astra, 65 % de Claude Fable 5.1 y 66,8 % de Claude Opus 5.5, según las cifras divulgadas por Google.
Esa característica tuvo implicaciones prácticas para empresas y profesionales. Un abogado podría utilizar un sistema de estas características para relacionar información contenida en numerosos documentos de un expediente; un analista financiero podría procesar estados financieros, reportes y bases de datos dentro de una misma investigación; y un equipo de ingeniería podría trabajar sobre repositorios extensos manteniendo las relaciones entre diferentes componentes del software.
El modelo también presentó avances en comprensión multimodal, es decir, en la posibilidad de interpretar y relacionar diferentes clases de información. En Chartography consiguió 71,6 % y en LVBench alcanzó 91,7 %, de acuerdo con las evaluaciones publicadas por Google.
En ciencia y matemáticas, Argon registró 88,8 % en LABBench 2 y 76 % en RiemannBench. En Terminal-Bench Science 0.1, sin embargo, obtuvo 57,6 %, por debajo del 68,1 % registrado para GPT-6 Astra y del 63,3 % de Claude Opus 5.5.
Otra diferencia importante estuvo en la capacidad de utilizar computadores y herramientas digitales. Argon obtuvo una tasa de aprobación de 39,5 % en Agent's Last Exam. En OSWorld-2.0 registró 69,2 %, mientras GPT-6 Astra alcanzó 72,6 %.
Este tipo de evaluaciones buscó determinar hasta qué punto un modelo podía desenvolverse en entornos informáticos y completar tareas mediante interfaces y aplicaciones, en lugar de limitarse a generar texto.
La ciberseguridad ocupó un lugar central en el lanzamiento. Google diseñó Argon para identificar vulnerabilidades de software, comprobar fallas y colaborar en la generación de correcciones.
En CWE-bench v1 obtuvo 68 %, resultado igual al reportado para GPT-6 Astra y ligeramente superior al 67 % de Claude Opus 5.5 en la tabla difundida por la compañía.
Esta capacidad explicó que Google optara por un lanzamiento inicial controlado. Un sistema capaz de encontrar vulnerabilidades informáticas con mayor autonomía podía acelerar la defensa de empresas e instituciones, pero las mismas capacidades exigían medidas de seguridad para impedir usos indebidos.
Google informó que algunos participantes de Fairwind comenzaron a utilizar Argon junto con CodeMender, un agente especializado en reparación de código. El objetivo fue combinar la detección de vulnerabilidades con procesos destinados a comprobarlas y corregirlas.
La empresa también informó que Wiz utilizó Argon dentro de su iniciativa Scan for Good. Durante una de las pruebas iniciales, según Google, el modelo encontró una vulnerabilidad crítica que exponía información personal en un software sanitario utilizado por hospitales y que no había sido identificada por modelos de frontera anteriores.
La ventaja de Argon en este campo, por tanto, no se limitó a reconocer patrones asociados con una posible falla. La apuesta consistió en avanzar hacia sistemas capaces de investigar una vulnerabilidad, determinar si podía explotarse y participar en la elaboración de una solución, un proceso que tradicionalmente exige numerosas horas de trabajo especializado.
Google mantuvo por esa razón controles sobre la disponibilidad del modelo y reforzó los entornos aislados utilizados para probar sus capacidades. La compañía señaló que recopilaría información de los especialistas que trabajaran inicialmente con Argon antes de ampliar el acceso.
El modelo también presentó una estrategia de precios dirigida a facilitar su utilización en procesos de gran escala. Google anunció inicialmente tarifas de USD 2 por cada millón de tokens de entrada y USD 10 por cada millón de tokens de salida. Para los tokens de entrada almacenados en caché estableció un descuento del 95 %.
Tras el periodo introductorio, la compañía previó tarifas de USD 4 por millón de tokens de entrada y USD 20 por millón de salida.
En conjunto, las principales ventajas presentadas por Google se concentraron en cinco capacidades: trabajar durante periodos más prolongados, manejar contextos de gran tamaño, ejecutar procesos de múltiples pasos con mayor autonomía, desarrollar tareas especializadas de programación y conocimiento empresarial, y aplicar esas capacidades a la búsqueda y corrección de vulnerabilidades de ciberseguridad.
Otras noticias
Etiquetas