Seguinos

Actualidad

SpaceXAI lanzó Grok 4.6 y afirma que iguala a GPT-5.6 Sol

La compañía presentó una nueva versión de Grok enfocada en agentes capaces de sostener tareas complejas durante más tiempo, programación y trabajos de conocimiento. El modelo ya está disponible en distintas plataformas y obtuvo 61 puntos en un índice que lo coloca a la altura de GPT-5.6 Sol, según las pruebas difundidas por la empresa.

Publicado

el

SpaceXAI lanzó este miércoles 12 de agosto Grok 4.6, una nueva versión de su modelo de inteligencia artificialorientada a tareas de programación, investigación y agentes que deben trabajar durante múltiples pasos. La actualización ya comenzó a desplegarse en Cursor, Grok Build, Grok Bot y la API de xAI, en una nueva apuesta por competir en el segmento de los modelos más avanzados del mercado.

La compañía aseguró que Grok 4.6 mejora a su antecesor, Grok 4.5, especialmente cuando debe mantener el contexto y completar trabajos extensos. Entre los usos destacados aparecen la investigación de temas, el análisis de información, el trabajo sobre grandes bases de código y la creación de aplicaciones o proyectos interactivos a partir de instrucciones generales.

Cómo rindió Grok 4.6 frente a GPT-5.6 Sol

Uno de los principales argumentos de SpaceXAI para presentar el nuevo modelo está en los resultados de sus evaluaciones. En el Artificial Analysis Intelligence Index, un indicador compuesto por nueve pruebas, Grok 4.6 obtuvo 61 puntos, la misma puntuación informada para GPT-5.6 Sol en su configuración máxima de razonamiento. Fable 5 Max alcanzó 62 puntos en esa comparación.

La empresa también informó mejoras respecto de Grok 4.5 en distintas pruebas vinculadas con programación y agentes autónomos. Los principales datos difundidos fueron:

  • AA Intelligence Index: Grok 4.6 alcanzó 61 puntos, frente a 56 de Grok 4.5.
  • CursorBench 3.2: obtuvo 69,9%, contra 66,7% de su antecesor.
  • DeepSWE 1.1: llegó a 65,9%, frente al 54% de Grok 4.5.
  • FrontierCode 1.1 Extended: registró 61,3%, contra 56,6%.
  • APEX-Agents: consiguió 57,5%, mientras Grok 4.5 alcanzó 47,1%.

Los resultados fueron publicados por SpaceXAI y, por lo tanto, deben leerse como evaluaciones presentadas por la propia compañía; las cifras de modelos competidores fueron recopiladas de tarjetas técnicas y rankings publicados por sus respectivos desarrolladores.

Qué cambió en el entrenamiento del nuevo modelo

SpaceXAI explicó que Grok 4.6 atravesó una etapa adicional de entrenamiento más prolongada que Grok 4.5. Ese proceso incorporó datos generados por modelos y seleccionados para razonamiento y conceptos técnicos avanzados, además de información de ingeniería y modificaciones en el optimizador y la metodología de entrenamiento.

La compañía también amplió el uso de aprendizaje por refuerzo en tareas vinculadas con programación, trabajo de conocimiento, desarrollo web, optimización de kernels y diseño asistido por computadora. Según sus pruebas internas, el modelo mostró además una mayor tendencia a comprobar y verificar su propio trabajo antes de continuar con los siguientes pasos de una tarea extensa.

Ese punto busca atacar uno de los desafíos centrales de los actuales agentes de inteligencia artificial: no sólo responder correctamente a una instrucción puntual, sino sostener una secuencia de acciones, utilizar herramientas y corregir errores mientras avanza hacia un objetivo más amplio.

Cuánto cuesta y dónde está disponible Grok 4.6

En la API de xAI, Grok 4.6 cuenta con una ventana de contexto de hasta 500.000 tokens, admite texto e imágenes como entrada y genera respuestas de texto. Para solicitudes inferiores a 200.000 tokens, el precio oficial es de US$2 por millón de tokens de entrada, US$0,50 por millón almacenado en caché y US$6 por millón de tokens de salida. Por encima de ese nivel, las tarifas ascienden a US$4, US$1 y US$12, respectivamente.

El modelo permite además seleccionar distintos niveles de esfuerzo de razonamiento —bajo, medio, alto y “xhigh”—. SpaceXAI dispuso durante la primera semana del lanzamiento el doble de uso incluido de Grok 4.6 dentro de Cursor y Grok Build como incentivo para acelerar su adopción.

El lanzamiento profundiza así la competencia entre los grandes desarrolladores de IA generativa, con una estrategia que pone el foco menos en las respuestas aisladas y más en modelos capaces de ejecutar trabajos prolongados. Por ahora, las comparaciones de rendimiento difundidas con GPT-5.6 Sol y otros competidores se apoyan en benchmarks; la prueba decisiva será cómo esas ventajas se trasladan al uso cotidiano de desarrolladores y empresas.