es.wedoany.com Noticia: El 12 de agosto, la empresa estadounidense de inteligencia artificial SpaceXAI lanzó su nuevo modelo insignia Grok 4.6, con un enfoque en mejorar las capacidades de agentes de largo plazo, desarrollo de software, trabajo de conocimiento y construcción de aplicaciones interactivas. El modelo ya está disponible a través de Grok Build, Cursor y la API de SpaceXAI, e integrado en plataformas colaborativas como OpenRouter, Vercel y Cloudflare.

Grok 4.6 admite entrada de texto e imágenes y salida de texto, con una ventana de contexto de 500 000 tokens. Puede invocar funciones, búsqueda web, búsqueda en la plataforma X y herramientas de ejecución de código, y admite salida estructurada. Los desarrolladores pueden llamar al modelo a través de las interfaces Responses API y Chat Completions, con niveles de razonamiento configurables en bajo, medio, alto y ultra alto, adoptando por defecto el modo de razonamiento alto.
SpaceXAI indicó que Grok 4.6 está orientado principalmente a tareas complejas que requieren la ejecución continua de múltiples pasos, incluyendo investigación entre fuentes, análisis de información, procesamiento de grandes bases de código, desarrollo de prototipos de software y generación de resultados de trabajo. En comparación con Grok 4.5, el nuevo modelo realiza más autoevaluaciones y verificaciones de resultados en tareas largas, y refuerza la capacidad de generación desde la concepción de un producto hasta la versión inicial de una aplicación interactiva.
En cuanto al entrenamiento, Grok 4.6 adoptó un proceso de entrenamiento complementario más extenso que la generación anterior, con datos que incluyen datos generados por el modelo para razonamiento y conceptos técnicos avanzados, así como datos de ingeniería. SpaceXAI utilizó posteriormente Grok 4.5 para regenerar trayectorias de ajuste fino supervisado que cubren diferentes intensidades de razonamiento, marcos de agentes, ciencia, ingeniería, matemáticas y desarrollo de software, y filtró registros de entrenamiento problemáticos mediante revisiones de modelos. El modelo también recibió entrenamiento de aprendizaje por refuerzo en tareas de agentes como trabajo de conocimiento, programación general, optimización de kernels, desarrollo web y diseño asistido por computadora.
Según los datos publicados por SpaceXAI, Grok 4.6 obtuvo 61 puntos en la prueba integral Artificial Analysis Intelligence Index, 5 puntos más que los 56 de Grok 4.5, empatando con GPT-5.6 Sol y quedando 1 punto por debajo de Claude Fable 5. Este índice combina nueve pruebas en áreas como ciencia, programación y servicios financieros, pero los resultados reflejan principalmente el rendimiento del modelo en condiciones específicas y no pueden equipararse directamente con las capacidades en todos los escenarios empresariales reales.
En las pruebas de agentes y desarrollo de software, Grok 4.6 obtuvo un 69,9 % en CursorBench 3.2, un 65,9 % en DeepSWE 1.1 y un 61,3 % en la prueba extendida FrontierCode 1.1. Su puntuación en APEX-Agents fue del 57,5 %, superior al 47,1 % de Grok 4.5; en la prueba AA-Briefcase, que evalúa capacidades de trabajo de conocimiento complejo, obtuvo 1577 puntos, también por encima de los 1313 de la generación anterior.
El precio base de la API estándar de Grok 4.6 es de 2 USD por millón de tokens de entrada, 0,5 USD por millón de tokens de entrada en caché y 6 USD por millón de tokens de salida. Cuando el contexto de entrada supera los 200 000 tokens, la empresa aplica una tarifa más alta; SpaceXAI también ofrece una versión más rápida con un precio aproximado del doble de la estándar. Grok Build y Cursor ofrecen el doble de cuota de uso durante la primera semana del lanzamiento del modelo.
SpaceXAI afirmó que el nuevo modelo ha completado las pruebas de capacidad y seguridad previas al despliegue más amplias realizadas hasta la fecha por la empresa, y continuará llevando a cabo pruebas posteriores al despliegue y pruebas de terceros. No obstante, la mayoría de los datos de rendimiento publicados oficialmente provienen de pruebas internas de la empresa o citan resultados públicos de otros desarrolladores de modelos, por lo que aún requieren una verificación adicional mediante evaluaciones independientes y despliegues empresariales reales.





















