es.wedoany.com Noticia: La empresa estadounidense de infraestructura de IA Tensormesh y AMD (Advanced Micro Devices) anunciaron una colaboración para tratar la memoria externa de los aceleradores como una extensión de la capacidad de la GPU, ayudando a las empresas a servir más modelos de inteligencia artificial con menos GPU.
Esta colaboración, anunciada el 23 de julio de 2026, combina la solución de caché KV de Tensormesh, la gestión LMCache, la tecnología de GPU de AMD y el componente de virtualización AMD Live Context. La nueva arquitectura ya no limita los datos activos de inferencia a la memoria de alto ancho de banda (HBM), sino que permite que el desbordamiento de la caché KV se extienda a una estructura jerárquica que abarca DRAM, SSD y almacenamiento remoto.
La capacidad de memoria se ha convertido en el cuello de botella práctico para la inferencia de modelos de lenguaje grandes. Añadir más GPU proporciona más HBM, pero también aumenta los costos de los aceleradores, el consumo de energía y los requisitos de infraestructura. Crear procesadores con grupos de memoria más grandes desde el lado del hardware puede resolver el mismo cuello de botella, pero agrava la demanda de componentes de memoria ya limitados. Tensormesh y AMD propusieron un enfoque alternativo: ¿qué pasaría si las empresas pudieran aprovechar mejor la memoria ya existente en cada nodo?
Los datos de la caché KV se convierten en el objetivo. Durante la inferencia, los modelos Transformer almacenan datos de atención intermedios para evitar recalcular el contexto completo de la conversación o el documento para cada token generado. Cuando las indicaciones son largas, la concurrencia aumenta o varios modelos comparten un clúster de inferencia, la caché puede volverse muy grande. El artículo de investigación de vLLM impulsó a la industria a prestar atención a una asignación más eficiente de la caché KV mediante PagedAttention, revelando el impacto de la gestión de la memoria en el rendimiento de la inferencia.
LMCache extiende este concepto a múltiples niveles de memoria. Según Tensormesh, los bloques de caché movidos fuera de la HBM para virtualización a corto plazo pueden reutilizarse posteriormente para la coincidencia de caché KV de prefijo o no prefijo. Mover datos a almacenamiento más lento aumenta la capacidad, pero evitar el recálculo es clave para que la arquitectura pueda recuperar el rendimiento.
Las pruebas utilizaron servidores Dell equipados con 8 GPU aceleradoras AMD/ATI (MI355) y almacenamiento Dell. En un conjunto de documentos de 300 GB ejecutando Kimi-K2.6, Tensormesh y AMD informaron que la latencia del primer token se redujo de 3,4 segundos a menos de 0,5 segundos, una mejora de casi 7 veces. Este resultado proviene de recuperar datos KV en caché desde DRAM y NFS, en lugar de recalcularlos. A medida que aumentaba la escala de la carga de trabajo, el rendimiento de salida se mantuvo en aproximadamente 48 tokens por segundo; en comparación, el rendimiento de inferencia no optimizado disminuyó casi un 40% bajo la misma carga. Según los resultados informados, la densidad de modelos en el mismo hardware también se duplicó.
Los resultados relevantes fueron publicados por los proveedores, no por pruebas de referencia independientes y extensas. Los equipos empresariales deben replicarlos utilizando sus propios modelos, longitudes de indicaciones y perfiles de concurrencia. MLCommons proporciona el contexto de necesidad para pruebas de inferencia estandarizadas: el rendimiento puede variar significativamente según el modelo, los objetivos de latencia, la configuración del servidor y el enfoque de la carga de trabajo.
Duplicar la densidad de modelos no solo significa alojar más modelos en un bastidor, sino que también puede afectar la economía de los asistentes internos, la generación aumentada por recuperación y los sistemas de análisis de documentos al distribuir los costos de los aceleradores entre más cargas de trabajo. Esta ventaja potencial es particularmente importante para las empresas que manejan grandes colecciones de documentos, ya que el contexto repetido crea oportunidades para la reutilización de la caché.
Este enfoque implica compensaciones. La DRAM es más lenta que la HBM, mientras que el SSD y el almacenamiento remoto introducen latencia adicional y riesgo de contención de red. Una jerarquía efectiva depende de identificar qué datos de caché deben permanecer cerca de la GPU y cuáles pueden moverse sin afectar los objetivos de nivel de servicio; la tasa de aciertos de caché, el ancho de banda de almacenamiento y el comportamiento de orquestación pueden ser tan importantes como la capacidad nominal.
Es poco probable que la presión más amplia se alivie rápidamente. El Instituto de IA Centrada en el Humano de Stanford (Stanford HAI) ha documentado las crecientes demandas computacionales asociadas con los sistemas avanzados de IA, respaldando aún más la importancia de mejorar la utilización mientras se despliega hardware adicional.
Antes de esta colaboración, AMD Ventures participó en la ronda de financiación de 20 millones de dólares que Tensormesh completó en mayo de 2026. Tensormesh y AMD presentaron los resultados de rendimiento esta semana en AMD Advancing AI 2026, y se espera que el código abierto de LMCache se publique públicamente en aproximadamente un mes. Esta publicación podría ampliar el alcance de los experimentos con la gestión de caché KV en múltiples niveles y brindar a los equipos de infraestructura una comprensión más clara del rendimiento de este enfoque más allá del entorno de prueba inicial de Dell.










