Google lanza la vista previa de AlloyDB HNSW, aumentando el rendimiento de búsqueda en 4 veces
2026-07-22 14:51
Favoritos

es.wedoany.com Noticia: Google ha lanzado en versión preliminar la función HNSW acelerada por el motor columnar para AlloyDB, afirmando que puede aumentar hasta cuatro veces el rendimiento de las búsquedas vectoriales.

Google lanza la vista previa de HNSW para mejorar el rendimiento de búsqueda vectorial de AlloyDB

AlloyDB es un servicio de base de datos alojado por Google y compatible con PostgreSQL. Esta nueva opción está dirigida a los usuarios de pgvector, una extensión de PostgreSQL para almacenar, indexar y consultar vectores de incrustación en aplicaciones de inteligencia artificial, especialmente útil para equipos que utilizan HNSW (Hierarchical Navigable Small World, grafo de mundo pequeño navegable jerárquico) para ejecutar búsquedas aproximadas del vecino más cercano en conjuntos de datos muy grandes.

La nueva opción aprovecha el motor columnar de AlloyDB, una caché en memoria que almacena datos consultados con frecuencia en formato columnar, para mantener los índices HNSW en memoria, evitando así parte de la sobrecarga de la gestión estándar del búfer de PostgreSQL. Google afirma que esto mejora el rendimiento y la tasa de recuperación (una métrica que mide la cantidad de coincidencias relevantes en los resultados de búsqueda). En pruebas comparativas realizadas con el conjunto de datos GloVe 100 Angular, que contiene más de 1 millón de registros, cuando la búsqueda se limitó a 100 y la tasa de recuperación objetivo fue de 0,95, las consultas por segundo aumentaron aproximadamente entre 4,2 y 4,9 veces. Con el mismo nivel de rendimiento, la tasa de recuperación también mejoró: a aproximadamente 350 consultas por segundo, al activar la configuración del motor columnar, la tasa de recuperación pasó de aproximadamente 0,78 a más de 0,94, un aumento de 0,163.

En cuanto al funcionamiento, PostgreSQL estándar depende de la caché de búfer compartida para las operaciones de indexación, incluso cuando los datos ya están en memoria. Este proceso aún implica fijar y desfijar páginas, gestionar bloqueos, buscar en la tabla de búfer y administrar el uso menos reciente, lo que puede aumentar la latencia y reducir la eficiencia durante el recorrido del grafo. AlloyDB cambia esta ruta al fijar directamente el índice pgvector HNSW en el espacio de memoria del motor columnar, adoptando un diseño de memoria específico para el patrón de recorrido intensivo de punteros que requiere HNSW, evitando así los cuellos de botella comunes del gestor de búfer. Google señala que esta mejora no se debe simplemente a mover datos del disco a la RAM; la comparación de referencia ya asumía que los índices estándar de PostgreSQL estaban completamente almacenados en caché en el búfer compartido, lo que significa que las ganancias de rendimiento reportadas provienen de una arquitectura de memoria diferente, no de un almacenamiento en caché básico.

Este lanzamiento refleja la creciente presión sobre los proveedores de bases de datos para admitir la generación aumentada por recuperación y otras cargas de trabajo de inteligencia artificial que dependen de la búsqueda vectorial. En estos sistemas, los operadores suelen necesitar equilibrar velocidad y precisión al buscar entre millones o miles de millones de vectores, especialmente bajo tráfico de producción. Para los usuarios de PostgreSQL, pgvector se ha convertido en una de las herramientas más utilizadas en este ámbito, ya que permite que las funciones vectoriales funcionen dentro de la pila de bases de datos relacionales existente. HNSW es un método de indexación popular en pgvector porque ofrece búsquedas aproximadas con menor latencia que los métodos exactos de k vecinos más cercanos, aunque los operadores suelen hacer algunas concesiones en la tasa de recuperación.

Google posiciona AlloyDB como una base de datos capaz de manejar transacciones relacionales, análisis y búsqueda vectorial en un mismo sistema. Además de HNSW, el servicio también admite ScaNN (otra opción de indexación vectorial), mientras que la búsqueda estándar de k vecinos más cercanos sigue disponible para los usuarios que necesitan una tasa de recuperación completa.

En cuanto a las concesiones operativas, el motor columnar utiliza memoria, lo que sigue siendo una consideración práctica para los operadores de bases de datos que gestionan costos y tamaños de instancias. Google afirma que, dado que el motor almacena datos vectoriales en formato columnar comprimido, el consumo de memoria es limitado. Google considera que esta concesión permite lograr un rendimiento de búsqueda vectorial determinado utilizando menos recursos informáticos, reduciendo así las necesidades de infraestructura. Esta función no requiere cambios en el código de la aplicación, ya que los usuarios pueden seguir utilizando la sintaxis SQL estándar de pgvector. Para usar la función, los usuarios de AlloyDB deben habilitar el motor columnar y el indicador de caché de índices en su instancia; después de crear un índice HNSW a través de pgvector, deben agregar ese índice a la caché del motor columnar mediante un comando SQL.

Este lanzamiento ofrece a Google otra forma de diferenciar AlloyDB en el creciente mercado de bases de datos adaptadas a cargas de trabajo de inteligencia artificial, donde los proveedores de nube y los equipos de bases de datos especializados compiten en rendimiento, latencia y calidad de búsqueda. Las pruebas comparativas citadas por Google se ejecutaron en una máquina AlloyDB C4A con 16 CPU virtuales.

Este boletín es una compilación y reproducción de información de Internet global y socios estratégicos, y está destinado únicamente a proporcionar a los lectores la comunicación. Si hay infracción u otros problemas, por favor infórmenos a tiempo, este sitio será modificado o eliminado. Toda reproducción de este artículo sin autorización formal está estrictamente prohibida. Correo electrónico: news@wedoany.com