SambaNova presentó en Hot Chips 2026 su acelerador SN50, la quinta generación de su unidad de flujo de datos reconfigurable. El chip duplica el SRAM del SN40 y quintuplica los FLOPS, escalando hasta 256 nodos. Sin embargo, mantiene HBM2e, una memoria en declive. Para el profesional, la inferencia de modelos como DeepSeek V3 se optimiza en decodificación, superando las limitaciones de ancho de banda típicas de las GPU.
Arquitectura de flujo de datos: el truco para esquivar el cuello de botella 🚀
El SN50 no compite por más ancho de banda bruto, sino por eficiencia en el flujo de datos. Al quintuplicar los FLOPS y duplicar el SRAM on-chip, logra mantener los pesos del modelo cerca del cálculo, reduciendo la dependencia de la memoria externa. En decodificación, la fase crítica de la IA generativa, esto permite tasas de tokens por segundo muy superiores a una GPU con especificaciones similares. La escalabilidad a 256 nodos sugiere un sistema pensado para clústeres dedicados, no para entornos heterogéneos.
HBM2e: como llevar un disquete a una carrera de Fórmula 1 ⚠️
La decisión de mantener HBM2e provoca curiosidad. Es como comprar un motor de F1 y montarle ruedas de bicicleta: funciona, pero el potencial se queda en el taller. Mientras NVIDIA y AMD migran a HBM3e y HBM4, SambaNova apuesta por una memoria que los fabricantes ya no priorizan. Quizás el SN50 sea una obra maestra de ingeniería, pero su longevidad dependerá de si alguien sigue fabricando el repuesto. La eficiencia en IA generativa tiene fecha de caducidad, y esta memoria es el ticket.