
Fireworks lanza Ember-1 en AI Gateway de Vercel: un modelo de razonamiento que genera un 40% menos de tokens que Kimi K3 sin perder calidad, ideal para agentes de código.
Desde ayer, 27 de septiembre de 2026, Ember-1, el nuevo modelo de razonamiento de Fireworks, está disponible en el AI Gateway de Vercel. Es una vista previa de investigación, así que conviene leerlo con ese matiz: no es un producto final, pero ya es funcional y accesible.
Qué es Ember-1 y de dónde viene
Ember-1 se construye sobre Kimi K3, un modelo de razonamiento de referencia. Lo que aporta Fireworks es eficiencia: según sus propias evaluaciones, Ember-1 genera aproximadamente un 40% menos de tokens que Kimi K3 con una calidad comparable.
Para un uso puntual eso puede parecer un detalle menor. Pero cambia bastante cuando hablamos de agentes que realizan decenas o cientos de llamadas encadenadas al modelo.
Por qué importa en flujos de trabajo con agentes
Los agentes de código no hacen una sola consulta: razonan, planifican, ejecutan pasos, comprueban resultados y vuelven a consultar. Cada llamada arrastra el contexto acumulado de las anteriores.
Si los trazos de razonamiento son más cortos, ocurren dos cosas concretas:
- El coste por llamada baja, porque se generan menos tokens de salida.
- El contexto que se pasa al siguiente paso es más ligero, lo que reduce la probabilidad de que el agente se pierda en su propio historial.
No es magia: es eficiencia de diseño aplicada a un caso de uso muy específico.
Capacidades técnicas del modelo
Ember-1 llega con un conjunto de características que lo hacen versátil dentro de su especialidad:
- Ventana de contexto de 1 millón de tokens, suficiente para proyectos de código de tamaño considerable.
- Acepta texto e imagen como entrada.
- Soporte nativo de llamadas a herramientas (tool calling), imprescindible para agentes que interactúan con APIs o sistemas externos.
- Caché implícita de instrucciones, que puede reducir costes en llamadas repetitivas con el mismo contexto inicial.
Además, el punto de acceso de Fireworks garantiza retención cero de datos y sin entrenamiento sobre los mensajes enviados. Dos condiciones que en entornos profesionales deberían ser el mínimo exigible, no un diferencial.
Cómo se integra en AI Gateway de Vercel
AI Gateway actúa como capa unificada para llamar a distintos modelos de lenguaje desde un único punto de acceso. Gestiona el seguimiento de uso y costes, permite establecer presupuestos por clave de API y aplica reglas de enrutamiento.
Para usar Ember-1, el identificador del modelo es fireworks/ember-1 en cualquier llamada a la API o configuración de agente.
Si trabajas con un agente de código compatible, Vercel ofrece un comando de configuración a través de su CLI que automatiza el proceso: detecta los agentes instalados, gestiona o reutiliza una clave de API del Gateway y configura la conexión. Después solo hay que seleccionar fireworks/ember-1 en la configuración del modelo dentro del agente.
Ventana de acceso limitada: dos semanas
Este lanzamiento tiene una restricción importante: la vista previa de investigación tiene una ventana inicial de dos semanas. Fireworks no ha detallado qué ocurre después, si el acceso se amplía, cambia de condiciones o se convierte en disponibilidad general.
Si tienes flujos de trabajo con agentes de código y quieres evaluar si la reducción de tokens se traduce en un ahorro real en tu caso concreto, este es el momento de probarlo. También está disponible en el playground de modelos de Vercel para hacer pruebas sin necesidad de integración.
Nuestra lectura
Hemos visto muchos lanzamientos de modelos que prometen eficiencia sin demostrarla. En este caso, el dato del 40% menos de tokens viene de las evaluaciones internas de Fireworks, no de un tercero independiente, así que hay que tomarlo como referencia orientativa.
Lo que sí nos parece relevante es la dirección: optimizar modelos de razonamiento específicamente para flujos de agentes encadenados es un problema real y poco atendido. La mayoría de los esfuerzos en el sector se concentran en capacidades brutas; la eficiencia en contextos largos y repetitivos es terreno más árido y más útil en producción.
Si gestionas proyectos donde el coste de inferencia empieza a ser una variable seria, merece la pena hacer la prueba con datos propios antes de que cierre la ventana de acceso.
Fuente original
Vercel News: Ember-1 from Fireworks now available on AI Gateway
Del blog al tablero
La IA ya puede estar trabajando en tu negocio.
Integramos módulos de inteligencia artificial en el día a día de empresas reales: atención, contenido, automatización. Primero los probamos en casa.
Sigue leyendo
Artículos relacionados.

El VY150: el robot submarino chino que trabaja a 4.500 metros de profundidad
China envió el VY150, un robot de trabajo submarino con más de 10.000 componentes nacionales, a una expedición real en el Mar del Sur. Qué significa esto.

La IA ya puede hacer semanas de trabajo humano: ¿por qué no la usamos así?
Los modelos de lenguaje actuales superan con creces lo que la mayoría de equipos les pide. El problema no es la tecnología: somos nosotros.

Cómo Anthropic construye salvaguardas de IA con sus clientes empresariales
Anthropic trabaja junto a sus clientes corporativos para definir límites de seguridad en modelos de lenguaje avanzados. Qué implica ese enfoque colaborativo y por qué importa.
Publicado el