In Breve
- Cosa è Jalapeño?
- Jalapeño è un chip sviluppato da OpenAI per ottimizzare l'inferenza AI.
- Quali sono i vantaggi di Jalapeño?
- Offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai concorrenti.
- Quando sarà disponibile Jalapeño?
- Il primo dispiegamento è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.
Durante la conferenza Hot Chips, OpenAI ha presentato Jalapeño, il suo innovativo chip progettato per migliorare le prestazioni nell’inferenza AI. I primi risultati dei benchmark condotti da InferenceX di Semianalysis rivelano che Jalapeño offre un numero maggiore di token per utente e una throughput per kilowatt superiore rispetto ai processori di inferenza attualmente considerati all’avanguardia.
Il confronto è stato effettuato con un sistema Nvidia Blackwell, ma OpenAI avverte che la competizione potrebbe evolversi prima della piena distribuzione del prodotto. Jalapeño è stato sviluppato in collaborazione con Broadcom, integrando i modelli di OpenAI nel processo di progettazione. L’azienda prevede che questa piattaforma diventi multigenerazionale, coordinando chip, memoria e modelli per ottimizzare le prestazioni.
L’architettura di Jalapeño è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che tradizionalmente rappresentano colli di bottiglia durante l’inferenza. Il comunicato aziendale sottolinea: “Abbiamo progettato Jalapeño per minimizzare il movimento dei dati e i ritardi di comunicazione.” Questo approccio consente di allocare e mantenere localmente lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte, mentre il sistema attiva la combinazione adeguata di calcolo, memoria e rete per ogni fase di inferenza.
Richard Ho, responsabile hardware di OpenAI, ha dichiarato: “I risultati mostrano un avanzamento delle prestazioni molto significativo rispetto allo stato dell’arte. Jalapeño può gestire un numero maggiore di lavori AI per unità di potenza, restituendo anche risposte più rapidamente. È molto efficiente nel servire un gran numero di clienti, mantenendo una bassa latenza.”
OpenAI prevede un primo dispiegamento di Jalapeño in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa attesa per il 2027. Questo nuovo chip potrebbe rappresentare un cambiamento significativo nel panorama dell’inferenza AI, offrendo soluzioni più efficienti e rapide per le esigenze crescenti del settore.
