OpenAI und Broadcom stellen LLM-optimierten Inferenzchip vor
- Erste Tests zeigen, dass der Beschleuniger der ersten Generation eine deutlich bessere Leistung pro Watt liefert als der aktuelle Stand der Technik
- Von Grund auf für aktuelle und künftige LLMs in der gesamten Branche entwickelt
- In neun Monaten vom Design bis zur Produktion entwickelt, beschleunigt durch OpenAIs Modelle
- Erweitert OpenAIs Full-Stack-Plattform: von Produkten über Modelle bis hin zu Chips
- Wird gemeinsam mit Rechenzentrumspartnern über mehrere Generationen im Gigawatt-Maßstab bereitgestellt
OpenAI und Broadcom (NASDAQ: AVGO) haben heute Jalapeño vorgestellt, OpenAIs ersten Intelligence Processor: einen Beschleuniger, der auf OpenAIs Vision für die Zukunft der LLM-Inferenz ausgerichtet ist. Er ist der erste KI-Beschleuniger einer mehrgenerationigen Compute-Plattform, die beide Unternehmen gemeinsam entwickeln, um fortgeschrittene KI schneller, zuverlässiger und für mehr Menschen zugänglicher zu machen.

Jalapeño wurde OpenAI CEO Sam Altman und President Greg Brockman von Broadcom President und CEO Hock Tan sowie President Charlie Kawwas übergeben. Das markiert einen wichtigen Schritt in OpenAIs Strategie, den gesamten Stack hinter seinen Modellen und Produkten zu entwickeln.
OpenAI hat den Chip gemeinsam mit den Partnern Broadcom und Celestica von Grund auf entwickelt, gestützt auf ein tiefes Verständnis der LLM-Grundlagen und auf die eigene Roadmap für Modelle, Kernels, Serving-Systeme und Produktanforderungen. Die Partner bringen die Plattform durch Chipimplementierung, Leiterplatten, Rack-Systemintegration, Hochleistungsnetzwerke und skalierbare Produktionssysteme zur industriellen Reife. Jalapeño ist flexibel ausgelegt und funktioniert mit allen LLMs. Grundlage sind OpenAIs Erkenntnisse zu den Inferenzanforderungen aktueller und künftiger KI-Modelle in der gesamten Branche. Vorserienmuster des Jalapeño-Chips führen im Labor ML-Workloads mit der angestrebten Produktionsfrequenz und Leistungsaufnahme aus, darunter GPT‑5.3‑Codex‑Spark.
OpenAI misst die endgültige Leistung noch. Erste Tests zeigen jedoch, dass Jalapeño eine deutlich bessere Leistung pro Watt liefern wird als der aktuelle Stand der Technik. Ein ausführlicher technischer Bericht zur Leistung wird in den kommenden Monaten vorgestellt. Die Architektur reduziert Datenbewegungen und balanciert Rechen-, Speicher- und Netzwerkressourcen aus, damit die tatsächliche Auslastung deutlich näher an die theoretische Spitzenleistung heranreicht. Broadcoms Chipimplementierung und Netzwerktechnologien, einschließlich Tomahawk-Netzwerkchips, tragen dazu bei, die Plattform in die Großserienproduktion zu bringen.
„Die Welt bewegt sich hin zu einer Wirtschaft, die von Rechenleistung getragen wird“, sagte Greg Brockman, Präsident und Mitgründer von OpenAI. „Jalapeño ist Teil unserer langfristigen Full-Stack-Infrastrukturstrategie, mit der wir Rechenleistung breiter verfügbar machen wollen. So entsteht KI, die für Menschen und Unternehmen schneller, zuverlässiger und erschwinglicher ist und zur Lösung wichtigerer Probleme eingesetzt werden kann. Indem wir größere Teile des Stacks selbst entwickeln, können wir mehr KI-Leistung effizienter bereitstellen und fortgeschrittene KI für mehr Menschen zugänglich machen.“
„Jalapeño wurde von Grund auf für LLM-Inferenz entwickelt, auf Basis detaillierter Erkenntnisse aus unserer engen Zusammenarbeit mit den Forschungsteams von OpenAI“, sagte Richard Ho, der OpenAIs Hardwareprogramm leitet. „Wir haben die Architektur auf die Kernels, Speicherbewegungen, Netzwerke und Serving-Muster optimiert, die für führende KI-Modelle am wichtigsten sind. Nach ersten Tests wird Jalapeño unsere wichtigsten Workloads effizient ausführen und dabei nahe an die theoretischen Grenzen der Hardware herankommen.“
„Unsere Zusammenarbeit mit OpenAI steht für ein grundlegendes Bekenntnis, die physische Infrastruktur zu skalieren, die für das nächste Jahrzehnt der KI erforderlich ist“, sagte Hock Tan, President und CEO, Broadcom. „Das ist erst der Anfang einer Roadmap über mehrere Generationen. Indem wir unsere branchenführenden Chips direkt mit OpenAI gemeinsam entwickeln, ermöglichen wir ab 2026 den Aufbau von Rechenzentren im Gigawatt-Maßstab mit Microsoft und weiteren Partnern.“
Jalapeño ist eine Neuentwicklung ohne Altlasten für moderne LLM-Inferenz, kein Allzweckbeschleuniger, der aus früheren KI-Workloads angepasst wurde. Die Entwicklung orientiert sich an den Systemen, die OpenAI täglich für ChatGPT, Codex, die API und künftige agentenbasierte Produkte betreibt. Gleichzeitig ist Jalapeño für aktuelle und künftige LLMs in der gesamten Branche ausgelegt. Ziel ist es, die Leistungsfähigkeit und den Durchsatz führender KI-Beschleuniger von heute mit Latenzen zu verbinden, die näher an den schnellsten spezialisierten Inferenzsystemen liegen. Damit eignet sich Jalapeño besonders für interaktive LLM-Produkte im großen Maßstab.
Das ist der Full-Stack-Vorteil. OpenAI entwickelt nicht nur Frontier-Modelle oder Produkte auf ihrer Basis, sondern auch die darunterliegende Infrastruktur: Chiparchitektur, Kernels, Speichersysteme, Netzwerke, Scheduling, Bereitstellungssysteme und Produkterlebnis. Weil OpenAI über den gesamten Stack hinweg arbeitet, kann jede Ebene auf dasselbe Ziel hin optimiert werden: die eigenen Modelle für Nutzer:innen schneller, zuverlässiger und erschwinglicher zu machen.
Jalapeño verstärkt den Kreislauf, der OpenAIs Fortschritt antreibt. Bessere Infrastruktur steigert die Recheneffizienz. Höhere Recheneffizienz ermöglicht besseres Training und Serving und treibt so letztlich leistungsfähigere KI-Modelle an. Bessere Modelle werden zu besseren Produkten für Menschen, Entwickler:innen sowie Unternehmen. Bessere Produkte führen zu mehr Nutzung, mehr Kundschaft und mehr Umsatz. Dadurch kann OpenAI in die nächste Infrastrukturgeneration reinvestieren. Mit der Zeit trägt dieser Kreislauf dazu bei, Intelligenz leistungsfähiger, zuverlässiger und für alle günstiger zu machen.
Jalapeño wurde vom ersten Entwurf bis zum Fertigungs-Tape-out in nur neun Monaten gemeinsam entwickelt. Das Programm für maßgeschneiderte KI-Beschleuniger stellt aus unserer Sicht den schnellsten ASIC-Entwicklungszyklus dar, der je bei modernen Hochleistungshalbleitern erreicht wurde. Dieses Tempo beruht auf enger Software-Hardware-Co-Entwicklung mit OpenAIs Engineering-Teams, Broadcoms Expertise in der Chipimplementierung und dem Einsatz von OpenAI-Modellen, die Teile des Design- und Optimierungsprozesses beschleunigen.
Dieselben Modelle, die Nutzer:innen bereitgestellt werden, helfen dabei, die Infrastruktur für künftige Modelle zu verbessern. Wenn KI Ingenieurteams dabei helfen kann, bessere Chips schneller zu entwickeln, kann sie die Kosten für Rechenleistung in der gesamten Branche senken und den Zugang zu fortgeschrittener KI für mehr Menschen öffnen.
Jalapeño ist der erste Schritt einer Compute-Plattform über mehrere Generationen. Sie ist für eine erste Bereitstellung bis Ende 2026 ausgelegt und soll in den folgenden Jahren weiter ausgebaut werden. Dafür verbindet sie von OpenAI entwickelte Beschleuniger mit Broadcoms Chipimplementierung, Netzwerk- und Konnektivitätstechnologien sowie Celesticas Expertise bei Leiterplatten, Racks und Systemen.
Der Kern dieser Arbeit ist einfach: Über Inferenz erreicht KI die Menschen. Jede Verbesserung bei Kosten, Geschwindigkeit und Zuverlässigkeit kann sich in schnelleren Antworten von ChatGPT niederschlagen, in Codex-Aufgaben, die mit weniger Wartezeit mehr Schritte ausführen können, in API-Produkten, die sich günstiger entwickeln lassen, oder in zuverlässigerem Zugriff bei hoher Nachfrage.
KI zu demokratisieren bedeutet, fortgeschrittene Modelle so verfügbar, zuverlässig und erschwinglich zu machen, dass mehr Menschen sie jeden Tag nutzen können. Jalapeño hilft OpenAI, einen größeren Teil seiner Infrastruktur in nützliche Intelligenz für Studierende, Entwickler:innen, kleine Unternehmen, Forschende, Großunternehmen und alle anderen umzuwandeln, die lernen, kreativ arbeiten oder schwierige Probleme lösen wollen.


