Warum das wichtig ist (Einordnung)
Wenn wir über KI-Hardware sprechen, denken die meisten nur an GPUs (wie Nvidia H100). Das ist nur die halbe Wahrheit. Ein KI-System wie ein Sprachmodell oder ein Agent macht weit mehr als nur Mathe: Es muss Texte in Zahlen zerlegen (Tokenisierung), auf Datenbanken zugreifen (Retrieval), Tools aufrufen, Ergebnisse prüfen und mit anderen Systemen sprechen. All das braucht verschiedene Spezialprozessoren, die gemeinsam arbeiten — wie ein Orchester, in dem jedes Instrument eine eigene Aufgabe hat.
Diese Landschaft wird umso wichtiger, je „agentischer“ KI wird: Wenn ein Agent ständig Tools aufruft und Daten bewegt, zählen CPU-Arbeit, Speicherbandbreite und Netzwerk genauso viel wie die reine Rechenleistung des Beschleunigers.
Die zwei großen Bereiche
Die Infografik teilt die Hardware in zwei Gruppen:
- MODEL + APPLICATION COMPUTE — die eigentlichen „Denker“: CPU, GPU, Custom Silicon, NPU
- THE SUPPORTING DATA PATH — die „Adern und Wege“, die Daten bewegen: DPU/SmartNIC, Memory + Interconnect
Die 6 Schichten im Detail
CPU — Host + Orchestration (der Dirigent)
Arbeit: Tool-Aufrufe (function calls) · Retrieval aus Vektor-DBs · Tokenisierung · Kontrollfluss · Vor-/Nachverarbeitung.
Stärke: flexible Logik, großer Speicher, ausgereiftes Ökosystem.
Grenze: geringer Tensor-Durchsatz (nicht fürs massive Mathe-Rechnen gebaut).
Agentic-Hinweis: Je mehr Tools ein Agent aufruft, desto mehr CPU-Arbeit entsteht.
GPU — General AI Workhorse (der Kraftpaket-Mathematiker)
Arbeit: Training · Fine-Tuning · Batch- und Echtzeit-Inferenz.
Stärke: massiv paralleles Matrix-Rechnen, HBM-Speicher, ausgereifte Software.
Grenze: Kosten, Stromverbrauch, Verfügbarkeit.
Schlüsselvorteil: breiteste Modell- und Framework-Unterstützung (nahezu jedes LLM läuft auf GPUs).
Custom AI Silicon — Purpose-Built at Scale (der Spezialwerkzeug-Bauer)
Beispiele: Google TPU · AWS Trainium / Inferentia · Microsoft Maia · Meta MTIA.
Arbeit: optimiertes Training oder Inferenz auf Flotten-Ebene (very viele Server gleichzeitig).
Stärke: beste Leistung pro Watt und pro Dollar.
Grenze: Abhängigkeit von Plattform und Compiler — nicht „einfach so“ universell einsetzbar.
NPU — On-Device AI (der Sparsame im Gerät)
Beispiele: Apple Neural Engine · AMD XDNA · Intel AI Boost · Snapdragon Hexagon.
Arbeit: lokale Copiloten · Vision (Bilderkennung) · Audio · kleine Modelle direkt auf dem Gerät.
Stärke: geringer Stromverbrauch, Datenschutz, sofortige Antwort (kein Cloud-Roundtrip).
Grenze: Speicher- und Modellgrößen-Beschränkungen — große Modelle passen nicht.
DPU / SmartNIC — Data Movement + Isolation (der Logistik- und Sicherheitsdienst)
Arbeit: Networking · Storage · Security · RDMA (schnelle direkte Speicher-Kommunikation).
Rolle: entlastet die CPUs und versorgt die Beschleuniger mit Daten.
Wichtig: Ersetzt keine GPU oder TPU für die Modell-Mathe.
Memory + Interconnect — The New Bottleneck (die Datenautobahnen)
Enthält: HBM-Speicherstapel · KV-Cache · Chip-zu-Chip-Verbindungen · Ethernet-Fabrics (Netzwerk-Switches).
Rolle: bewegt Gewichte und Aktivierungen zwischen den Beschleunigern.
Wichtig: bestimmt oft den Durchsatz und die Skalierung des gesamten Clusters.
Schnell-Auswahl (Quick Pick)
| Aufgabe | Welche Hardware? |
|---|---|
| Agent-Tools + Retrieval (viele Tool-Aufrufe, Datenzugriff) | CPU |
| Training + breite Inferenz (das große Mathe-Rechnen) | GPU |
| Flotten-optimierte KI im großen Maßstab | Custom Silicon |
| Private, akkueffiziente lokale KI | NPU |
| Cluster-Netzwerk + Sicherheit | DPU / SmartNIC |
Auswahl nach: Latenz · Durchsatz · Speicher · Leistung · Kosten · Ökosystem · Skalierung.
Praxisbezug für andblack
Selbsttest
- Warum reicht eine GPU allein für ein KI-System nicht aus? (Tipp: Tokenisierung, Tool-Aufrufe, Datenfluss …)
- Welche Hardware wählst du für private, akkueffiziente KI auf einem Laptop? (NPU)
- Was macht eine DPU/SmartNIC, und was macht sie nicht? (Netzwerk/Storage/Security — aber keine Modell-Mathe)
- Warum heißt es „Memory + Interconnect = der neue Flaschenhals“? (Bestimmt, wie schnell Daten zwischen Chips fließen → bestimmt Cluster-Durchsatz)