4.4 Grafikkarte und Grafikschnittstellen
Eine Grafikkarte ist ein spezialisiertes Rechensystem für Bildausgabe, parallele Berechnungen und Medienverarbeitung. Sie besteht nicht nur aus der GPU: Grafikspeicher, Spannungsversorgung, PCIe-Anbindung, Firmware, Display- und Medien-Engines, Kühlung und Anschlüsse arbeiten als Gesamtsystem zusammen.
Aufgaben einer modernen Grafikeinheit
Die GPU erzeugt aus Geometrie-, Textur- und Beleuchtungsdaten fertige Bildpunkte. Ihre vielen parallel arbeitenden Recheneinheiten eignen sich außerdem für Simulationen, Bild- und Videoverarbeitung, wissenschaftliche Berechnungen sowie Verfahren des maschinellen Lernens. Nicht jede Grafikeinheit besitzt dafür dieselben spezialisierten Funktionsblöcke.
Fest verdrahtete Einheiten übernehmen Aufgaben, die sich besonders effizient ausführen lassen: Rasterisierung, Texturfilterung, Video-Decodierung und -Encodierung oder die Ausgabe fertiger Bilder an einen Monitor. Moderne Architekturen können zusätzlich Beschleuniger für Strahlverfolgung oder Matrixoperationen enthalten. Produktnamen und genaue Aufteilung unterscheiden sich zwischen Herstellern und Generationen.
Datenwege und Funktionsblöcke
Programme und Treiber übergeben Befehle über PCI Express. Ein Scheduler verteilt die Arbeit auf Rechen- und Festfunktionseinheiten. Arbeitsdaten liegen überwiegend im lokalen Grafikspeicher; Cache-Speicher vermindern dabei teure Speicherzugriffe. Das fertige Bild wird im Framebuffer abgelegt und von der Display-Engine mit passendem Timing und Signalformat ausgegeben.
Die Grafik zeigt ein herstellerunabhängiges Funktionsmodell. Ein konkreter Chip kann Blöcke zusammenfassen, mehrfach ausführen oder anders benennen.
Bauteile einer dedizierten Grafikkarte
| Bauteil | Aufgabe und Erkennungsmerkmal |
|---|---|
| Leiterplatte (PCB) | Trägt und verbindet sämtliche Bauteile; Länge und Höhe bestimmen einen Teil des Platzbedarfs. |
| GPU-Package | Großes Chipgehäuse unter dem Hauptkühler; enthält Grafik-, Compute- und Festfunktionseinheiten. |
| Grafikspeicher (VRAM) | Mehrere Speicherbausteine nahe der GPU, meist GDDR; speichern Texturen, Geometrie, Framebuffer und Rechendaten. |
| Spannungsversorgung (VRM) | Regler, Leistungsstufen, Spulen und Kondensatoren wandeln die 12-Volt-Versorgung in niedrige, stabile Chipspannungen um. |
| PCIe-Kontaktleiste | Elektrische Verbindung zum Mainboard; überträgt Daten und versorgt die Karte anteilig mit Energie. |
| Zusätzliche Stromanschlüsse | Versorgen leistungsstärkere Karten über separate Leitungen des Netzteils; Bauform und zulässige Belastung müssen zusammenpassen. |
| Firmware-Speicher | Enthält vBIOS beziehungsweise UEFI-GOP-Code für Initialisierung, Leistungsgrenzen und frühe Bildausgabe. |
| Slotblende und Ausgänge | Befestigen die Karte am Gehäuse und führen beispielsweise DisplayPort- oder HDMI-Buchsen nach außen. |
| Kühlsystem | Kühlkörper, Heatpipes oder Vapor-Chamber, Lüfter, Wärmeleitpaste und Wärmeleitpads führen Verlustwärme ab. |
| Abdeckung und Backplate | Schützen und stabilisieren je nach Modell; eine Backplate ist nicht automatisch ein wirksamer Kühlkörper. |
Grafikpipeline und parallele Rechenarbeit
In einer klassischen 3D-Pipeline werden Eckpunkte transformiert, primitive Flächen zusammengesetzt, auf Bildpunkte abgebildet und anschließend schattiert. Texturfilter wie anisotrope Filterung erhöhen die Detailtreue schräg betrachteter Flächen. Antialiasing vermindert sichtbare Treppenkanten. Viele Stufen sind programmierbar und werden durch Shader ausgeführt.
Moderne GPUs verwenden überwiegend vereinheitlichte Recheneinheiten: Dieselben Kerne können je nach Arbeitsauftrag Vertex-, Pixel-, Compute- oder andere Shader ausführen. Die ältere Vorstellung fest getrennter Vertex- und Pixel-Prozessoren beschreibt aktuelle GPUs daher nicht mehr ausreichend. Rasterizer, Textureinheiten, Render-Backends, Caches und Speichercontroller bleiben spezialisierte Funktionsblöcke.
Die Zahl beworbener Shader-Kerne ist nur innerhalb vergleichbarer Architekturen aussagekräftig. Takt, Rechenformat, Auslastung, Speicherbandbreite, Cache, Treiber und Software bestimmen gemeinsam die reale Leistung.
Grafikspeicher: Kapazität ist nicht alles
Dedizierte Grafikkarten verwenden lokalen Speicher, häufig GDDR6, GDDR6X oder GDDR7. Hochleistungsbeschleuniger können HBM einsetzen. VRAM ist normalerweise verlötet und nicht nachrüstbar. Kapazität, Datenrate, Busbreite, Speichercontroller, Kompression und Cache bestimmen zusammen, wie schnell die GPU auf Daten zugreifen kann.
Reicht der lokale Speicher nicht aus, müssen Daten über PCIe aus dem deutlich weiter entfernten Arbeitsspeicher nachgeladen werden. Das kann Wartezeiten, Ruckler oder reduzierte Detailstufen verursachen. Viel VRAM allein macht eine langsame GPU jedoch nicht schnell.
Integrierte Grafikeinheiten teilen sich meist den Arbeitsspeicher mit der CPU. Dieser „Shared Memory“ besitzt keine fest reservierte Größe für alle Situationen und wird vom System dynamisch verwaltet. Aktuelle integrierte GPUs sind für Büroarbeit, Medienwiedergabe und je nach Modell auch anspruchsvollere Grafik geeignet; Leistung und Speicherbandbreite hängen stark von Prozessor, RAM-Konfiguration und Leistungsgrenzen ab.
| Eigenschaft | Bedeutung |
|---|---|
| Kapazität | Wie viele Texturen, Modelle, Framebuffer und Rechendaten gleichzeitig lokal gehalten werden können. |
| Datenrate und Busbreite | Bestimmen zusammen die theoretische Rohbandbreite des Speichers. |
| Cache | Hält häufig benötigte Daten nahe an den Recheneinheiten und senkt externe Speicherzugriffe. |
| Speichertyp | Beschreibt Technologie und Signalisierung; die Bezeichnung allein erlaubt keinen vollständigen Leistungsvergleich. |
Grafik- und Compute-Schnittstellen (APIs)
Eine Programmierschnittstelle beschreibt, wie Software Rendering- oder Rechenaufträge formuliert. Der Treiber setzt diese Befehle für die konkrete Hardware um. Eine API ist damit keine physische Buchse und auch kein einzelner Grafikchip.
| Schnittstelle | Typischer Einsatz |
|---|---|
| Direct3D / DirectX | Grafik und Multimedia vor allem unter Windows und Xbox; Direct3D ist die 3D-Grafik-API innerhalb der DirectX-Familie. |
| Vulkan | Hersteller- und plattformübergreifende Low-Level-Grafik- und Compute-API mit expliziter Ressourcenverwaltung. |
| OpenGL | Plattformübergreifende Grafik-API, weiterhin in Bestands- und Fachanwendungen verbreitet. |
| Metal | Apples Grafik- und Compute-API für die eigenen Plattformen. |
| WebGPU | Moderne Grafik- und Compute-Schnittstelle für Webanwendungen; wird über Browser-APIs angesprochen. |
| CUDA, OpenCL und SYCL | Schnittstellen beziehungsweise Programmiermodelle für allgemeine parallele Berechnungen; keine Monitoranschlüsse. |
Anbindung an das Mainboard: PCI Express
Aktuelle dedizierte Grafikkarten werden über PCI Express angebunden. Eine mechanisch lange x16-Karte kann elektrisch mit weniger Lanes arbeiten; tatsächlich verwendete Generation und Lane-Zahl werden beim Start zwischen den Geräten ausgehandelt. Beide Seiten fallen dabei auf die höchste gemeinsam unterstützte Konfiguration zurück.
GT/s bezeichnet Übertragungen pro Sekunde und darf nicht direkt mit Gbit/s gleichgesetzt werden. Leitungscodierung, FLIT-Modus, Fehlerkorrektur und Protokoll-Overhead beeinflussen die nutzbare Datenrate. Die Werte der Tabelle sind deshalb gerundete theoretische Größen pro Richtung vor zusätzlichem Transaktions-Overhead.
- PCIe 6.0 und 7.0 verwenden PAM4 sowie FLIT-basierte Übertragung mit Vorwärtsfehlerkorrektur.
- PCIe ist abwärtskompatibel, die Verbindung arbeitet aber nur mit der gemeinsam unterstützten Generation und Lane-Zahl.
- Eine doppelte theoretische Linkbandbreite bedeutet nicht automatisch doppelte Bildrate: Viele Grafikdaten verbleiben während der Berechnung im VRAM.
- PCI und AGP sind ältere, heute als Legacy bezeichnete Grafikkartenbusse und mit PCIe nicht steckkompatibel.
| Generation | Transferrate je Lane | ca. GB/s je Lane | ca. GB/s bei x16 |
|---|---|---|---|
| PCIe 1.0 | 2,5 GT/s | 0,25 | 4 |
| PCIe 2.0 | 5,0 GT/s | 0,50 | 8 |
| PCIe 3.0 | 8,0 GT/s | 0,98 | 15,8 |
| PCIe 4.0 | 16 GT/s | 1,97 | 31,5 |
| PCIe 5.0 | 32 GT/s | 3,94 | 63 |
| PCIe 6.0 | 64 GT/s, PAM4 | etwa 7,6 | etwa 121 |
| PCIe 7.0 | 128 GT/s, PAM4 | etwa 15,1 | etwa 242 |
Bildausgänge und der Weg zum Monitor
Die Display-Engine liest fertige Frames, versieht sie mit Timing-, Farb- und Metadaten und sendet sie über einen Ausgang. Heute dominieren DisplayPort und HDMI; USB-C kann DisplayPort-Signale im Alternate Mode transportieren. DVI ist bei älteren Systemen verbreitet, VGA überträgt ausschließlich analog.
Der früher übliche RAMDAC wandelte digitale Pixeldaten für VGA in analoge RGB-Signale um. Aktuelle GPUs und Grafikkarten besitzen häufig keinen analogen Ausgang mehr. Für einen VGA-Monitor ist dann ein aktiver Wandler erforderlich; ein rein mechanischer Adapter genügt nicht.





Auflösung, Seitenverhältnis und Bildwiederholrate
Die Auflösung nennt die Zahl adressierbarer Bildpunkte, das Seitenverhältnis beschreibt das Verhältnis von Breite zu Höhe. Die Bildwiederholrate in Hertz gibt an, wie oft pro Sekunde ein neues Bildsignal übertragen wird. Höhere Farbtiefe, Auflösung und Wiederholrate erhöhen gemeinsam die benötigte Linkbandbreite.
Ob eine Kombination funktioniert, hängt nicht nur von der GPU ab, sondern auch von Ausgangsversion, Monitor, Kabel, Farbcodierung und gegebenenfalls Display Stream Compression (DSC). Marketingbegriffe wie „4K“ ersetzen deshalb nicht die Prüfung der konkreten technischen Daten.
| Bezeichnung | Pixel | Seitenverhältnis | Einordnung |
|---|---|---|---|
| VGA | 640 × 480 | 4:3 | Legacy-Auflösung; nicht mit dem VGA-Anschluss gleichsetzen. |
| Full HD | 1920 × 1080 | 16:9 | Weit verbreitete Desktop- und Videoauflösung. |
| QHD / WQHD | 2560 × 1440 | 16:9 | Mehr Arbeitsfläche und Details als Full HD. |
| UWQHD | 3440 × 1440 | ca. 21:9 | Ultrabreites Format; mathematisch 43:18. |
| UHD / 4K UHD | 3840 × 2160 | 16:9 | Viermal so viele Pixel wie Full HD. |
| Dual QHD | 5120 × 1440 | 32:9 | Sehr breites Format, entspricht zwei QHD-Flächen nebeneinander. |
| 5K | 5120 × 2880 | 16:9 | Hohe Pixeldichte für große oder hochauflösende Displays. |
| 8K UHD | 7680 × 4320 | 16:9 | Sehr hohe Anforderungen an Ausgabeweg und Rechenleistung. |
Kühlung, Leistungsaufnahme und Bauform
Elektrische Leistung wird überwiegend in Wärme umgewandelt. Überschreitet ein Bauteil seine Temperatur- oder Leistungsgrenze, reduziert die Steuerung Takt und Spannung; dieser Schutzmechanismus heißt Thermal beziehungsweise Power Throttling. Dauerhaft gute Leistung benötigt daher einen passenden Kühler und einen ungehinderten Luftstrom im Gehäuse.
- Vor dem Kauf Länge, Kartenhöhe, Dicke in Slots und Freiraum für Kabel prüfen.
- Netzteilleistung, Anzahl und Art der PCIe-Stromstecker sowie Herstellerempfehlungen beachten; Stecker vollständig einsetzen.
- Schwere Karten gegebenenfalls abstützen und beim Transport eines PCs sichern.
- Lüfter, Kühlrippen und Filter regelmäßig staubfrei halten; niemals einen laufenden oder noch geladenen PC öffnen.
| Kühlkonzept | Eigenschaften |
|---|---|
| Passiv | Geräuschlos, aber auf geringe Verlustleistung und gute Gehäusebelüftung begrenzt. |
| Open-Air-Luftkühlung | Ein oder mehrere Axiallüfter verteilen einen Teil der erwärmten Luft im Gehäuse; häufig bei Desktopkarten. |
| Radiallüfter / Blower | Drückt Luft entlang der Karte nach außen; kann in dichten Systemen helfen, ist unter Last oft lauter. |
| Flüssigkeitskühlung | Transportiert Wärme zu einem Radiator; benötigt weiterhin Kühlung für Speicher und Spannungswandler und erhöht die Komplexität. |
Desktop-Grafikkarte, KI-Beschleuniger oder HPC-Beschleuniger?
Die Begriffe beschreiben vor allem den vorgesehenen Einsatz und nicht drei vollständig verschiedene Chiparten. Moderne GPUs führen Grafik- und allgemeine Parallelberechnungen aus. Ein und dieselbe Rechenarchitektur kann deshalb Varianten für Spiele, professionelle Visualisierung, KI und wissenschaftliches Rechnen hervorbringen. KI und HPC überschneiden sich zusätzlich: Große Sprachmodelle benötigen ähnliche Speicher- und Kommunikationssysteme wie verteilte wissenschaftliche Simulationen.
Im Alltag wird fast jede PCIe-Karte mit GPU als „Grafikkarte“ bezeichnet. Bei Rechenprodukten ohne nutzbare Bildausgänge ist „GPU-Beschleuniger“ genauer. Solche Beschleuniger können als PCIe-Steckkarte, als Servermodul oder fest in einem Mehr-GPU-System ausgeführt sein. OAM-, SXM- und andere Rechenmodule sind daher keine normalen Desktop-Grafikkarten, obwohl sie GPUs enthalten.
| Kategorie | Optimierung und typische Merkmale | Typische Aufgaben |
|---|---|---|
| Desktop- und Gaming-Grafikkarte | Starke Raster-, Shader- und häufig Raytracing-Leistung; GDDR-Speicher; mehrere Bildausgänge; aktive Luftkühlung; Treiber für Spiele und Desktop-Anwendungen. | Spiele, Desktop, Medienwiedergabe, Streaming, leichte Inhaltsproduktion und kleinere lokale Compute- oder KI-Aufgaben. |
| Professionelle Workstation-Grafikkarte | Ähnlicher Grundaufbau wie eine Desktopkarte, aber häufig mehr VRAM, validierte beziehungsweise zertifizierte Treiber, längere Produktpflege und auf Dauerbetrieb ausgelegte Modelle. | CAD, 3D-Konstruktion, Visualisierung, Video, virtuelle Arbeitsplätze und fachlich zertifizierte Anwendungen. |
| KI-Beschleuniger | Hoher Durchsatz für Matrixoperationen und reduzierte Zahlenformate wie BF16, FP16, FP8 oder INT8; sehr großer HBM-Speicher, schnelle GPU-Verbindungen und optimierte Framework-Bibliotheken; häufig ohne Display-Ausgänge. | Training, Fine-Tuning und Inferenz neuronaler Netze sowie große Sprach-, Bild- und Empfehlungssysteme. |
| HPC-Beschleuniger | Hohe FP64- und Vektorleistung, große Speicherbandbreite, ECC und RAS-Funktionen, schnelle Clusterkommunikation sowie auf lange Rechenläufe ausgelegte Kühlung und Überwachung. | Klima-, Strömungs- und Molekülsimulation, Physik, Wettervorhersage, numerische Forschung und technische Berechnungen. |
| Kombinierter KI-/HPC-Beschleuniger | Unterstützt sowohl niedrige und gemischte Genauigkeiten für KI als auch FP64 und wissenschaftliche Bibliotheken; HBM und schnelle GPU-zu-GPU-Verbindungen dienen beiden Bereichen. | Rechenzentren und Supercomputer, die KI-Modelle, Datenanalyse und klassische Simulationen auf derselben Plattform betreiben. |
Die entscheidenden technischen Unterschiede
Rechenleistung darf nur für das benötigte Zahlenformat verglichen werden. Ein hoher INT8- oder FP8-Wert macht einen Beschleuniger nicht automatisch schnell bei FP64; umgekehrt ist eine starke FP64-GPU nicht zwangsläufig die wirtschaftlichste Inferenzlösung. Auch Angaben mit und ohne Sparsity, unterschiedliche Genauigkeitsbedingungen und Herstellerdefinitionen dürfen nicht ungeprüft nebeneinandergestellt werden.
Für KI und HPC entscheidet das Gesamtsystem: nutzbarer Speicher, Speicherbandbreite, Interconnect, CPU-Anbindung, Netzwerk, Energiebedarf, Kühlung, Bibliotheken und Skalierbarkeit können wichtiger sein als der Spitzenwert einer einzelnen GPU. Eine Desktopkarte kann für Entwicklung und kleine Modelle sinnvoll sein, ersetzt aber nicht automatisch einen Rechenzentrumsbeschleuniger mit ECC, RAS und schneller Mehr-GPU-Kommunikation.
| Merkmal | Desktop / Workstation | KI | HPC |
|---|---|---|---|
| Priorisierte Rechenformate | Vor allem FP32 für Grafik; je nach GPU auch FP16, BF16 und Integerformate. | Sehr hoher Durchsatz bei Matrixoperationen und niedrigeren beziehungsweise gemischten Genauigkeiten. | FP64 ist für viele numerische Verfahren zentral; je nach Anwendung zusätzlich FP32, gemischte Genauigkeit oder Spezialformate. |
| Speicher | Meist GDDR; Kapazität und Kosten auf Einzelarbeitsplätze abgestimmt. | Häufig großer HBM-Speicher für Modellparameter, Aktivierungen und hohe Bandbreite. | Häufig HBM mit ECC für große, bandbreitenintensive Datensätze und lange Rechenläufe. |
| Ausgabe | Physische Monitoranschlüsse und vollständige Display-Engine sind wichtige Produktmerkmale. | Bildausgänge sind oft nicht vorhanden oder für den Betrieb bedeutungslos. | Bildausgänge sind meistens nicht erforderlich; Visualisierung erfolgt häufig über getrennte Systeme. |
| Skalierung | Üblicherweise eine Karte, gelegentlich mehrere unabhängige GPUs. | Schnelle GPU-zu-GPU- und Knotenverbindungen für verteiltes Training und große Modelle. | Schnelle Interconnects, kollektive Kommunikation und Cluster-Netzwerke für viele Beschleuniger. |
| Zuverlässigkeit | Desktop-Fehlerbehandlung und herstellerspezifische Garantien. | ECC, Telemetrie, Partitionierung und RAS-Funktionen für Rechenzentrumsbetrieb. | ECC, RAS, Fehlererkennung und planbares Verhalten bei sehr langen Jobs sind besonders wichtig. |
| Software | Grafiktreiber, Direct3D/Vulkan/OpenGL/Metal sowie Kreativ- und CAD-Anwendungen. | Frameworks und Bibliotheken für Training und Inferenz; das Software-Ökosystem ist ein zentrales Auswahlkriterium. | Compiler, numerische Bibliotheken, MPI-/Kommunikationsbibliotheken, Profiler und wissenschaftliche Anwendungen. |
Grafiklösung nach Arbeitslast auswählen
Starre Kategorien nach Preis oder Modellklasse altern schnell. Aussagekräftiger sind aktuelle, reproduzierbare Benchmarks der eigenen Anwendungen. Ergebnisse verschiedener Treiberversionen, Qualitätsstufen und Leistungsgrenzen dürfen nur mit identischen Testbedingungen verglichen werden.
| Einsatz | Wichtige Kriterien |
|---|---|
| Büro, Web und Unterricht | Anzahl und Art der Ausgänge, unterstützte Auflösungen, leiser Betrieb, Hardware-Decodierung aktueller Videoformate. |
| Gaming und Echtzeit-3D | Leistung in den tatsächlich genutzten Spielen, Zielauflösung und Bildrate, VRAM, Treiber, Leistungsaufnahme und Kühlung. |
| Bild, Video und 3D-Produktion | VRAM-Kapazität, Medien-Engines und Codecs, Farbausgabe, Anwendungszertifizierung, Stabilität und Renderleistung. |
| Compute, KI und Wissenschaft | Unterstützte Softwareplattform, Rechenformate, Speicherbandbreite und -kapazität, Skalierbarkeit und Dauerlastkühlung. |
| Viele oder hochauflösende Monitore | Zahl der Display-Engines und physischen Ausgänge, maximale Kombinationen, MST/DSC sowie Monitor- und Kabelstandard. |
Typische Fehler systematisch eingrenzen
- Kein Bild: Monitor am vorgesehenen Ausgang anschließen, Eingangsquelle prüfen, Stromstecker der Karte kontrollieren und Karte spannungsfrei neu einsetzen.
- Niedrige Leistung: Treiber, Energieprofil, Temperaturen, PCIe-Lane-Anbindung, CPU-Limit, VRAM-Auslastung und Hintergrundlast prüfen.
- Bildfehler oder Abstürze: Temperaturen und Stromversorgung kontrollieren, Übertaktung zurücksetzen und mit einer bekannten stabilen Treiberversion testen.
- Gewünschte Auflösung oder Bildrate fehlt: Ausgangsstandard, Kabel, Monitorport, Farbtiefe, DSC-Unterstützung und Betriebssystemeinstellung gemeinsam prüfen.
- Vor Arbeiten im PC ausschalten, Netzleitung trennen, Restenergie entladen und ESD-Schutz beachten. Komponenten nie unter Spannung ein- oder ausstecken.
Quellen zur fachlichen Prüfung
- PCI-SIG: PCI Express 7.0 mit 128 GT/s
- PCI-SIG: PCI Express 6.0, PAM4, FLIT und FEC
- Khronos Group: aktuelle Vulkan-Spezifikation
- Khronos Group: Einführung in Vulkan
- Apple Developer: Metal
- W3C: WebGPU-Spezifikation
- NVIDIA: Tensor Cores für KI und HPC
- NVIDIA: NVLink und Mehr-GPU-Skalierung
- AMD: Instinct-Beschleuniger für KI und HPC
- Intel: Data Center GPU Max Series für HPC und KI
- Wikimedia Commons: offengelegte Grafikkarte und Bauteile
PDF-Download nach Anmeldung
Zum Schutz der Unterrichtsunterlagen steht der PDF-Download ausschließlich angemeldeten Nutzern zur Verfügung.
