Wichtig: GitHub Models wurde am 30. Juli 2026 vollständig eingestellt
Laut offizieller GitHub-Dokumentation sind Playground, Modellkatalog, Inferenz-API und BYOK offline – ein eigenständiger Dienst, unabhängig von GitHub Copilot. Dieser Artikel bleibt als vollständiges technisches Archiv für die Migration erhalten; wenn Ihr Code noch auf models.github.ai verweist, springen Sie direkt zum Abschnitt Migrationspfad am Ende.
„GPT-4o mit nur einem GitHub-Konto aufrufen? Ohne Kreditkarte?“
Als GitHub Ende 2024 GitHub Models einführte, nutzten viele Entwickler es als „kostenlose LLM-Sandbox“: ein PAT, ein OpenAI-kompatibler Endpunkt – Skripte, CLI und GitHub Actions liefen damit. Es senkte tatsächlich die Hürde für KI-Prototypen – doch die kostenlose Stufe hatte harte Ratenlimits, GitHub empfahl es nie für Produktion, und der Dienst hielt kürzer als viele erwartet hatten.
Dieser Leitfaden erklärt wie man die GitHub Models API aufruft, wie das kostenlose Kontingent funktioniert, welche Fallstricke es gibt und wohin man nach der Einstellung wechselt – alles an einem Ort. Auch wenn der Dienst weg ist, hilft das Verständnis seines Designs bei der Wahl anderer Inferenzplattformen.
Was ist GitHub Models
GitHub Models war GitHubs KI-Inferenz-API und Playground, mit dem Sie Multi-Anbieter-Modelle über GitHub-Anmeldedaten statt separater API-Schlüssel der Anbieter aufrufen konnten. Kernmerkmale:
- Modellkatalog: OpenAI (GPT-4o, GPT-4.1 usw.), Meta Llama, DeepSeek, Microsoft Phi und mehr – einheitlich im Format
publisher/model_name - OpenAI-kompatibel: Endpunkte folgen der
chat/completions-Spezifikation – bestehende OpenAI-SDK- / LangChain-Setups ließen sich mit minimalen Änderungen umstellen - Native GitHub-Integration:
models: readim Actions-Workflow deklarieren, und das eingebaute Token konnte Modelle aufrufen - Gestaffelte Abrechnung: Kostenlose Stufe für Experimente; Pay-as-you-go oder BYOK (eigener Anbieterschlüssel) bei Überschreitung der Limits
Es war eine eigenständige Produktlinie neben GitHub Copilot: Copilot zielte auf IDE-Coding-Unterstützung; Models darauf, LLMs in eigene Apps, Skripte oder CI-Pipelines einzubetten. Nach der Einstellung empfiehlt GitHub Azure AI Foundry für Modellkataloge und Copilot für KI-Workflows innerhalb von GitHub.
Authentifizierung: PAT und Berechtigungen
Der Aufruf der Inferenz-API erforderte GitHub-Anmeldedaten – zwei Ansätze:
Personal Access Token (lokale / Server-Skripte)
- Öffnen Sie GitHub → Settings → Developer settings → Personal access tokens
- Erstellen Sie einen Fine-grained PAT oder Classic PAT mit aktivierter Berechtigung
models:read(bei Classic alsmodels-Scope angezeigt) - Im Request-Header senden:
Authorization: Bearer ghp_xxxx
Sicherheitshinweise
- PATs nur in Umgebungsvariablen oder einem Secrets Manager speichern – niemals ins Repository committen
- Bei Fine-grained PATs auf erforderliche Repos beschränken und Ablaufdatum setzen
- In CI
GITHUB_TOKENbevorzugen, um das Risiko langfristiger PAT-Leaks zu reduzieren
Eingebautes Token in GitHub Actions
Nach Deklaration der Berechtigungen im Workflow erhielt das GITHUB_TOKEN des Runners automatisch models:read – kein zusätzliches Secret nötig:
permissions:
contents: read
models: read # GitHub Models Inferenz freischalten
API-Aufrufe
Kernendpunkt: https://models.github.ai/inference/chat/completions. Modell-ID-Format: {publisher}/{model_name}, z. B. openai/gpt-4o, meta/llama-3.3-70b-instruct.
3.1 curl direkt
Minimales Request-Beispiel (während der Dienst aktiv war):
curl -L \
-X POST \
-H "Accept: application/vnd.github+json" \
-H "Authorization: Bearer YOUR_GITHUB_PAT" \
-H "X-GitHub-Api-Version: 2022-11-28" \
-H "Content-Type: application/json" \
https://models.github.ai/inference/chat/completions \
-d '{
"model": "openai/gpt-4o",
"messages": [
{"role": "user", "content": "Erkläre die GitHub Models API in drei Sätzen"}
]
}'
Die Antwortstruktur entspricht OpenAI chat/completions: choices[0].message.content ist die Modellausgabe. Unterstützt stream: true für Streaming, temperature, max_tokens und weitere Standardparameter.
3.2 OpenAI Python / JS SDK
Da das Protokoll kompatibel ist, genügt es, base_url und api_key anzupassen:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["GITHUB_TOKEN"],
base_url="https://models.github.ai/inference/",
)
completion = client.chat.completions.create(
model="openai/gpt-4o",
messages=[
{"role": "system", "content": "Du bist ein knapper technischer Assistent"},
{"role": "user", "content": "Was ist der Unterschied zwischen GitHub Models und Copilot?"},
],
)
print(completion.choices[0].message.content)
Frameworks mit anpassbarer OpenAI-base-URL – LangChain, Vercel AI SDK und andere – hatten ebenso geringe Migrationskosten. Das war ein wichtiger Grund, warum GitHub Models in der Open-Source-Community schnell verbreitet wurde.
3.3 GitHub Actions Integration
Typische Anwendungsfälle: automatische PR-Zusammenfassungen, Issue-Klassifizierung, Changelog-Generierung. Vollständiges Workflow-Gerüst:
name: AI Triage
on:
issues:
types: [opened]
permissions:
issues: write
models: read
jobs:
triage:
runs-on: ubuntu-latest
steps:
- name: Classify issue with LLM
env:
GITHUB_TOKEN: ${{ secrets.GITHUB_TOKEN }}
run: |
curl -s https://models.github.ai/inference/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $GITHUB_TOKEN" \
-d '{
"model": "openai/gpt-4o-mini",
"messages": [{
"role": "user",
"content": "Klassifiziere das folgende Issue als bug/feature/question: ..."
}]
}'
Organisationen konnten per Richtlinie steuern, welche Repos und Mitglieder auf Models zugreifen durften – nützlich, um KI-Nutzung im Team zu standardisieren, ohne Anbieter-API-Schlüssel zu teilen.
3.4 Modellkatalog abfragen
Verfügbare Modelle auflisten:
curl -L \
-H "Accept: application/vnd.github+json" \
-H "Authorization: Bearer YOUR_GITHUB_PAT" \
-H "X-GitHub-Api-Version: 2022-11-28" \
https://models.github.ai/catalog/models
Liefert Metadaten pro Modell: Publisher, Kontextfenster, Streaming-Unterstützung und mehr. Zuerst den Katalog prüfen, dann die Ratenlimit-Tabelle unten abgleichen – verschiedene Modelle fallen in unterschiedliche Komplexitätsstufen mit sehr unterschiedlichen Limits.
Kostenloses Kontingent und Ratenlimits
Solange der Dienst bestand, befand sich die kostenlose GitHub Models API in der öffentlichen Vorschau – GitHub wies darauf hin, dass Limits sich ändern können. Die kostenlose Stufe war nicht unbegrenzt, sondern wurde über vier Dimensionen gedrosselt:
- Anfragen pro Minute (RPM)
- Anfragen pro Tag (RPD)
- Token-Obergrenze pro Anfrage (Eingabe / Ausgabe getrennt gezählt)
- Gleichzeitige Anfragen
Die Limits variierten außerdem mit Ihrer GitHub Copilot-Abonnementstufe. Die Tabelle zeigt Basiswerte aus der offiziellen GitHub-Dokumentation (Copilot Free vs. Enterprise):
| Modellstufe | Kennzahl | Free | Pro | Pro+ | Enterprise |
|---|---|---|---|---|---|
| Geringe Komplexität GPT-4o-mini, Llama 3 usw. |
Pro Minute | 15 | 15 | 15 | 20 |
| Pro Tag | 150 | 150 | 300 | 450 | |
| Token pro Anfrage | 8.000 Eingabe + 4.000 Ausgabe (Enterprise Ausgabe 8.000) | ||||
| Parallelität | 5 | 5 | 5 | 8 | |
| Hohe Komplexität GPT-4o, GPT-4.1 usw. |
Pro Minute | 10 | 10 | 10 | 15 |
| Pro Tag | 50 | 50 | 100 | 150 | |
| Token pro Anfrage | 8.000 Eingabe + 4.000 Ausgabe | 16.000 Eingabe + 8.000 Ausgabe | |||
| Parallelität | 2 | 2 | 2 | 4 | |
| Embedding | Pro Minute | 15 | 15 | 15 | 20 |
| Pro Tag | 150 | 150 | 300 | 450 | |
| Token pro Anfrage | 64.000 | ||||
| Parallelität | 5 | 5 | 5 | 8 | |
| Reasoning-Modelle DeepSeek-R1, Grok-3 usw. |
Pro Minute | ca. 1–2 | |||
| Pro Tag | ca. 8–15 | ||||
| Token pro Anfrage | ca. 4.000 Eingabe + 4.000 Ausgabe | ||||
| Parallelität | 1 | ||||
So lesen Sie die Tabelle
- Tageslimits zuerst erreicht: Kostenlose Konten hatten nur 50 GPT-4o-Aufrufe pro Tag – Batch-Jobs erschöpfen das Kontingent schnell
- Reasoning-Modelle extrem knapp: DeepSeek-R1-Klasse erlaubte nur wenige Anfragen pro Tag – geeignet für gelegentliche Tests, nicht für regelmäßige Nutzung
- Nach 429 auf Reset warten: Welches Limit Sie erreicht haben, bestimmt das Wartezeitfenster (Minuten- oder Tagesebene)
- Kostenlose Stufe ≠ Produktionslizenz: Offizielle Positionierung war Prototyping – kein SLA, keine garantierte dedizierte Kapazität
Kostenpflichtige Nutzung und BYOK
Mitte 2025 eröffnete GitHub zwei Wege über die kostenlosen Limits hinaus:
Pay-as-you-go
- Aktivierung von Pay-as-you-go in der Organisations- / persönlichen Abrechnung (standardmäßig deaktiviert)
- Abrechnungseinheit: Token Unit zu $0,00001 / Unit
- Verschiedene Modelle haben Multiplikatoren: GPT-4o-Eingabetokens tragen einen Multiplikator von 0,25 – effektive Kosten entsprechen ungefähr den OpenAI-Direktpreisen
- Schaltet höhere RPM/RPD, größere Kontextfenster und mehr Parallelität frei
Bring Your Own Key (BYOK)
- Eigenen OpenAI- oder Azure-AI-Schlüssel binden – Nutzung wird dem Anbieterkonto gutgeschrieben
- Teammitglieder sehen nie den echten API-Schlüssel; GitHub verwaltet ihn sicher
- Gleiches Nutzungsmuster wie GitHub-gehostete Modelle in Playground, Actions und Evaluierungsflows
Pay-as-you-go und BYOK eigneten sich für Teams, die bereits im GitHub-Ökosystem arbeiteten und einheitliche Abrechnung / Berechtigungen wollten. Wenn Sie nur rohen API-Durchsatz brauchen, ist der direkte Weg zum Anbieter oft einfacher – siehe den LLM-Preis- & Modellauswahl-Leitfaden.
Best Practices
1. Szenario kennen: Experimente ja, Produktion nein
Die kostenlose Stufe eignete sich am besten für: persönliche Side-Project-Prototypen, Open-Source-Action-Demos, Vergleich von Modellausgaben und seltene CI-Hilfen (z. B. PR-Titelvorschläge). Ungeeignet für: nutzerorientierte Chat-Produkte, High-QPS-Backends oder latenzsensitive Pfade.
2. Gestaffeltes Modell-Routing
Anfragen nach Komplexität leiten: Modelle geringer Komplexität (GPT-4o-mini, kleinere Llama) für einfache Klassifizierung / Zusammenfassung; GPT-4o oder DeepSeek-R1 nur aufrufen, wenn wirklich Reasoning-Qualität nötig ist. Kostenlose Konten hatten nur 50 GPT-4o-Aufrufe pro Tag – bei Missbrauch war das Kontingent für den Tag aufgebraucht.
3. Token-Budget kontrollieren
Obergrenze pro Anfrage: 8K Eingabe + 4K Ausgabe. Lange Dokumente vor dem Reasoning zusammenfassen; System-Prompts knapp halten; max_tokens setzen, um unkontrollierte Ausgaben zu verhindern. Embedding erlaubte 64K, aber Massenjobs trafen trotzdem auf Tagesanfragelimits.
4. 429 elegant behandeln
Exponentielles Backoff implementieren; RPM (60 Sekunden warten) von RPD (bis zum nächsten Tag warten oder auf kostenpflichtig wechseln) unterscheiden; Semaphore nutzen, um innerhalb der Parallelitätslimits zu bleiben (5 bei geringer, 2 bei hoher Komplexität).
5. GITHUB_TOKEN in Actions; kurzlebige PATs lokal
Null Konfiguration in CI; Fine-grained PAT mit Ablaufdatum für lokale Entwicklung. Tokens niemals in Workflow-Logs ausgeben – -s bei curl verwenden und set -x vermeiden, das den Authorization-Header druckt.
6. Inferenzschicht abstrahieren für einfache Migration
base_url, model und api_key in Umgebungsvariablen oder einem Konfigurationsobjekt zentralisieren. Mit der Einstellung von GitHub Models ist diese Abstraktion noch wichtiger – derselbe Code kann auf OpenAI, Azure AI Foundry oder ein selbst gehostetes Gateway zeigen.
Migrationspfad nach der Einstellung (ab 2026-07-30)
Offizielle Ersatzpfade von GitHub:
| Ihr Bedarf | Empfohlener Ersatz | Migrationshinweise |
|---|---|---|
| Multi-Modell-Katalog + Enterprise-Inferenz | Azure AI Foundry | Am nächsten an der ursprünglichen GitHub-Models-Positionierung für Modellauswahl und gehostete Skalierung |
| KI-Workflows innerhalb von GitHub (PRs, Issues) | GitHub Copilot | IDE / PR-Review / Agent-Modus – keine rohe API |
| OpenAI-kompatibel, geringste Migrationskosten | OpenAI API | base_url zurück auf https://api.openai.com/v1 setzen und API-Schlüssel tauschen |
| LLM-Aufrufe in CI | Actions + Anbieter-Secrets | models: read entfernen; OPENAI_API_KEY oder ähnliche Secrets verwenden |
Checkliste für minimale Änderungen bei der Migration:
- Global nach
models.github.aisuchen und alle Referenzen auflisten base_urlund Authentifizierung durch den neuen Anbieter ersetzen- Modell-IDs aktualisieren (z. B.
openai/gpt-4o→gpt-4o, je nach Anbieterformat) - Veraltete
permissions: models: readaus Workflows entfernen - Ratenlimits und Abrechnung neu bewerten – die Illusion der kostenlosen Stufe ist weg; nach den Kontingenten der neuen Plattform planen
FAQ
Ist die GitHub Models API noch verfügbar?
Nein. Ab dem 30. Juli 2026 vollständig eingestellt – alle Endpunkte offline.
Wie authentifiziert man sich?
PAT mit models:read, oder models: read in Actions deklarieren und GITHUB_TOKEN verwenden.
Wie hoch war das kostenlose Kontingent?
Geringe Komplexität: ca. 15 RPM / 150 RPD; hohe Komplexität: ca. 10 RPM / 50 RPD; Reasoning-Modelle strenger. Skalierte mit der Copilot-Stufe.
War sie mit der OpenAI API kompatibel?
Ja – chat/completions. SDK: base_url auf https://models.github.ai/inference/ setzen.
Konnte die kostenlose Stufe in Produktion genutzt werden?
Nein. Offizielle Positionierung war Experimentieren – kein SLA, strenge Ratenlimits.
Fazit
Wie ruft man die GitHub Models API auf? Kurz gesagt: PAT-Authentifizierung + OpenAI-kompatibler Endpunkt + Ratenlimits pro Modellstufe – es war ein Shortcut ohne Einstiegshürde zum Modelltesten, aber tägliche Anfragen in der kostenlosen Stufe lagen im ein- bis dreistelligen Bereich – nie eine Produktionslösung.
Der Dienst ist weg, die Lehren bleiben: Kompatible Protokolle nutzen, um Migrationskosten zu senken, minimale Berechtigungen in CI deklarieren und die Inferenzschicht als austauschbare Konfiguration abstrahieren. Nächster Schritt: models.github.ai aus dem Code entfernen und je nach Szenario Azure AI Foundry, OpenAI direkt oder Copilot wählen – für einen breiteren Vergleich siehe den LLM-Preis- & Modellauswahl-Leitfaden.
LLM-Agent für Xcode-Builds? Stabile Cloud-Mac-Execution-Node
Modell-APIs sind weggezogen, macOS-Build-Umgebungen bleiben. Vuncloud dedizierte Mac mini M4 – damit CI / Agents TestFlight über Nacht ohne Unterbrechung laufen.
Cloud-Mac-Pakete ansehen · LLM-Preis- & Modellauswahl-Leitfaden
Weiterführende Artikel
- LLM-API-Preise & Modellauswahl 2026: GPT-5.5, Claude, Gemini, DeepSeek
- GPT-5.6 Sol, Terra oder Luna – welches Modell? Leistung, Preis und Geschwindigkeit im Vergleich (2026)
- Codex-Wochenlimit erreicht? 7 Fixes, Kontingent-Mechanik & alternative APIs (2026)
- 2026 AI Coding, Personal AI & Agent-Orchestrierung: Das Dreier-Set als Referenzarchitektur
Limits und Einstellungsinformationen basieren auf der offiziellen GitHub Models Dokumentation. Zuletzt aktualisiert: 31. Juli 2026.