Важно: GitHub Models полностью выведен из эксплуатации 30 июля 2026 года
Согласно официальной документации GitHub, Playground, каталог моделей, API инференса и BYOK отключены — это отдельный сервис, не связанный с GitHub Copilot. Статья сохранена как полный технический архив для миграции; если в коде остались ссылки на models.github.ai, переходите сразу к разделу миграции в конце.
«Вызвать GPT-4o с аккаунтом GitHub? Без привязки кредитной карты?»
После запуска GitHub Models в конце 2024 года многие разработчики воспринимали его как «бесплатную песочницу для LLM»: один PAT, один OpenAI-совместимый эндпоинт — и можно запускать скрипты, CLI и GitHub Actions. Сервис действительно снизил порог входа для AI-прототипирования — но бесплатный уровень имел жёсткие лимиты, GitHub не рекомендовал его для продакшена, а срок жизни сервиса оказался короче, чем ожидали многие.
Здесь разобрано как вызывать GitHub Models API, как считаются бесплатные квоты, каких ошибок избегать и куда мигрировать после вывода из эксплуатации. Даже после закрытия сервиса понимание его архитектуры помогает при выборе других платформ инференса.
1. Что такое GitHub Models
GitHub Models — это API инференса и Playground от GitHub, позволявший вызывать модели разных вендоров с учётными данными GitHub вместо отдельных API-ключей провайдеров. Ключевые особенности:
- Каталог моделей: OpenAI (GPT-4o, GPT-4.1 и др.), Meta Llama, DeepSeek, Microsoft Phi и другие — единый формат
publisher/model_name - OpenAI-совместимость: эндпоинты следуют спецификации
chat/completions— существующие OpenAI SDK / LangChain переключались с минимальными изменениями - Нативная интеграция с GitHub: объявите
models: readв workflow Actions — встроенный токен вызывал модели - Многоуровневая тарификация: бесплатный уровень для экспериментов; pay-as-you-go или BYOK (свой ключ провайдера) при превышении лимитов
Это была отдельная продуктовая линия от GitHub Copilot: Copilot — помощь в IDE при написании кода; Models — встраивание LLM в собственные приложения, скрипты или CI-пайплайны. После вывода из эксплуатации GitHub рекомендует Azure AI Foundry для каталогов моделей и Copilot для AI-воркфлоу внутри GitHub.
2. Аутентификация: PAT и области доступа
Для вызова API инференса требовались учётные данные GitHub — два подхода:
Personal Access Token (локальные / серверные скрипты)
- Откройте GitHub → Settings → Developer settings → Personal access tokens
- Создайте Fine-grained PAT или Classic PAT, включив
models:read(в Classic это областьmodels) - Передайте в заголовке запроса:
Authorization: Bearer ghp_xxxx
Советы по безопасности
- Храните PAT в переменных окружения или менеджере секретов — не коммитьте в репозиторий
- Для Fine-grained PAT ограничьте доступ нужными репозиториями и задайте срок действия
- В CI предпочитайте
GITHUB_TOKENдолгоживущим PAT, чтобы снизить риск утечки
Встроенный токен GitHub Actions
После объявления разрешений в workflow GITHUB_TOKEN runner'а автоматически получал models:read — дополнительный secret не нужен:
permissions:
contents: read
models: read # unlock GitHub Models inference
3. Способы вызова API
Основной эндпоинт: https://models.github.ai/inference/chat/completions. Формат ID модели: {publisher}/{model_name}, например openai/gpt-4o, meta/llama-3.3-70b-instruct.
3.1 Прямой вызов через curl
Минимальный пример запроса (пока сервис работал):
curl -L \
-X POST \
-H "Accept: application/vnd.github+json" \
-H "Authorization: Bearer YOUR_GITHUB_PAT" \
-H "X-GitHub-Api-Version: 2022-11-28" \
-H "Content-Type: application/json" \
https://models.github.ai/inference/chat/completions \
-d '{
"model": "openai/gpt-4o",
"messages": [
{"role": "user", "content": "Объясни GitHub Models API в трёх предложениях"}
]
}'
Структура ответа совпадает с OpenAI chat/completions: choices[0].message.content — вывод модели. Поддерживались stream: true для потоковой передачи, temperature, max_tokens и другие стандартные параметры.
3.2 OpenAI Python / JS SDK
Из-за совместимости протокола достаточно сменить base_url и api_key:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["GITHUB_TOKEN"],
base_url="https://models.github.ai/inference/",
)
completion = client.chat.completions.create(
model="openai/gpt-4o",
messages=[
{"role": "system", "content": "Ты лаконичный технический ассистент"},
{"role": "user", "content": "Чем отличаются GitHub Models и Copilot?"},
],
)
print(completion.choices[0].message.content)
Фреймворки с поддержкой кастомного OpenAI base URL — LangChain, Vercel AI SDK и другие — имели столь же низкую стоимость миграции. Это была одна из причин быстрого распространения GitHub Models в open-source-сообществе.
3.3 Интеграция с GitHub Actions
Типичные сценарии: автоматические сводки PR, классификация Issue, генерация changelog. Каркас workflow:
name: AI Triage
on:
issues:
types: [opened]
permissions:
issues: write
models: read
jobs:
triage:
runs-on: ubuntu-latest
steps:
- name: Classify issue with LLM
env:
GITHUB_TOKEN: ${{ secrets.GITHUB_TOKEN }}
run: |
curl -s https://models.github.ai/inference/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $GITHUB_TOKEN" \
-d '{
"model": "openai/gpt-4o-mini",
"messages": [{
"role": "user",
"content": "Классифицируй Issue как bug/feature/question: ..."
}]
}'
На уровне организации можно было политиками контролировать, какие репозитории и участники имеют доступ к Models — удобно для унификации AI-использования в команде без общего API-ключа вендора.
3.4 Запрос каталога моделей
Список доступных моделей:
curl -L \
-H "Accept: application/vnd.github+json" \
-H "Authorization: Bearer YOUR_GITHUB_PAT" \
-H "X-GitHub-Api-Version: 2022-11-28" \
https://models.github.ai/catalog/models
Возвращались метаданные по каждой модели: publisher, контекстное окно, поддержка streaming и др. При выборе модели сначала смотрите каталог, затем сверяйтесь с таблицей лимитов ниже — разные модели относятся к разным уровням сложности с сильно отличающимися квотами.
4. Бесплатные квоты и лимиты скорости
Пока сервис работал, бесплатный API GitHub Models находился в публичном превью — GitHub предупреждал, что лимиты могут меняться. Бесплатный уровень не был безлимитным; ограничения действовали по четырём измерениям:
- Запросов в минуту (RPM)
- Запросов в день (RPD)
- Лимит токенов на запрос (вход / выход считаются отдельно)
- Параллельные запросы
Лимиты также зависели от тарифа подписки GitHub Copilot. Ниже — базовые значения из официальной документации GitHub (Copilot Free vs Enterprise):
| Уровень модели | Метрика | Free | Pro | Pro+ | Enterprise |
|---|---|---|---|---|---|
| Низкая сложность GPT-4o-mini, Llama 3 и др. |
В минуту | 15 | 15 | 15 | 20 |
| В день | 150 | 150 | 300 | 450 | |
| Токены на запрос | 8 000 вход + 4 000 выход (Enterprise: 8 000 выход) | ||||
| Параллельность | 5 | 5 | 5 | 8 | |
| Высокая сложность GPT-4o, GPT-4.1 и др. |
В минуту | 10 | 10 | 10 | 15 |
| В день | 50 | 50 | 100 | 150 | |
| Токены на запрос | 8 000 вход + 4 000 выход | 16 000 вход + 8 000 выход | |||
| Параллельность | 2 | 2 | 2 | 4 | |
| Embedding | В минуту | 15 | 15 | 15 | 20 |
| В день | 150 | 150 | 300 | 450 | |
| Токены на запрос | 64 000 | ||||
| Параллельность | 5 | 5 | 5 | 8 | |
| Модели рассуждений DeepSeek-R1, Grok-3 и др. |
В минуту | ~1–2 | |||
| В день | ~8–15 | ||||
| Токены на запрос | ~4 000 вход + 4 000 выход | ||||
| Параллельность | 1 | ||||
Как читать таблицу
- Дневной лимит упирается первым: на бесплатном аккаунте GPT-4o — всего 50 вызовов в день, пакетная обработка быстро исчерпывает квоту
- Модели рассуждений крайне жёсткие: DeepSeek-R1 и аналоги — единицы запросов в день, подходит лишь для редких тестов
- После 429 нужно ждать сброса: какой лимит сработал — такое окно ожидания (минутное или суточное)
- Бесплатный уровень ≠ продакшен: официальная позиция — прототипирование, без SLA и гарантий выделенной ёмкости
5. Платное использование и BYOK
В середине 2025 года GitHub открыл два пути сверх бесплатных лимитов:
Оплата по факту (Pay-as-you-go)
- Включите pay-as-you-go в Billing организации / личного аккаунта (по умолчанию выключено)
- Единица тарификации: token unit по $0.00001 / unit
- У разных моделей свои множители (multiplier): входные токены GPT-4o — множитель 0.25, итоговая стоимость близка к прямому тарифу OpenAI
- Разблокируются более высокие RPM/RPD, большие контекстные окна и больше параллельных запросов
Свой ключ (BYOK)
- Привяжите свой ключ OpenAI или Azure AI — расход идёт на счёт провайдера
- Участники команды не видят реальный API Key — GitHub хранит его безопасно
- Тот же паттерн использования, что и у моделей GitHub в Playground, Actions и оценочных пайплайнах
Pay-as-you-go и BYOK подходили командам, уже работающим в экосистеме GitHub и желающим единый биллинг / права доступа. Если нужен только сырой API-пропускная способность, прямое подключение к провайдеру часто проще — см. Гайд по ценам и выбору LLM.
6. Лучшие практики
1. Определите сценарий: эксперименты — да, продакшен — нет
Бесплатный уровень лучше всего подходил для: личных side-project прототипов, демо open-source Action, сравнения выводов моделей и редких CI-задач (например, предложения заголовков PR). Не подходит для: пользовательских чат-продуктов, высоконагруженных бэкендов и цепочек, чувствительных к задержке.
2. Маршрутизация по уровням моделей
Разделяйте запросы по сложности: простая классификация / суммаризация — модели низкой сложности (GPT-4o-mini, Llama меньшего размера); GPT-4o или DeepSeek-R1 — только когда действительно нужно качество рассуждений. На бесплатном аккаунте GPT-4o — 50 вызовов в день; злоупотребление — и квота на сутки исчерпана.
3. Контроль бюджета токенов
Лимит на запрос: 8K вход + 4K выход. Длинные документы сначала суммируйте, затем рассуждайте; system prompt держите компактным; задайте max_tokens, чтобы не раздувать вывод. Embedding допускал 64K, но массовые задачи всё равно упирались в дневной лимит запросов.
4. Корректная обработка 429
Реализуйте экспоненциальный backoff; различайте RPM (ждать 60 секунд) и RPD (ждать до следующего дня или переходить на платный план); семафорами держите параллельность в пределах лимита (5 для низкой сложности, 2 для высокой).
5. GITHUB_TOKEN в Actions; короткоживущие PAT локально
В CI — нулевая настройка; для локальной разработки — Fine-grained PAT со сроком действия. Никогда не логируйте токены в вывод workflow — curl с -s и без set -x, печатающего заголовок Authorization.
6. Абстрагируйте слой инференса для простой миграции
Соберите base_url, model и api_key в переменные окружения или объект конфигурации. После вывода GitHub Models эта абстракция особенно важна — тот же код может указывать на OpenAI, Azure AI Foundry или собственный шлюз.
7. Миграция после вывода из эксплуатации (с 30.07.2026)
Официальные пути замены от GitHub:
| Ваша задача | Рекомендуемая замена | Заметки по миграции |
|---|---|---|
| Мультимодельный каталог + корпоративный инференс | Azure AI Foundry | Ближе всего к исходному позиционированию GitHub Models по выбору моделей и масштабу хостинга |
| AI-воркфлоу внутри GitHub (PR, Issue) | GitHub Copilot | IDE / ревью PR / режим Agent — не «голый» API |
| OpenAI-совместимость, минимальная стоимость миграции | OpenAI API | Верните base_url на https://api.openai.com/v1 и замените API Key |
| Вызовы LLM в CI | Actions + secrets провайдера | Удалите models: read; используйте OPENAI_API_KEY и аналогичные secrets |
Чеклист миграции с минимальными изменениями:
- Глобальный поиск
models.github.ai— составьте список всех ссылок - Замените
base_urlи способ аутентификации на нового провайдера - Обновите ID моделей (например,
openai/gpt-4o→gpt-4o— по формату вендора) - Удалите устаревший
permissions: models: readиз workflow - Заново оцените лимиты и биллинг — иллюзии бесплатного уровня больше нет, планируйте под квоты новой платформы
FAQ
GitHub Models API ещё доступен?
Нет. С 30 июля 2026 года полностью выведен из эксплуатации — все эндпоинты отключены.
Как проходила аутентификация?
PAT с models:read или объявление models: read в Actions и использование GITHUB_TOKEN.
Какой была бесплатная квота?
Низкая сложность: ~15 RPM / 150 RPD; высокая сложность: ~10 RPM / 50 RPD; модели рассуждений — строже. Лимиты росли с тарифом Copilot.
Был ли API совместим с OpenAI?
Да — chat/completions. В SDK: base_url = https://models.github.ai/inference/.
Можно ли было использовать бесплатный уровень в продакшене?
Нет. Официальная позиция — эксперименты; без SLA, с жёсткими лимитами скорости.
Заключение
Как вызывать GitHub Models API? В одном предложении: аутентификация PAT + OpenAI-совместимый эндпоинт + лимиты по уровню модели — это был путь без порога входа для тестирования моделей, но дневные запросы на бесплатном уровне — от единиц до сотен, никогда не продакшен-решение.
Сервис закрыт, но уроки остаются: совместимые протоколы снижают стоимость миграции, в CI объявляйте минимальные права, слой инференса выносите в заменяемую конфигурацию. Следующий шаг — убрать models.github.ai из кода и выбрать Azure AI Foundry, прямой OpenAI или Copilot по сценарию — более системное сравнение в Гайд по ценам и выбору LLM.
LLM Agent запускает сборки Xcode? Подключите стабильный Cloud Mac как узел выполнения
API моделей ушли, среда сборки macOS осталась. Выделенный Mac mini M4 от Vuncloud — CI и Agent могут ночью гонять TestFlight без обрывов.
Читайте также
- Цены, конфиг, производительность и аудитории LLM 2026—полный разбор
- Как выбрать GPT-5.6 Sol, Terra или Luna? Сравнение производительности, цены и скорости (2026)
- Исчерпан недельный лимит Codex? 7 решений, механика квот и альтернативные API (2026)
- 2026: AI Coding, Personal AI и оркестрация Agent — авторитетный разбор «триады» для разработчиков
Лимиты и сведения о выводе из эксплуатации — по официальной документации GitHub Models. Последнее обновление: 31 июля 2026 г.