Vuncloud Блог
← Назад к Dev Notes

GitHub Models API: вызов, бесплатные квоты, лимиты и лучшие практики (2026)

PAT-аутентификация · OpenAI-совместимый endpoint · бесплатные лимиты · GitHub Actions · pay-as-you-go и BYOK · миграция после shutdown~12 мин

Разработчик вызывает GitHub Models API в терминале, на экране код и запрос инференса AI-модели

Важно: GitHub Models полностью выведен из эксплуатации 30 июля 2026 года

Согласно официальной документации GitHub, Playground, каталог моделей, API инференса и BYOK отключены — это отдельный сервис, не связанный с GitHub Copilot. Статья сохранена как полный технический архив для миграции; если в коде остались ссылки на models.github.ai, переходите сразу к разделу миграции в конце.

«Вызвать GPT-4o с аккаунтом GitHub? Без привязки кредитной карты?»

После запуска GitHub Models в конце 2024 года многие разработчики воспринимали его как «бесплатную песочницу для LLM»: один PAT, один OpenAI-совместимый эндпоинт — и можно запускать скрипты, CLI и GitHub Actions. Сервис действительно снизил порог входа для AI-прототипирования — но бесплатный уровень имел жёсткие лимиты, GitHub не рекомендовал его для продакшена, а срок жизни сервиса оказался короче, чем ожидали многие.

Здесь разобрано как вызывать GitHub Models API, как считаются бесплатные квоты, каких ошибок избегать и куда мигрировать после вывода из эксплуатации. Даже после закрытия сервиса понимание его архитектуры помогает при выборе других платформ инференса.

OpenAI-совместимость
спецификация chat/completions — достаточно сменить base_url в SDK
150/день
дневной лимит запросов для моделей низкой сложности (базовый уровень)
models:read
необходимое разрешение PAT или GITHUB_TOKEN в Actions

1. Что такое GitHub Models

GitHub Models — это API инференса и Playground от GitHub, позволявший вызывать модели разных вендоров с учётными данными GitHub вместо отдельных API-ключей провайдеров. Ключевые особенности:

  • Каталог моделей: OpenAI (GPT-4o, GPT-4.1 и др.), Meta Llama, DeepSeek, Microsoft Phi и другие — единый формат publisher/model_name
  • OpenAI-совместимость: эндпоинты следуют спецификации chat/completions — существующие OpenAI SDK / LangChain переключались с минимальными изменениями
  • Нативная интеграция с GitHub: объявите models: read в workflow Actions — встроенный токен вызывал модели
  • Многоуровневая тарификация: бесплатный уровень для экспериментов; pay-as-you-go или BYOK (свой ключ провайдера) при превышении лимитов

Это была отдельная продуктовая линия от GitHub Copilot: Copilot — помощь в IDE при написании кода; Models — встраивание LLM в собственные приложения, скрипты или CI-пайплайны. После вывода из эксплуатации GitHub рекомендует Azure AI Foundry для каталогов моделей и Copilot для AI-воркфлоу внутри GitHub.

2. Аутентификация: PAT и области доступа

Для вызова API инференса требовались учётные данные GitHub — два подхода:

Personal Access Token (локальные / серверные скрипты)

  1. Откройте GitHub → Settings → Developer settings → Personal access tokens
  2. Создайте Fine-grained PAT или Classic PAT, включив models:read (в Classic это область models)
  3. Передайте в заголовке запроса: Authorization: Bearer ghp_xxxx

Советы по безопасности

  • Храните PAT в переменных окружения или менеджере секретов — не коммитьте в репозиторий
  • Для Fine-grained PAT ограничьте доступ нужными репозиториями и задайте срок действия
  • В CI предпочитайте GITHUB_TOKEN долгоживущим PAT, чтобы снизить риск утечки

Встроенный токен GitHub Actions

После объявления разрешений в workflow GITHUB_TOKEN runner'а автоматически получал models:read — дополнительный secret не нужен:

permissions:
  contents: read
  models: read   # unlock GitHub Models inference

3. Способы вызова API

Основной эндпоинт: https://models.github.ai/inference/chat/completions. Формат ID модели: {publisher}/{model_name}, например openai/gpt-4o, meta/llama-3.3-70b-instruct.

3.1 Прямой вызов через curl

Минимальный пример запроса (пока сервис работал):

curl -L \
  -X POST \
  -H "Accept: application/vnd.github+json" \
  -H "Authorization: Bearer YOUR_GITHUB_PAT" \
  -H "X-GitHub-Api-Version: 2022-11-28" \
  -H "Content-Type: application/json" \
  https://models.github.ai/inference/chat/completions \
  -d '{
    "model": "openai/gpt-4o",
    "messages": [
      {"role": "user", "content": "Объясни GitHub Models API в трёх предложениях"}
    ]
  }'

Структура ответа совпадает с OpenAI chat/completions: choices[0].message.content — вывод модели. Поддерживались stream: true для потоковой передачи, temperature, max_tokens и другие стандартные параметры.

3.2 OpenAI Python / JS SDK

Из-за совместимости протокола достаточно сменить base_url и api_key:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["GITHUB_TOKEN"],
    base_url="https://models.github.ai/inference/",
)

completion = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[
        {"role": "system", "content": "Ты лаконичный технический ассистент"},
        {"role": "user", "content": "Чем отличаются GitHub Models и Copilot?"},
    ],
)
print(completion.choices[0].message.content)

Фреймворки с поддержкой кастомного OpenAI base URL — LangChain, Vercel AI SDK и другие — имели столь же низкую стоимость миграции. Это была одна из причин быстрого распространения GitHub Models в open-source-сообществе.

3.3 Интеграция с GitHub Actions

Типичные сценарии: автоматические сводки PR, классификация Issue, генерация changelog. Каркас workflow:

name: AI Triage
on:
  issues:
    types: [opened]

permissions:
  issues: write
  models: read

jobs:
  triage:
    runs-on: ubuntu-latest
    steps:
      - name: Classify issue with LLM
        env:
          GITHUB_TOKEN: ${{ secrets.GITHUB_TOKEN }}
        run: |
          curl -s https://models.github.ai/inference/chat/completions \
            -H "Content-Type: application/json" \
            -H "Authorization: Bearer $GITHUB_TOKEN" \
            -d '{
              "model": "openai/gpt-4o-mini",
              "messages": [{
                "role": "user",
                "content": "Классифицируй Issue как bug/feature/question: ..."
              }]
            }'

На уровне организации можно было политиками контролировать, какие репозитории и участники имеют доступ к Models — удобно для унификации AI-использования в команде без общего API-ключа вендора.

3.4 Запрос каталога моделей

Список доступных моделей:

curl -L \
  -H "Accept: application/vnd.github+json" \
  -H "Authorization: Bearer YOUR_GITHUB_PAT" \
  -H "X-GitHub-Api-Version: 2022-11-28" \
  https://models.github.ai/catalog/models

Возвращались метаданные по каждой модели: publisher, контекстное окно, поддержка streaming и др. При выборе модели сначала смотрите каталог, затем сверяйтесь с таблицей лимитов ниже — разные модели относятся к разным уровням сложности с сильно отличающимися квотами.

Разработчик анализирует ответы API и логи лимитов скорости при отладке вызовов GitHub Models
При 429 на бесплатном уровне сначала проверьте, какой лимит RPM/RPD исчерпан, затем решайте — ждать или переходить на платный план

4. Бесплатные квоты и лимиты скорости

Пока сервис работал, бесплатный API GitHub Models находился в публичном превью — GitHub предупреждал, что лимиты могут меняться. Бесплатный уровень не был безлимитным; ограничения действовали по четырём измерениям:

  • Запросов в минуту (RPM)
  • Запросов в день (RPD)
  • Лимит токенов на запрос (вход / выход считаются отдельно)
  • Параллельные запросы

Лимиты также зависели от тарифа подписки GitHub Copilot. Ниже — базовые значения из официальной документации GitHub (Copilot Free vs Enterprise):

Уровень модели Метрика Free Pro Pro+ Enterprise
Низкая сложность
GPT-4o-mini, Llama 3 и др.
В минуту 15 15 15 20
В день 150 150 300 450
Токены на запрос 8 000 вход + 4 000 выход (Enterprise: 8 000 выход)
Параллельность 5 5 5 8
Высокая сложность
GPT-4o, GPT-4.1 и др.
В минуту 10 10 10 15
В день 50 50 100 150
Токены на запрос 8 000 вход + 4 000 выход 16 000 вход + 8 000 выход
Параллельность 2 2 2 4
Embedding В минуту 15 15 15 20
В день 150 150 300 450
Токены на запрос 64 000
Параллельность 5 5 5 8
Модели рассуждений
DeepSeek-R1, Grok-3 и др.
В минуту ~1–2
В день ~8–15
Токены на запрос ~4 000 вход + 4 000 выход
Параллельность 1

Как читать таблицу

  • Дневной лимит упирается первым: на бесплатном аккаунте GPT-4o — всего 50 вызовов в день, пакетная обработка быстро исчерпывает квоту
  • Модели рассуждений крайне жёсткие: DeepSeek-R1 и аналоги — единицы запросов в день, подходит лишь для редких тестов
  • После 429 нужно ждать сброса: какой лимит сработал — такое окно ожидания (минутное или суточное)
  • Бесплатный уровень ≠ продакшен: официальная позиция — прототипирование, без SLA и гарантий выделенной ёмкости

В середине 2025 года GitHub открыл два пути сверх бесплатных лимитов:

Оплата по факту (Pay-as-you-go)

  • Включите pay-as-you-go в Billing организации / личного аккаунта (по умолчанию выключено)
  • Единица тарификации: token unit по $0.00001 / unit
  • У разных моделей свои множители (multiplier): входные токены GPT-4o — множитель 0.25, итоговая стоимость близка к прямому тарифу OpenAI
  • Разблокируются более высокие RPM/RPD, большие контекстные окна и больше параллельных запросов

Свой ключ (BYOK)

  • Привяжите свой ключ OpenAI или Azure AI — расход идёт на счёт провайдера
  • Участники команды не видят реальный API Key — GitHub хранит его безопасно
  • Тот же паттерн использования, что и у моделей GitHub в Playground, Actions и оценочных пайплайнах

Pay-as-you-go и BYOK подходили командам, уже работающим в экосистеме GitHub и желающим единый биллинг / права доступа. Если нужен только сырой API-пропускная способность, прямое подключение к провайдеру часто проще — см. Гайд по ценам и выбору LLM.

6. Лучшие практики

1. Определите сценарий: эксперименты — да, продакшен — нет

Бесплатный уровень лучше всего подходил для: личных side-project прототипов, демо open-source Action, сравнения выводов моделей и редких CI-задач (например, предложения заголовков PR). Не подходит для: пользовательских чат-продуктов, высоконагруженных бэкендов и цепочек, чувствительных к задержке.

2. Маршрутизация по уровням моделей

Разделяйте запросы по сложности: простая классификация / суммаризация — модели низкой сложности (GPT-4o-mini, Llama меньшего размера); GPT-4o или DeepSeek-R1 — только когда действительно нужно качество рассуждений. На бесплатном аккаунте GPT-4o — 50 вызовов в день; злоупотребление — и квота на сутки исчерпана.

3. Контроль бюджета токенов

Лимит на запрос: 8K вход + 4K выход. Длинные документы сначала суммируйте, затем рассуждайте; system prompt держите компактным; задайте max_tokens, чтобы не раздувать вывод. Embedding допускал 64K, но массовые задачи всё равно упирались в дневной лимит запросов.

4. Корректная обработка 429

Реализуйте экспоненциальный backoff; различайте RPM (ждать 60 секунд) и RPD (ждать до следующего дня или переходить на платный план); семафорами держите параллельность в пределах лимита (5 для низкой сложности, 2 для высокой).

5. GITHUB_TOKEN в Actions; короткоживущие PAT локально

В CI — нулевая настройка; для локальной разработки — Fine-grained PAT со сроком действия. Никогда не логируйте токены в вывод workflow — curl с -s и без set -x, печатающего заголовок Authorization.

6. Абстрагируйте слой инференса для простой миграции

Соберите base_url, model и api_key в переменные окружения или объект конфигурации. После вывода GitHub Models эта абстракция особенно важна — тот же код может указывать на OpenAI, Azure AI Foundry или собственный шлюз.

7. Миграция после вывода из эксплуатации (с 30.07.2026)

Официальные пути замены от GitHub:

Ваша задача Рекомендуемая замена Заметки по миграции
Мультимодельный каталог + корпоративный инференс Azure AI Foundry Ближе всего к исходному позиционированию GitHub Models по выбору моделей и масштабу хостинга
AI-воркфлоу внутри GitHub (PR, Issue) GitHub Copilot IDE / ревью PR / режим Agent — не «голый» API
OpenAI-совместимость, минимальная стоимость миграции OpenAI API Верните base_url на https://api.openai.com/v1 и замените API Key
Вызовы LLM в CI Actions + secrets провайдера Удалите models: read; используйте OPENAI_API_KEY и аналогичные secrets

Чеклист миграции с минимальными изменениями:

  1. Глобальный поиск models.github.ai — составьте список всех ссылок
  2. Замените base_url и способ аутентификации на нового провайдера
  3. Обновите ID моделей (например, openai/gpt-4ogpt-4o — по формату вендора)
  4. Удалите устаревший permissions: models: read из workflow
  5. Заново оцените лимиты и биллинг — иллюзии бесплатного уровня больше нет, планируйте под квоты новой платформы

FAQ

GitHub Models API ещё доступен?

Нет. С 30 июля 2026 года полностью выведен из эксплуатации — все эндпоинты отключены.

Как проходила аутентификация?

PAT с models:read или объявление models: read в Actions и использование GITHUB_TOKEN.

Какой была бесплатная квота?

Низкая сложность: ~15 RPM / 150 RPD; высокая сложность: ~10 RPM / 50 RPD; модели рассуждений — строже. Лимиты росли с тарифом Copilot.

Был ли API совместим с OpenAI?

Да — chat/completions. В SDK: base_url = https://models.github.ai/inference/.

Можно ли было использовать бесплатный уровень в продакшене?

Нет. Официальная позиция — эксперименты; без SLA, с жёсткими лимитами скорости.

Заключение

Как вызывать GitHub Models API? В одном предложении: аутентификация PAT + OpenAI-совместимый эндпоинт + лимиты по уровню модели — это был путь без порога входа для тестирования моделей, но дневные запросы на бесплатном уровне — от единиц до сотен, никогда не продакшен-решение.

Сервис закрыт, но уроки остаются: совместимые протоколы снижают стоимость миграции, в CI объявляйте минимальные права, слой инференса выносите в заменяемую конфигурацию. Следующий шаг — убрать models.github.ai из кода и выбрать Azure AI Foundry, прямой OpenAI или Copilot по сценарию — более системное сравнение в Гайд по ценам и выбору LLM.

LLM Agent запускает сборки Xcode? Подключите стабильный Cloud Mac как узел выполнения

API моделей ушли, среда сборки macOS осталась. Выделенный Mac mini M4 от Vuncloud — CI и Agent могут ночью гонять TestFlight без обрывов.

Смотреть тарифы Cloud Mac · Гайд по ценам и выбору LLM

Лимиты и сведения о выводе из эксплуатации — по официальной документации GitHub Models. Последнее обновление: 31 июля 2026 г.

Dev Notes · AI API

Shutdown GitHub Models · миграция инференса · Cloud Mac execution

OpenAI-совместимые вызовы · бесплатные лимиты · Actions · Azure AI Foundry

Смотреть тарифы Cloud Mac
Лимитированное предложение Смотреть тарифы