Vuncloud 部落格
← 返回機房手記專欄

GitHub Models API 如何呼叫?免費額度、限制與最佳實踐(2026)

PAT 鑑權 · OpenAI 相容端點 · 免費速率限制 · GitHub Actions · 付費與 BYOK · 退役遷移約 12 分鐘閱讀

開發者在終端呼叫 GitHub Models API,螢幕顯示程式碼與 AI 模型推理請求

重要:GitHub Models 已於 2026 年 7 月 30 日全面退役

根據 GitHub 官方文件,Playground、模型目錄、推理 API 與 BYOK 均已下線,與 GitHub Copilot 是獨立服務。本文保留完整技術檔案供遷移參考;若你仍有指向 models.github.ai 的程式碼,請直接跳到文末遷移方案

「用 GitHub 帳號就能調 GPT-4o?不用綁信用卡?」

2024 年底 GitHub 推出 GitHub Models 後,不少開發者把它當作「零成本 LLM 沙盒」:一個 PAT、一個 OpenAI 相容端點,腳本、CLI、GitHub Actions 都能跑。它確實降低了 AI 原型驗證的門檻——但免費層有硬限速、官方不推薦生產、且服務壽命比很多人預期的短。

這篇把 GitHub Models API 怎麼調、免費額度怎麼算、踩坑怎麼避、退役後去哪 一次講清。即便服務已下線,理解它的設計對選型其它推理平台仍有參考價值。

OpenAI 相容
chat/completions 規範,SDK 改 base_url 即用
150/天
免費帳戶低複雜度模型日請求上限(基準檔)
models:read
PAT 或 Actions GITHUB_TOKEN 所需權限

一、GitHub Models 是什麼

GitHub Models 是 GitHub 提供的 AI 推理 API 與 Playground,讓你用 GitHub 憑證(而非各家廠商獨立 API Key)呼叫多廠商模型。核心特點:

  • 模型目錄:OpenAI(GPT-4o、GPT-4.1 等)、Meta Llama、DeepSeek、Microsoft Phi 等,統一以 publisher/model_name 格式引用
  • OpenAI 相容:端點遵循 chat/completions 規範,現有 OpenAI SDK / LangChain 等可無縫切換
  • GitHub 原生整合:Actions 工作流宣告 models: read 即可用內建 token 調模型
  • 分層計費:免費層面向實驗;超額可開通按量付費或 BYOK(自帶廠商密鑰)

它與 GitHub Copilot 是兩條產品線:Copilot 面向 IDE 內編碼輔助;Models 面向你把 LLM 嵌進自己的應用、腳本或 CI 流水線。退役後,GitHub 建議需要模型目錄的走 Azure AI Foundry,需要 GitHub 內 AI 工作流的走 Copilot。

二、鑑權:PAT 與權限範圍

呼叫推理 API 需要 GitHub 憑證,兩種方式:

Personal Access Token(本機 / 伺服器腳本)

  1. 打開 GitHub → Settings → Developer settings → Personal access tokens
  2. 建立 Fine-grained PAT 或 Classic PAT,勾選 models:read(Classic 版顯示為 models scope)
  3. 請求標頭攜帶:Authorization: Bearer ghp_xxxx

安全提示

  • PAT 只放環境變數或密鑰管理器,不要提交到儲存庫
  • Fine-grained PAT 建議限定到必要儲存庫,並設過期時間
  • CI 優先用 GITHUB_TOKEN,避免長期 PAT 洩露風險

GitHub Actions 內建 Token

工作流中宣告權限後,runner 自帶的 GITHUB_TOKEN 自動獲得 models:read,無需額外 secret:

permissions:
  contents: read
  models: read   # 解鎖 GitHub Models 推理

三、API 呼叫方式

核心端點:https://models.github.ai/inference/chat/completions。模型 ID 格式 {publisher}/{model_name},例如 openai/gpt-4ometa/llama-3.3-70b-instruct

3.1 curl 直連

最簡請求範例(服務存續期間可用):

curl -L \
  -X POST \
  -H "Accept: application/vnd.github+json" \
  -H "Authorization: Bearer YOUR_GITHUB_PAT" \
  -H "X-GitHub-Api-Version: 2022-11-28" \
  -H "Content-Type: application/json" \
  https://models.github.ai/inference/chat/completions \
  -d '{
    "model": "openai/gpt-4o",
    "messages": [
      {"role": "user", "content": "用三句話解釋 GitHub Models API"}
    ]
  }'

回應結構與 OpenAI chat/completions 一致:choices[0].message.content 即模型輸出。支援 stream: true 串流返回、temperaturemax_tokens 等標準參數。

3.2 OpenAI Python / JS SDK

因為協定相容,改 base_urlapi_key 即可:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["GITHUB_TOKEN"],
    base_url="https://models.github.ai/inference/",
)

completion = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[
        {"role": "system", "content": "你是簡潔的技術助手"},
        {"role": "user", "content": "GitHub Models 和 Copilot 有什麼區別?"},
    ],
)
print(completion.choices[0].message.content)

LangChain、Vercel AI SDK 等凡支援自訂 OpenAI base URL 的框架,遷移成本同樣很低——這也是 GitHub Models 在開源社群快速傳播的原因。

3.3 GitHub Actions 整合

典型場景:PR 自動摘要、Issue 分類、changelog 生成。完整 workflow 骨架:

name: AI Triage
on:
  issues:
    types: [opened]

permissions:
  issues: write
  models: read

jobs:
  triage:
    runs-on: ubuntu-latest
    steps:
      - name: Classify issue with LLM
        env:
          GITHUB_TOKEN: ${{ secrets.GITHUB_TOKEN }}
        run: |
          curl -s https://models.github.ai/inference/chat/completions \
            -H "Content-Type: application/json" \
            -H "Authorization: Bearer $GITHUB_TOKEN" \
            -d '{
              "model": "openai/gpt-4o-mini",
              "messages": [{
                "role": "user",
                "content": "將以下 Issue 分類為 bug/feature/question:..."
              }]
            }'

組織級還可透過策略控制哪些儲存庫、哪些成員能存取 Models——適合在團隊內統一 AI 用量而不共享廠商 API Key。

3.4 模型目錄查詢

列出可用模型:

curl -L \
  -H "Accept: application/vnd.github+json" \
  -H "Authorization: Bearer YOUR_GITHUB_PAT" \
  -H "X-GitHub-Api-Version: 2022-11-28" \
  https://models.github.ai/catalog/models

返回各模型的 publisher、上下文視窗、是否支援 streaming 等元資料。選型時先查目錄,再對照下方速率限制表——不同模型歸屬不同複雜度檔位,限額差異很大。

開發者審查 API 回應資料與速率限制日誌,排查 GitHub Models 呼叫問題
免費層遇 429 時,先查 RPM/RPD 哪條觸頂,再決定是否排隊或升級

四、免費額度與速率限制

GitHub Models 免費 API 處於公開預覽階段(存續期間),官方註明限額可能調整。免費層不是無限呼叫,而是按四個維度限速:

  • 每分鐘請求數(RPM)
  • 每天請求數(RPD)
  • 單次請求 token 上限(輸入 / 輸出分開計)
  • 並發請求數

限額還隨你的 GitHub Copilot 訂閱檔位浮動。下表為 GitHub 官方文件記載的基準值(Copilot Free 檔 vs Enterprise 檔):

模型檔位 指標 Free Pro Pro+ Enterprise
低複雜度
GPT-4o-mini、Llama 3 等
每分鐘 15 15 15 20
每天 150 150 300 450
單次 token 8,000 輸入 + 4,000 輸出(Enterprise 輸出 8,000)
並發 5 5 5 8
高複雜度
GPT-4o、GPT-4.1 等
每分鐘 10 10 10 15
每天 50 50 100 150
單次 token 8,000 輸入 + 4,000 輸出 16,000 輸入 + 8,000 輸出
並發 2 2 2 4
Embedding 每分鐘 15 15 15 20
每天 150 150 300 450
單次 token 64,000
並發 5 5 5 8
推理模型
DeepSeek-R1、Grok-3 等
每分鐘 約 1–2
每天 約 8–15
單次 token 約 4,000 輸入 + 4,000 輸出
並發 1

讀表要點

  • 日限額最先撞牆:免費帳戶調 GPT-4o 一天只有 50 次,跑批次處理很容易觸頂
  • 推理模型極緊:DeepSeek-R1 類每天個位數請求,只適合偶爾試效果
  • 觸發 429 後需等待:哪條限速命中就等對應視窗重置(分鐘級或日級)
  • 免費層 ≠ 生產許可:官方定位是原型驗證,無 SLA、無專屬容量保障

2025 年中 GitHub 開放了兩條超出免費限額的路徑:

按量付費(Pay-as-you-go)

  • 在組織 / 個人帳戶 Billing 中主動開通付費用量(預設關閉)
  • 計費單位:token unit,單價 $0.00001 / unit
  • 不同模型有乘數(multiplier):GPT-4o 輸入 token 乘數 0.25,折算後與 OpenAI 直連價基本一致
  • 解鎖更高 RPM/RPD、更大上下文視窗、更多並發

自帶密鑰(BYOK)

  • 綁定你自己的 OpenAI 或 Azure AI 密鑰,用量計入廠商帳戶
  • 團隊成員無需看到真實 API Key,由 GitHub 安全託管
  • 在 Playground、Actions、評估流程中與 GitHub 託管模型用法一致

付費與 BYOK 適合「已在 GitHub 生態內、希望統一帳單 / 權限」的團隊。若你只需要裸 API 吞吐,直連廠商往往更直接——詳見 大模型定價選型指南

六、最佳實踐

1. 明確場景:實驗 yes,生產 no

免費層最適合:個人 side project 原型、開源 Action 演示、對比不同模型輸出、CI 裡低頻輔助任務(如 PR 標題建議)。不適合:面向使用者的聊天產品、高 QPS 後端、延遲敏感鏈路。

2. 模型分級路由

把請求按複雜度分流:簡單分類 / 摘要用低複雜度模型(GPT-4o-mini、小參數 Llama),只有真正需要推理品質時才調 GPT-4o 或 DeepSeek-R1。免費帳戶 GPT-4o 日限 50 次,濫用一天就沒額度。

3. 控制 token 預算

單次上限 8K 輸入 + 4K 輸出。長文件先摘要再推理;system prompt 保持精簡;設 max_tokens 防止輸出失控。Embedding 雖允許 64K,但大批量仍受日請求數約束。

4. 優雅處理 429

實作指數退避重試;區分 RPM(等 60 秒)與 RPD(等次日或切付費);並發用信號量控制在限額內(低複雜度 5、高複雜度 2)。

5. Actions 裡用 GITHUB_TOKEN,本機用短期 PAT

CI 場景零配置;本機開發用 Fine-grained PAT + 過期時間。絕不要把 token 寫進 workflow 日誌——curl 加 -s 並避免 set -x 列印 Authorization 標頭。

6. 抽象推理層,便於遷移

base_urlmodelapi_key 收口到環境變數或配置物件。GitHub Models 已退役,這層抽象現在顯得尤為重要——同一套程式碼可指向 OpenAI、Azure AI Foundry 或自建閘道。

七、退役後的遷移方案(2026-07-30 起)

GitHub 官方給出的替代路徑:

你的需求 推薦替代 遷移要點
多模型目錄 + 企業級推理 Azure AI Foundry 模型選擇與託管規模最接近原 GitHub Models 定位
GitHub 內 AI 工作流(PR、Issue) GitHub Copilot IDE / PR 審查 / Agent 模式,非裸 API
OpenAI 相容、最低遷移成本 OpenAI API base_url 改回 https://api.openai.com/v1,換 API Key
CI 中 LLM 呼叫 Actions + 廠商 Secret 刪除 models: read,改用 OPENAI_API_KEY 等 secret

最小改動遷移 checklist:

  1. 全域搜尋 models.github.ai,列出所有引用
  2. 替換 base_url 與鑑權方式為新的提供商
  3. 更新模型 ID(如 openai/gpt-4ogpt-4o,視廠商格式而定)
  4. 刪除 workflow 中已無意義的 permissions: models: read
  5. 重新評估速率限制與計費——免費層幻覺不再存在,需按新平台配額規劃

FAQ

GitHub Models API 現在還能用嗎?

不能。2026 年 7 月 30 日起全面退役,所有端點下線。

如何鑑權?

PAT 帶 models:read,或 Actions 宣告 models: read 使用 GITHUB_TOKEN

免費額度多少?

低複雜度約 15 RPM / 150 RPD;高複雜度約 10 RPM / 50 RPD;推理模型更嚴。隨 Copilot 檔位上浮。

與 OpenAI API 相容嗎?

相容 chat/completions。SDK 改 base_urlhttps://models.github.ai/inference/ 即可。

免費層能用於生產嗎?

不能。官方定位為實驗;無 SLA,限速嚴格。

結語

GitHub Models API 如何呼叫?一句話:PAT 鑑權 + OpenAI 相容端點 + 按模型檔位限速——它曾是零門檻試模型的捷徑,但免費層日請求個位數到百次量級,從來都不是生產方案。

服務雖已退役,它留下的經驗仍然有用:用相容協定降低遷移成本、在 CI 裡宣告最小權限、把推理層抽象成可替換配置。下一步該把 models.github.ai 從程式碼裡清乾淨,按場景選 Azure AI Foundry、OpenAI 直連或 Copilot——更系統的對比可參考 大模型定價選型指南

LLM Agent 要跑 Xcode 建置?配穩定 Cloud Mac 執行節點

模型 API 遷走了,macOS 建置環境還在。Vuncloud 獨享 Mac mini M4,讓 CI / Agent 過夜跑 TestFlight 不斷線。

查看 Cloud Mac 方案 · 大模型定價選型指南

限額與退役資訊以 GitHub Models 官方文件 為準。最後更新:2026 年 7 月 31 日。

機房手記 · AI API

GitHub Models 退役 · 推理層遷移 · Cloud Mac 執行

OpenAI 相容呼叫 · 免費限速 · Actions 整合 · Azure AI Foundry

查看 Cloud Mac 方案
限時優惠 點擊查看方案