重要:GitHub Models 已於 2026 年 7 月 30 日全面退役
根據 GitHub 官方文件,Playground、模型目錄、推理 API 與 BYOK 均已下線,與 GitHub Copilot 是獨立服務。本文保留完整技術檔案供遷移參考;若你仍有指向 models.github.ai 的程式碼,請直接跳到文末遷移方案。
「用 GitHub 帳號就能調 GPT-4o?不用綁信用卡?」
2024 年底 GitHub 推出 GitHub Models 後,不少開發者把它當作「零成本 LLM 沙盒」:一個 PAT、一個 OpenAI 相容端點,腳本、CLI、GitHub Actions 都能跑。它確實降低了 AI 原型驗證的門檻——但免費層有硬限速、官方不推薦生產、且服務壽命比很多人預期的短。
這篇把 GitHub Models API 怎麼調、免費額度怎麼算、踩坑怎麼避、退役後去哪 一次講清。即便服務已下線,理解它的設計對選型其它推理平台仍有參考價值。
一、GitHub Models 是什麼
GitHub Models 是 GitHub 提供的 AI 推理 API 與 Playground,讓你用 GitHub 憑證(而非各家廠商獨立 API Key)呼叫多廠商模型。核心特點:
- 模型目錄:OpenAI(GPT-4o、GPT-4.1 等)、Meta Llama、DeepSeek、Microsoft Phi 等,統一以
publisher/model_name格式引用 - OpenAI 相容:端點遵循
chat/completions規範,現有 OpenAI SDK / LangChain 等可無縫切換 - GitHub 原生整合:Actions 工作流宣告
models: read即可用內建 token 調模型 - 分層計費:免費層面向實驗;超額可開通按量付費或 BYOK(自帶廠商密鑰)
它與 GitHub Copilot 是兩條產品線:Copilot 面向 IDE 內編碼輔助;Models 面向你把 LLM 嵌進自己的應用、腳本或 CI 流水線。退役後,GitHub 建議需要模型目錄的走 Azure AI Foundry,需要 GitHub 內 AI 工作流的走 Copilot。
二、鑑權:PAT 與權限範圍
呼叫推理 API 需要 GitHub 憑證,兩種方式:
Personal Access Token(本機 / 伺服器腳本)
- 打開 GitHub → Settings → Developer settings → Personal access tokens
- 建立 Fine-grained PAT 或 Classic PAT,勾選
models:read(Classic 版顯示為modelsscope) - 請求標頭攜帶:
Authorization: Bearer ghp_xxxx
安全提示
- PAT 只放環境變數或密鑰管理器,不要提交到儲存庫
- Fine-grained PAT 建議限定到必要儲存庫,並設過期時間
- CI 優先用
GITHUB_TOKEN,避免長期 PAT 洩露風險
GitHub Actions 內建 Token
工作流中宣告權限後,runner 自帶的 GITHUB_TOKEN 自動獲得 models:read,無需額外 secret:
permissions:
contents: read
models: read # 解鎖 GitHub Models 推理
三、API 呼叫方式
核心端點:https://models.github.ai/inference/chat/completions。模型 ID 格式 {publisher}/{model_name},例如 openai/gpt-4o、meta/llama-3.3-70b-instruct。
3.1 curl 直連
最簡請求範例(服務存續期間可用):
curl -L \
-X POST \
-H "Accept: application/vnd.github+json" \
-H "Authorization: Bearer YOUR_GITHUB_PAT" \
-H "X-GitHub-Api-Version: 2022-11-28" \
-H "Content-Type: application/json" \
https://models.github.ai/inference/chat/completions \
-d '{
"model": "openai/gpt-4o",
"messages": [
{"role": "user", "content": "用三句話解釋 GitHub Models API"}
]
}'
回應結構與 OpenAI chat/completions 一致:choices[0].message.content 即模型輸出。支援 stream: true 串流返回、temperature、max_tokens 等標準參數。
3.2 OpenAI Python / JS SDK
因為協定相容,改 base_url 和 api_key 即可:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["GITHUB_TOKEN"],
base_url="https://models.github.ai/inference/",
)
completion = client.chat.completions.create(
model="openai/gpt-4o",
messages=[
{"role": "system", "content": "你是簡潔的技術助手"},
{"role": "user", "content": "GitHub Models 和 Copilot 有什麼區別?"},
],
)
print(completion.choices[0].message.content)
LangChain、Vercel AI SDK 等凡支援自訂 OpenAI base URL 的框架,遷移成本同樣很低——這也是 GitHub Models 在開源社群快速傳播的原因。
3.3 GitHub Actions 整合
典型場景:PR 自動摘要、Issue 分類、changelog 生成。完整 workflow 骨架:
name: AI Triage
on:
issues:
types: [opened]
permissions:
issues: write
models: read
jobs:
triage:
runs-on: ubuntu-latest
steps:
- name: Classify issue with LLM
env:
GITHUB_TOKEN: ${{ secrets.GITHUB_TOKEN }}
run: |
curl -s https://models.github.ai/inference/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $GITHUB_TOKEN" \
-d '{
"model": "openai/gpt-4o-mini",
"messages": [{
"role": "user",
"content": "將以下 Issue 分類為 bug/feature/question:..."
}]
}'
組織級還可透過策略控制哪些儲存庫、哪些成員能存取 Models——適合在團隊內統一 AI 用量而不共享廠商 API Key。
3.4 模型目錄查詢
列出可用模型:
curl -L \
-H "Accept: application/vnd.github+json" \
-H "Authorization: Bearer YOUR_GITHUB_PAT" \
-H "X-GitHub-Api-Version: 2022-11-28" \
https://models.github.ai/catalog/models
返回各模型的 publisher、上下文視窗、是否支援 streaming 等元資料。選型時先查目錄,再對照下方速率限制表——不同模型歸屬不同複雜度檔位,限額差異很大。
四、免費額度與速率限制
GitHub Models 免費 API 處於公開預覽階段(存續期間),官方註明限額可能調整。免費層不是無限呼叫,而是按四個維度限速:
- 每分鐘請求數(RPM)
- 每天請求數(RPD)
- 單次請求 token 上限(輸入 / 輸出分開計)
- 並發請求數
限額還隨你的 GitHub Copilot 訂閱檔位浮動。下表為 GitHub 官方文件記載的基準值(Copilot Free 檔 vs Enterprise 檔):
| 模型檔位 | 指標 | Free | Pro | Pro+ | Enterprise |
|---|---|---|---|---|---|
| 低複雜度 GPT-4o-mini、Llama 3 等 |
每分鐘 | 15 | 15 | 15 | 20 |
| 每天 | 150 | 150 | 300 | 450 | |
| 單次 token | 8,000 輸入 + 4,000 輸出(Enterprise 輸出 8,000) | ||||
| 並發 | 5 | 5 | 5 | 8 | |
| 高複雜度 GPT-4o、GPT-4.1 等 |
每分鐘 | 10 | 10 | 10 | 15 |
| 每天 | 50 | 50 | 100 | 150 | |
| 單次 token | 8,000 輸入 + 4,000 輸出 | 16,000 輸入 + 8,000 輸出 | |||
| 並發 | 2 | 2 | 2 | 4 | |
| Embedding | 每分鐘 | 15 | 15 | 15 | 20 |
| 每天 | 150 | 150 | 300 | 450 | |
| 單次 token | 64,000 | ||||
| 並發 | 5 | 5 | 5 | 8 | |
| 推理模型 DeepSeek-R1、Grok-3 等 |
每分鐘 | 約 1–2 | |||
| 每天 | 約 8–15 | ||||
| 單次 token | 約 4,000 輸入 + 4,000 輸出 | ||||
| 並發 | 1 | ||||
讀表要點
- 日限額最先撞牆:免費帳戶調 GPT-4o 一天只有 50 次,跑批次處理很容易觸頂
- 推理模型極緊:DeepSeek-R1 類每天個位數請求,只適合偶爾試效果
- 觸發 429 後需等待:哪條限速命中就等對應視窗重置(分鐘級或日級)
- 免費層 ≠ 生產許可:官方定位是原型驗證,無 SLA、無專屬容量保障
五、付費用量與 BYOK
2025 年中 GitHub 開放了兩條超出免費限額的路徑:
按量付費(Pay-as-you-go)
- 在組織 / 個人帳戶 Billing 中主動開通付費用量(預設關閉)
- 計費單位:token unit,單價 $0.00001 / unit
- 不同模型有乘數(multiplier):GPT-4o 輸入 token 乘數 0.25,折算後與 OpenAI 直連價基本一致
- 解鎖更高 RPM/RPD、更大上下文視窗、更多並發
自帶密鑰(BYOK)
- 綁定你自己的 OpenAI 或 Azure AI 密鑰,用量計入廠商帳戶
- 團隊成員無需看到真實 API Key,由 GitHub 安全託管
- 在 Playground、Actions、評估流程中與 GitHub 託管模型用法一致
付費與 BYOK 適合「已在 GitHub 生態內、希望統一帳單 / 權限」的團隊。若你只需要裸 API 吞吐,直連廠商往往更直接——詳見 大模型定價選型指南。
六、最佳實踐
1. 明確場景:實驗 yes,生產 no
免費層最適合:個人 side project 原型、開源 Action 演示、對比不同模型輸出、CI 裡低頻輔助任務(如 PR 標題建議)。不適合:面向使用者的聊天產品、高 QPS 後端、延遲敏感鏈路。
2. 模型分級路由
把請求按複雜度分流:簡單分類 / 摘要用低複雜度模型(GPT-4o-mini、小參數 Llama),只有真正需要推理品質時才調 GPT-4o 或 DeepSeek-R1。免費帳戶 GPT-4o 日限 50 次,濫用一天就沒額度。
3. 控制 token 預算
單次上限 8K 輸入 + 4K 輸出。長文件先摘要再推理;system prompt 保持精簡;設 max_tokens 防止輸出失控。Embedding 雖允許 64K,但大批量仍受日請求數約束。
4. 優雅處理 429
實作指數退避重試;區分 RPM(等 60 秒)與 RPD(等次日或切付費);並發用信號量控制在限額內(低複雜度 5、高複雜度 2)。
5. Actions 裡用 GITHUB_TOKEN,本機用短期 PAT
CI 場景零配置;本機開發用 Fine-grained PAT + 過期時間。絕不要把 token 寫進 workflow 日誌——curl 加 -s 並避免 set -x 列印 Authorization 標頭。
6. 抽象推理層,便於遷移
把 base_url、model、api_key 收口到環境變數或配置物件。GitHub Models 已退役,這層抽象現在顯得尤為重要——同一套程式碼可指向 OpenAI、Azure AI Foundry 或自建閘道。
七、退役後的遷移方案(2026-07-30 起)
GitHub 官方給出的替代路徑:
| 你的需求 | 推薦替代 | 遷移要點 |
|---|---|---|
| 多模型目錄 + 企業級推理 | Azure AI Foundry | 模型選擇與託管規模最接近原 GitHub Models 定位 |
| GitHub 內 AI 工作流(PR、Issue) | GitHub Copilot | IDE / PR 審查 / Agent 模式,非裸 API |
| OpenAI 相容、最低遷移成本 | OpenAI API | 把 base_url 改回 https://api.openai.com/v1,換 API Key |
| CI 中 LLM 呼叫 | Actions + 廠商 Secret | 刪除 models: read,改用 OPENAI_API_KEY 等 secret |
最小改動遷移 checklist:
- 全域搜尋
models.github.ai,列出所有引用 - 替換
base_url與鑑權方式為新的提供商 - 更新模型 ID(如
openai/gpt-4o→gpt-4o,視廠商格式而定) - 刪除 workflow 中已無意義的
permissions: models: read - 重新評估速率限制與計費——免費層幻覺不再存在,需按新平台配額規劃
FAQ
GitHub Models API 現在還能用嗎?
不能。2026 年 7 月 30 日起全面退役,所有端點下線。
如何鑑權?
PAT 帶 models:read,或 Actions 宣告 models: read 使用 GITHUB_TOKEN。
免費額度多少?
低複雜度約 15 RPM / 150 RPD;高複雜度約 10 RPM / 50 RPD;推理模型更嚴。隨 Copilot 檔位上浮。
與 OpenAI API 相容嗎?
相容 chat/completions。SDK 改 base_url 為 https://models.github.ai/inference/ 即可。
免費層能用於生產嗎?
不能。官方定位為實驗;無 SLA,限速嚴格。
結語
GitHub Models API 如何呼叫?一句話:PAT 鑑權 + OpenAI 相容端點 + 按模型檔位限速——它曾是零門檻試模型的捷徑,但免費層日請求個位數到百次量級,從來都不是生產方案。
服務雖已退役,它留下的經驗仍然有用:用相容協定降低遷移成本、在 CI 裡宣告最小權限、把推理層抽象成可替換配置。下一步該把 models.github.ai 從程式碼裡清乾淨,按場景選 Azure AI Foundry、OpenAI 直連或 Copilot——更系統的對比可參考 大模型定價選型指南。
LLM Agent 要跑 Xcode 建置?配穩定 Cloud Mac 執行節點
模型 API 遷走了,macOS 建置環境還在。Vuncloud 獨享 Mac mini M4,讓 CI / Agent 過夜跑 TestFlight 不斷線。
相關閱讀
- 2026 大模型 API 價格與選型指南:GPT-5.5、Claude、Gemini、DeepSeek 一篇講透
- GPT-5.6 Sol、Terra、Luna 怎麼選?性能、價格、速度全面對比
- Codex 週限額耗盡怎麼辦:7 種修復方案、限額機制與替代 API(2026)
- 2026 開發者 AI 三層架構:AI Coding、Personal AI 與 Agent 編排完整指南
限額與退役資訊以 GitHub Models 官方文件 為準。最後更新:2026 年 7 月 31 日。