Unity Gateway 預算與用量:成本歸屬、封鎖與紀錄限制
閱讀原指南的預算、速率限制、成本管理與觀測紀錄內容。
成本歸屬與用量紀錄
成本管理Cost Management文件已說明
文件明載的計費與紀錄
| 項目 | 官方說明 |
|---|---|
| 模型推論 | Foundation Model APIs 提供按 token 或預配置吞吐量等方式;外部模型估算依 token 與供應商公開價格計算,實際費用以供應商帳單為準。 |
| 政策評估 | 內建 Service Policies 不另收政策費;使用模型評判的檢查,按評估模型呼叫計費,包含政策提示、輸出格式要求、受評內容與評估回應的 token。 |
| 用量與費用對帳 | Databricks 實際計費用量以 system.billing.usage 為依據;外部供應商實際費用以其帳單為依據。各頁面與系統表更新頻率不同,當下數字可能不同。 |
用量表預設查詢者須同時具備 account admin 與 metastore admin 角色,亦可由管理者另行授權。對超過 1 MiB 的非串流、非 embedding 回應,Gateway 不追蹤 token 用量。
預算範圍與封鎖限制
預算與支出限制Budgets and Spend Limits部分 Beta
可設定共用或每人每月門檻,選擇寄出警示或封鎖後續用量;也可替特定人員與群組設例外額度。範圍含經 Gateway 的按 token 用量、ai_query 與 Genie;外部模型費用可選擇納入。
導入前看這裡:封鎖採近即時估算,不中斷執行中請求,也不是最終帳單的絕對上限。預算不涵蓋 provisioned throughput 或繞過 Gateway 的獨立 Serving 流量。外部模型納入預算為 Beta,須另行啟用;預算比對使用服務標籤,不使用請求標籤。
速率限制
速率限制Rate Limits文件已說明
模型服務可限制每分鐘請求數(QPM)與 token 數(TPM);MCP 服務限制 QPM。可設定整體服務、預設每人及特定使用者或群組規則;群組速率額度由成員共用。
導入前看這裡:預設不設限。超限回傳 HTTP 429,官方建議採指數退避重試。用量在回應後計入,且各服務執行個體分別限流,短時間可能略超門檻。每服務最多 20 筆規則,其中最多 5 筆為群組規則。
追蹤與內容紀錄
追蹤與可觀測性Tracing and Observability統一追蹤表 Beta
用量表 system.ai_gateway.usage 記錄用量、耗時與呼叫者;inference tables 逐一為模型服務記錄請求與回應。官方建議新部署採統一追蹤表:由 metastore 管理者一次配置,集中同 metastore 工作區的模型與 MCP 服務活動,每列是一個 OpenTelemetry span。
導入前看這裡:兩種紀錄都盡力交付,401、403、429、500 請求可能未記錄。統一追蹤單一屬性超過 3 MiB 會截斷;跨步驟共用 trace ID 尚待提供。其他使用者需另外取得表與父層權限;官方建議授權前加 ABAC 列篩選。統一追蹤不能取代 Databricks 稽核紀錄。
Inference Tables 只能在 external storage catalog 建立;不支援 Default storage catalog 或以 private endpoint 保護的儲存體,也不能指定既存表。超過 10 MiB 的請求或回應不會記錄,會以 logging_error_codes 標示;資料交付不保證完整。[41] Inference Tables 與限制 ↗
原始文件與延伸閱讀
本頁取樣原指南既有內容與其官方技術文件引用。原指南文件核對日為 2026-09-15,本頁重組日為 2026-09-15;本次未重新查核外部文件。
- 預算、通知與用量封鎖 ↗文件 · 本站核對 2026-09-15
- 速率限制 ↗文件 · 本站核對 2026-09-15
- AI 成本分析 ↗文件 · 本站核對 2026-09-15
- Service Policies ↗文件 · 本站核對 2026-09-15
- Model Serving 與推論容量 ↗文件 · 本站核對 2026-09-15
- 用量追蹤、儀表板與計費 ↗官方文件 · 本站核對 2026-09-15
- 統一追蹤表 ↗文件 · 本站核對 2026-09-15
- 可觀測性工具選擇 ↗文件 · 本站核對 2026-09-15
- Inference Tables 與限制 ↗官方文件 · 本站核對 2026-09-15