NVIDIA Inference Microservices
簡介¶
NVIDIA Inference Microservices(NIM)是 NVIDIA 推出的容器化 AI 推理微服務,讓開發者能在任何支援 NVIDIA GPU 的環境(雲端、資料中心或工作站)中快速部署大型語言模型,並提供標準化 API 介面。NIM 背後由 NVIDIA DGX Cloud 等基礎設施托管,效能優異,且支援 openai 相容的呼叫格式,可無縫整合進現有工具鏈。
免費 API 平台¶
NVIDIA 提供免費的 NIM API 存取,位於 build.nvidia.com,可瀏覽 80+ 個領先模型,包括 DeepSeek、GLM、Kimi、Qwen、Llama、Nemotron 等。存取方式如下:
- 註冊 NVIDIA Developer Program 帳號並登入。
- 在右上角頭像 → API Keys → Generate API Key,取得
nvapi-開頭的 Key。 - 以 OpenAI SDK 呼叫,
base_url設為https://integrate.api.nvidia.com/v1。
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-你的key"
)
response = client.chat.completions.create(
model="deepseek-ai/deepseek-v4",
messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)
此免費方案不需信用卡,適合原型開發、測試與個人研究,詳細資訊可見 nvidia-free-nim-api-access。
與 LiteLLM 整合¶
litellm 與 litellm-router 對 NVIDIA NIM 有原生支援,只需在模型名稱加上 nvidia_nim/ 前綴即可路由到官方 API。例如:
model_list:
- model_name: deepseek-v4
litellm_params:
model: nvidia_nim/deepseek-ai/deepseek-v4
api_key: os.environ/NVIDIA_NIM_API_KEY
環境變數設定:
export NVIDIA_NIM_API_KEY="nvapi-你的完整key"
若以 docker 部署 LiteLLM,建議在 docker-compose.yml 中加入 NVIDIA_NIM_API_KEY 與 STORE_MODEL_IN_DB=True,方便在 UI 中透過 LLM Credentials 管理模型。設定完成後,即可在 Claude Code、SillyTavern、Cursor 等工具中,將 base_url 指向 LiteLLM Proxy(例如 http://localhost:4000),並使用自訂的 Master Key 存取。
限流與限制¶
免費 NIM API 目前約有 40 requests per minute(RPM) 的限制,且不保證 SLA。遇到 HTTP 429 時,建議等待片刻重試、切換其他模型,或向 NVIDIA 論壇申請提高限流。免費方案主要用途為開發與測試,重度或生產環境建議自托管 NIM 或購買 NVIDIA AI Enterprise 授權。在 LiteLLM 設定中,加入 drop_params: true 可避免非 OpenAI 格式的額外參數造成錯誤。
自托管 NIM¶
NVIDIA 允許免費下載 NIM 微服務容器,在自己的 GPU 上執行,如此便沒有 API 呼叫次數限制。開發者可從 NGC(NVIDIA GPU Cloud)取得容器與模型,並按官方文件(developer.nvidia.com/nim)自行部署。此方案特別適合需要高吞吐、低延遲或資料私密性的ai-agent應用。