跳轉至

NVIDIA NIM

概述

NVIDIA NIM (NVIDIA Inference Microservices) 是 NVIDIA 的 AI 推理微服務,透過 build.nvidia.com 免費提供 80+ 個領先模型(如 DeepSeek、Qwen、GLM、Kimi、Llama、Nemotron)的 API 存取。兼容 openai 接口,無需信用卡,適合原型開發、測試及個人/研究用途。

免費 API 存取

  1. 註冊 NVIDIA Developer Program 並登入 build.nvidia.com
  2. 在右上角頭像 → API Keys → Generate API Key,取得 nvapi- 格式的 Key
  3. 使用 OpenAI SDK 呼叫,base_url 為 https://integrate.api.nvidia.com/v1
from openai import OpenAI
client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-...")
response = client.chat.completions.create(model="deepseek-ai/deepseek-v4", messages=[...])

免費額度與限制

  • 多數模型完全免費,無需 credits
  • Rate limit 約 40 RPM(視流量與模型而定),高峰期可能更嚴格
  • 主要供開發/原型使用,不保證 SLA;生產環境建議自托管 NIM 或購買 NVIDIA AI Enterprise
  • 遇到 429 時可稍候重試,或向 NVIDIA 申請提高限流

與 LiteLLM 整合

litellm 原生支援 NVIDIA NIM,使用 nvidia_nim/ 前綴即可路由。透過環境變數 NVIDIA_NIM_API_KEY 設定 Key,於 config.yaml 中加入模型,並搭配 drop_params: true 避免非 OpenAI 工具傳入參數出錯。

model_list:
  - model_name: deepseek-v4
    litellm_params:
      model: nvidia_nim/deepseek-ai/deepseek-v4
      api_key: os.environ/NVIDIA_NIM_API_KEY

Docker 部署與 UI 設定

若以 docker 部署 LiteLLM(例如 oracle-cloud VPS),需在 docker-compose.yml 設定 NVIDIA_NIM_API_KEYSTORE_MODEL_IN_DB=True,才能在 LiteLLM UI 新增模型。別忘了在 Oracle Cloud Security List 開啟 4000 port。

Virtual Keys 應用

LiteLLM 的 Virtual Keys 可建立多個子 Key,用於浸沉翻譯或不同工具(如 SillyTavern),可設定預算、RPM/TPM 限制並綁定特定模型(例如 Groq 的 llama 模型),方便管理與安全控管。

相關資源

  • NVIDIA Developer NIM
  • Docker 自托管 NIM:下載容器在自己的 GPU 上運行,無 API 限制
  • NGC (NVIDIA GPU Cloud) 提供容器與模型下載

Sources

See Also