xiaowei-system/skills/devops/provider-tiering/references/nvidia-nim-eol-sweep.md

2.6 KiB
Raw Blame History

NVIDIA NIM 模型易失性与全量 Sweep 方法论

Created: 2026-07-27 Context: 大规模 EOL 事件 — step-3.5-flash / m2.7 / mistral-large-3-675b 等 16+ 个模型同日 EOL

问题本质

NewAPI 的免费模型全部来自 NVIDIA NIM (NVIDIA Inference Microservices)。NVIDIA 不定期退役模型HTTP 410 Gone无提前通知

2026-07-27 是首次大规模退役16+ 个曾经可用的模型在同一天或最近几天全部 EOL。

症状

  • 调用返回 HTTP 410: The model 'X' has reached its end of life on Y and is no longer available
  • HTTP 404: openai_error — 模型已从 NVIDIA 列表下架
  • HTTP 000 — 模型超时(可能 EOL / 可能极慢 / 可能 NVIDIA 临时问题)

全量 Sweep 方法论

当发现常用模型大面积失效时,执行一次系统性的模型探索:

第一步:获取全量模型列表

curl -s http://127.0.0.1:3000/v1/models \
  -H "Authorization: Bearer sk-0ExNiLblJvIWBDpkS50fwOBw4MmqLyKdHJK5iQtlw9dOMWBP" \
  | python3 -c "import json,sys; [print(m['id']) for m in json.load(sys.stdin)['data']]"

第二步:分类 + 系统性测试

  1. 已知候选 — 之前的 active 模型列表(从 model-health.json / 旧 catalog 获取)
  2. 按成熟度筛选 — 优先测知名厂商meta/llama, mistralai, openai/gpt-oss, minimaxai, deepseek-ai, nvidia/nemotron, google/gemma, qwen
  3. 按规模分层 — 每个厂商测大小两端(如 llama-3.1-8b + llama-3.1-70b

第三步:测试命令模板

# 单模型快速测试(仅 HTTP 状态码)
curl -s -o /dev/null -w "%{http_code}" --max-time 10 \
  http://127.0.0.1:3000/v1/chat/completions \
  -H "Authorization: Bearer sk-0ExNiLblJvIWBDpkS50fwOBw4MmqLyKdHJK5iQtlw9dOMWBP" \
  -H "Content-Type: application/json" \
  -d '{"model":"<model_id>","messages":[{"role":"user","content":"hi"}],"max_tokens":5}'

返回码含义:

  • 200 可用
  • 410 EOL永久不可用
  • 404 不存在(可能下架)
  • 000 / 28⚠️ 超时(可能极慢或临时问题,用更长超时重试)

第四步:更新

  1. 成功后更新 model-health.py 的测试列表
  2. 更新 newapi-model-catalog.md 的可用/不可用清单
  3. 更新 provider-tiering SKILL.md 的推荐矩阵和 MOA preset

注意事项

  • 不要假设"今天能用明天也能用" — NVIDIA NIM 没有 SLA
  • 主力模型选 1-2 个最稳的(目前 minimax-m3 最持久)
  • 健康巡检每 6h 自动检测,但仅测已知列表 — 不会自动发现新模型
  • model-health.json 显示 stable == 0 时,必须手动 sweep