2.6 KiB
2.6 KiB
NVIDIA NIM 模型易失性与全量 Sweep 方法论
Created: 2026-07-27 Context: 大规模 EOL 事件 — step-3.5-flash / m2.7 / mistral-large-3-675b 等 16+ 个模型同日 EOL
问题本质
NewAPI 的免费模型全部来自 NVIDIA NIM (NVIDIA Inference Microservices)。NVIDIA 不定期退役模型(HTTP 410 Gone),无提前通知。
2026-07-27 是首次大规模退役:16+ 个曾经可用的模型在同一天或最近几天全部 EOL。
症状
- 调用返回
HTTP 410: The model 'X' has reached its end of life on Y and is no longer available HTTP 404: openai_error— 模型已从 NVIDIA 列表下架HTTP 000— 模型超时(可能 EOL / 可能极慢 / 可能 NVIDIA 临时问题)
全量 Sweep 方法论
当发现常用模型大面积失效时,执行一次系统性的模型探索:
第一步:获取全量模型列表
curl -s http://127.0.0.1:3000/v1/models \
-H "Authorization: Bearer sk-0ExNiLblJvIWBDpkS50fwOBw4MmqLyKdHJK5iQtlw9dOMWBP" \
| python3 -c "import json,sys; [print(m['id']) for m in json.load(sys.stdin)['data']]"
第二步:分类 + 系统性测试
- 已知候选 — 之前的 active 模型列表(从 model-health.json / 旧 catalog 获取)
- 按成熟度筛选 — 优先测知名厂商:meta/llama, mistralai, openai/gpt-oss, minimaxai, deepseek-ai, nvidia/nemotron, google/gemma, qwen
- 按规模分层 — 每个厂商测大小两端(如 llama-3.1-8b + llama-3.1-70b)
第三步:测试命令模板
# 单模型快速测试(仅 HTTP 状态码)
curl -s -o /dev/null -w "%{http_code}" --max-time 10 \
http://127.0.0.1:3000/v1/chat/completions \
-H "Authorization: Bearer sk-0ExNiLblJvIWBDpkS50fwOBw4MmqLyKdHJK5iQtlw9dOMWBP" \
-H "Content-Type: application/json" \
-d '{"model":"<model_id>","messages":[{"role":"user","content":"hi"}],"max_tokens":5}'
返回码含义:
200→ ✅ 可用410→ ❌ EOL(永久不可用)404→ ❌ 不存在(可能下架)000/28→ ⚠️ 超时(可能极慢或临时问题,用更长超时重试)
第四步:更新
- 成功后更新
model-health.py的测试列表 - 更新
newapi-model-catalog.md的可用/不可用清单 - 更新
provider-tieringSKILL.md 的推荐矩阵和 MOA preset
注意事项
- 不要假设"今天能用明天也能用" — NVIDIA NIM 没有 SLA
- 主力模型选 1-2 个最稳的(目前 minimax-m3 最持久)
- 健康巡检每 6h 自动检测,但仅测已知列表 — 不会自动发现新模型
- 当
model-health.json显示stable == 0时,必须手动 sweep