# NVIDIA NIM 模型易失性与全量 Sweep 方法论 > Created: 2026-07-27 > Context: 大规模 EOL 事件 — step-3.5-flash / m2.7 / mistral-large-3-675b 等 16+ 个模型同日 EOL ## 问题本质 NewAPI 的免费模型全部来自 **NVIDIA NIM (NVIDIA Inference Microservices)**。NVIDIA 不定期退役模型(HTTP 410 Gone),**无提前通知**。 2026-07-27 是首次大规模退役:16+ 个曾经可用的模型在同一天或最近几天全部 EOL。 ## 症状 - 调用返回 `HTTP 410: The model 'X' has reached its end of life on Y and is no longer available` - `HTTP 404: openai_error` — 模型已从 NVIDIA 列表下架 - `HTTP 000` — 模型超时(可能 EOL / 可能极慢 / 可能 NVIDIA 临时问题) ## 全量 Sweep 方法论 当发现常用模型大面积失效时,执行一次系统性的模型探索: ### 第一步:获取全量模型列表 ```bash curl -s http://127.0.0.1:3000/v1/models \ -H "Authorization: Bearer sk-0ExNiLblJvIWBDpkS50fwOBw4MmqLyKdHJK5iQtlw9dOMWBP" \ | python3 -c "import json,sys; [print(m['id']) for m in json.load(sys.stdin)['data']]" ``` ### 第二步:分类 + 系统性测试 1. **已知候选** — 之前的 active 模型列表(从 model-health.json / 旧 catalog 获取) 2. **按成熟度筛选** — 优先测知名厂商:meta/llama, mistralai, openai/gpt-oss, minimaxai, deepseek-ai, nvidia/nemotron, google/gemma, qwen 3. **按规模分层** — 每个厂商测大小两端(如 llama-3.1-8b + llama-3.1-70b) ### 第三步:测试命令模板 ```bash # 单模型快速测试(仅 HTTP 状态码) curl -s -o /dev/null -w "%{http_code}" --max-time 10 \ http://127.0.0.1:3000/v1/chat/completions \ -H "Authorization: Bearer sk-0ExNiLblJvIWBDpkS50fwOBw4MmqLyKdHJK5iQtlw9dOMWBP" \ -H "Content-Type: application/json" \ -d '{"model":"","messages":[{"role":"user","content":"hi"}],"max_tokens":5}' ``` 返回码含义: - `200` → ✅ 可用 - `410` → ❌ EOL(永久不可用) - `404` → ❌ 不存在(可能下架) - `000` / `28` → ⚠️ 超时(可能极慢或临时问题,用更长超时重试) ### 第四步:更新 1. 成功后更新 `model-health.py` 的测试列表 2. 更新 `newapi-model-catalog.md` 的可用/不可用清单 3. 更新 `provider-tiering` SKILL.md 的推荐矩阵和 MOA preset ## 注意事项 - 不要假设"今天能用明天也能用" — NVIDIA NIM 没有 SLA - 主力模型选 1-2 个最稳的(目前 minimax-m3 最持久) - 健康巡检每 6h 自动检测,但仅测已知列表 — 不会自动发现新模型 - 当 `model-health.json` 显示 `stable == 0` 时,必须手动 sweep