- 7B Q3常驻(llama-server-7b.service, parallel 2) + 3B备用, llama-switch.sh开关 - bge-m3 INT8量化 + CUDA (bge-embed.service) - gpu_infer.py统一入口 + gpu_run.sh + GPU健康看门狗 - 织忆蒸馏切local/qwen7b(zhiyid.service), TencentDB L1切local(tdai-gateway.yaml) - daemon.py call_llm本地优先(fallback云) - github-weekly/投研简报/wiki_curator/cangjie全部本地优先 - distill-model-watchdog适配local分支+健康检查防误切 - 移除.env/auth.json跟踪(防敏感泄漏) |
||
|---|---|---|
| .. | ||
| MEMORY.md | ||
| MEMORY.md.lock | ||
| USER.md | ||
| USER.md.lock | ||