小唯 A06
|
c549095b22
|
feat: 本地GPU推理全面落地 + 云LLM调用本地化 (2026-08-29)
- 7B Q3常驻(llama-server-7b.service, parallel 2) + 3B备用, llama-switch.sh开关
- bge-m3 INT8量化 + CUDA (bge-embed.service)
- gpu_infer.py统一入口 + gpu_run.sh + GPU健康看门狗
- 织忆蒸馏切local/qwen7b(zhiyid.service), TencentDB L1切local(tdai-gateway.yaml)
- daemon.py call_llm本地优先(fallback云)
- github-weekly/投研简报/wiki_curator/cangjie全部本地优先
- distill-model-watchdog适配local分支+健康检查防误切
- 移除.env/auth.json跟踪(防敏感泄漏)
|
2026-08-29 18:53:48 +08:00 |
小唯 A06
|
3997d9e904
|
fix: 全面切 Agnes — 蒸馏看门狗+巡检自愈+6个脚本
- distill-model-watchdog.py: 候选池Agnes优先, 双端点支持, _update_zhiyid端点/key联动, _update_tddb只改llm段(不再误改embedding)
- model-health.py: 蒸馏自愈Agnes优先, 当前模型探针用_get_endpoint(修复误判agnes挂→切回NewAPI的bug), tdai更新只改llm段
- daemon.py: FAST/DEEP/COMPACTION_MODEL→agnes-2.0-flash, 硬编码模型名/URL→动态
- cangjie_distill.py: 默认模型→agnes-2.0-flash
- wiki_curator.py: LLM→agnes(无key fallback NewAPI)
- github-weekly-digest.py: 模型→agnes, 端点动态
- model-health.sh: 测试列表加Agnes+独立端点
- tdai-gateway.yaml: llm.baseUrl/key→Agnes, embedding保持bge-m3(已修正)
|
2026-08-17 23:27:45 +08:00 |