4.3 KiB
4.3 KiB
自治运维体系(2026-07-09 建立)
该体系包含三个相互补充的子系统,让代理能够自主监控、修复、复盘、持久化。
1. 系统健康看门狗 + 自愈
脚本:~/.hermes/scripts/health-watchdog.sh
Cron:每 30 分钟(no_agent 模式)
监控指标
| 指标 | 阈值(警告) | 阈值(紧急) |
|---|---|---|
| 磁盘 / | >85% | >92% |
| 磁盘 /home | >85% | — |
| 内存 | >80% | >90% |
| CPU 负载 | > 核数 × 0.9 | — |
| 关键进程 | — | 任意离线即为紧急 |
| GPU 温度 | >80°C | — |
关键进程列表
| 进程名 | systemd service | 匹配模式 |
|---|---|---|
| zhiyid | zhiyid.service | zhiyid-new |
| bge-embed | bge-embed.service | bge_embed_server |
| new-api | — | new-api |
| hermes | — | hermes |
自愈机制
检测到进程离线 → 自动 systemctl --user start <service> → 等待 3 秒 → 重新检查 → 记录结果到告警消息。
通知策略
- 正常:静默(不浪费飞书)
- 首次异常:飞书告警卡片(红色 header)
- 持续异常:每 2 小时重复一次(防刷屏)
- 恢复:飞书恢复通知(绿色 header),标记已解决
历史状态追踪
~/.hermes/watchdog/health.state — 记录上次状态(ok / alarm),用于判断状态转换。
2. 自启动恢复
脚本:~/.hermes/startup.sh
Systemd:xiaowei-startup.service(enabled, oneshot)
启动时执行的步骤
- 检查 zhiyid.service / bge-embed.service → 未运行则 systemctl start
- 检查 NewAPI → 未运行则尝试启动
- 检查 Playwright REST API → 无响应则重启
- 检查外网连通性
- 运行一次快速健康检查(health-watchdog.sh)
启用状态
systemctl --user status xiaowei-startup.service
日志
journalctl --user -u xiaowei-startup.service
3. 每日复盘
Cron:b46f060eb16b(每晚 22:00,newapi-local 免费模型)
交付:飞书 Home 频道
模型:minimaxai/minimax-m2.7
复盘内容
- 回顾今天 — 搜索今日 session + 日志 + 看门狗状态
- 分析模式 — 重复问题、新 skill 机会、配置隐患
- 产出 — 按 P0/P1/P2 优先级列出:需立即修的问题 → 建议创建的 skill → 可优化的流程
- 执行 — 有 P0/P1 时直接创建 skill / 修配置 / 更新 memory
输出格式
## 每日复盘 YYYY-MM-DD
### 🐛 今天修复的问题
- ...
### 📚 新技能/新知识
- ...
### ⚙️ 配置改进
- ...
### 📝 记忆更新
- ...
无问题时的输出:✅ 一切正常,无需变更。
适用范围
| 场景 | 覆盖 |
|---|---|
| 技能库陈旧 | 发现未记录的 skill → 建议创建 |
| 配置错误 | session 中踩过的坑 → 记录到对应 skill 的 pitfalls |
| 模型退化 | 健康巡检发现某模型不稳定 → 建议切到 stable 模型 |
| 重复劳动 | 同样的问题反复解决 → 建议创建自动化 |
| 流程优化 | 发现低效操作 → 建议改进流程 |
技巧
- 复盘代理使用
minimaxai/minimax-m2.7(免费),足够完成分析和产出 session_search是主要信息来源,用它找今天的对话- 看门狗状态文件
~/.hermes/watchdog/health.state可以快速判断今天有无系统异常 - 输出到飞书后可被用户即时看到,如果用户回复讨论,可进一步深化
三者关系
自启动 (xiaowei-startup.service)
└── 开机 → 恢复所有服务 + 跑一次健康检查
↓
看门狗 (health-watchdog, 30min)
├── 正常 → 静默
├── 异常 → 飞书告警 + 自动自愈
└── 恢复 → 飞书通知
↓
每日复盘 (daily-review, 22:00)
└── 回顾 session + 看门狗状态
├── 发现问题 → 创建 skill / 修配置
└── 一切正常 → 一言带过
脚本位置
| 脚本 | 路径 | 用途 |
|---|---|---|
| 看门狗 | ~/.hermes/scripts/health-watchdog.sh |
系统监控 + 自愈 |
| 自启动 | ~/.hermes/startup.sh |
开机恢复 |
| 模型巡检 | ~/.hermes/scripts/model-health.py |
NewAPI 模型健康 |
完整配置见 devops-umbrella 技能树中的"自治运维体系"章节。