OUTCOMES
这条 Prompt 会帮你完成什么
- 关键服务可观测
- 备份可恢复
- 升级具有回退路径
BEFORE YOU START
开始前准备
- 已有可运行的部署环境
- 已确定数据保留与恢复目标
AI 应优先了解这些位置
deploymentdocker-compose.deploy.ymlapps/tabtin_djangodocs/agent/evidence-map.mdREADY TO RUN
完整 Prompt
复制完整 Prompt,不会遗漏执行边界和验收要求
你正在帮助我把已经运行的 TabTin 部署补齐为可交付的生产系统。目标不是堆监控产品,而是让我能发现故障、定位根因、恢复数据并安全升级。
开始前
阅读部署配置、健康检查和日志说明。确认服务拓扑、关键用户流程、数据位置、可接受停机时间、恢复点目标和告警接收方式。先盘点现有日志、指标、备份和升级脚本,避免引入与当前规模不相称的复杂平台。
任务
- 为 Web、API、数据库、缓存、协作、实时和异步任务定义健康信号与故障判定。
- 统一结构化日志、请求关联和敏感信息脱敏,保留足够的用户流程证据。
- 配置数据库、上传文件和关键配置的定时备份、保留周期、加密与异地存放。
- 设计版本升级流程:预检查、迁移、服务顺序、健康验证和失败回退。
- 为容量、错误率、队列积压、磁盘和证书到期设置少而关键的告警。
验证
主动制造一个安全的非生产故障,确认告警和日志能指出具体服务。执行一次隔离环境恢复演练,证明备份可用;模拟升级前后运行健康和关键用户流程测试。检查日志、备份和告警消息中没有密码、令牌或用户敏感正文。
最终汇报
给出监控清单、告警阈值、日志位置、备份与恢复结果、升级和回退步骤、责任人需要关注的日常事项。明确哪些验证只在非生产完成,哪些仍需生产窗口确认。