08 三个月落地排期
这篇把前面 01~07 的内容收拢成一张「三个月可执行排期表」。主线只有一个:围绕 ops-diagnose / AI 运维知识库 这一个项目推进,三个月后产出可展示、可面试、可写进简历的资产。
一句话定位
用 LLM 把过去 2 年的运维答疑文档、巡检日志、故障案例,沉淀成可检索的知识库,实现「自然语言问答 + 智能巡检 + 自愈脚本」三大能力。
三个月总体时间表
| 阶段 | 时间 | 主题 | 里程碑产出 |
|---|---|---|---|
| 第 1 月 | 09-02 ~ 09-30 | 知识入库 + RAG 基础版 | 5000+ 问答对知识库 + 本地可运行的问答系统 |
| 第 2 月 | 10-01 ~ 10-31 | 智能巡检 + 自愈脚本 | 异常检测 + 自动修复 + 第一篇技术文章 |
| 第 3 月 | 11-01 ~ 11-30 | 上线 + 打磨 + 简历 | GitHub 完整项目 + 2 篇技术文章 + 升级版简历 |
第 1 月:知识入库 + RAG 基础版
目标:把「死文档」变成「能问答的知识库」。
第 1 周:数据整理与入库
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 建仓库 | 在 GitHub 新建 yourname/ai-sre-knowledgebase |
仓库建好,README 占位 |
| 2. 数据盘点 | 把过去 2 年答疑文档(txt/doc/pdf/聊天记录)全列出来 | 列出一份文件清单 |
| 3. 数据清洗 | 把文档统一转成结构化格式(推荐 JSON) | 得到 data/qa_pairs.json |
| 4. 写入库脚本 | 写 ingest.py:清洗 → 切块 → 向量化 |
脚本能跑通 |
| 5. 接向量库 | 用 Chroma(入门)/ Qdrant(推荐)存储向量 | 向量入库成功 |
第 2 周:基础问答系统
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 接 LLM | 接入 DeepSeek / Qwen / GLM(或 Ollama 本地) | 能正常调用 |
| 2. 写 RAG 链 | 用 LangChain 写检索 + 生成链路 | 提问能返回答案 |
| 3. 写查询脚本 | 写 query.py:命令行输入问题 → 输出答案 |
终端能问答 |
| 4. 加引用来源 | 让答案附带「来自哪条历史文档」 | 能看到出处 |
第 3 周:Web 界面
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 写 Web UI | 用 Streamlit / Gradio 做界面 | 浏览器能打开 |
| 2. 优化检索 | 向量 + 关键词混合检索,提高命中率 | 常见问题能命中 |
| 3. 写 README | 写架构图 + 使用说明 | README 完整 |
第 4 周:打磨与交付
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 测试 | 找 20 个真实问题测试命中率 | 命中率 ≥ 70% |
| 2. 写部署文档 | Docker 化,写部署步骤 | 一键部署 |
| 3. 阶段性总结 | 记录本月踩坑和成果 | 一份复盘笔记 |
第 1 月里程碑:一个能问答的运维知识库 MVP 完成。
第 2 月:智能巡检 + 自愈脚本
目标:从「问答」升级到「主动发现问题 + 自动修复」。
第 5 周:接入巡检日志
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 数据源接入 | 接入 yum/ntp/syslog 的日志或指标 | 日志能进入系统 |
| 2. 结构化 | 把日志解析成结构化字段 | 得到 data/logs.json |
| 3. 关联知识库 | 日志关键词关联到知识库条目 | 能自动关联 |
第 6 周:异常检测
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 规则告警 | 写阈值规则(CPU/磁盘/服务状态) | 触发告警 |
| 2. AI 分析 | 用 LLM 分析日志,判断异常根因 | 给出根因判断 |
| 3. 生成报告 | 自动生成巡检报告 | 一份报告样例 |
第 7 周:自愈脚本
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 脚本生成 | 用 LLM 根据问题生成修复脚本 | 能生成脚本 |
| 2. 沙箱执行 | 在安全环境执行脚本并回传结果 | 能执行 |
| 3. 闭环验证 | 修复 → 验证 → 记录到知识库 | 形成闭环 |
第 8 周:第一篇文章
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 写文章 | 《用 LLM 构建内部运维知识库,解决 80% 日常运维痛点》 | 文章完成 |
| 2. 发布 | 发 CSDN / 掘金 / 个人博客 | 已发布 |
| 3. 月度复盘 | 记录本月成果 | 复盘笔记 |
第 2 月里程碑:系统具备「巡检 + 自愈」能力,并产出第一篇技术文章。
第 3 月:上线 + 打磨 + 简历
目标:把项目做成「可展示、可投递」的完整作品。
第 9 周:GitHub 项目完善
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 整理代码 | 代码规范化、加注释、加测试 | 代码整洁 |
| 2. 补文档 | 完善 README、架构图、快速开始 | 文档完整 |
| 3. 录演示 | 录一段 2 分钟演示视频/GIF | 有演示 |
第 10 周:第二篇文章
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 写文章 | 《分布式数据库主备切换自动化实践》 | 文章完成 |
| 2. 发布 | 发布到技术社区 | 已发布 |
| 3. 互链 | 文章和 GitHub 互相引用 | 形成流量闭环 |
第 11 周:简历重写
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 重写简历 | 用「成果量化 + AI 能力」重写 | 简历升级版完成 |
| 2. 找岗位 | 匹配「AI 运维 / SRE / DBA」岗位 JD | 目标岗位清单 |
| 3. 定制投递 | 针对每个岗位微调简历 | 投递版本 |
第 12 周:复盘与迭代
| 任务 | 具体动作 | 完成标准 |
|---|---|---|
| 1. 全面复盘 | 总结 3 个月成果和不足 | 复盘文档 |
| 2. 规划下一期 | 决定下一期项目方向 | 下一期计划 |
第 3 月里程碑:完整 GitHub 项目 + 2 篇技术文章 + 升级版简历 + 开始投递。
推荐技术栈
| 层 | 技术选型 | 备注 |
|---|---|---|
| LLM | DeepSeek-V3 / Qwen2.5 / GLM-4 | 本地可用 Ollama 跑 |
| 向量数据库 | Qdrant(推荐)/ Chroma(入门) | 轻量够用 |
| 编排框架 | LangChain + LangGraph | 主流 |
| 图谱(可选) | Neo4j / PGVector | 二期再加 |
| 前端 | Streamlit / Gradio | 快速出界面 |
| 部署 | Docker + Docker Compose | 先别上 K8s |
每周固定节奏
| 时间 | 动作 |
|---|---|
| 周一 | 列本周 3~5 个任务 |
| 周二~周四 | 每天完成 1~2 个任务,记录笔记 |
| 周五 | 小复盘,检查完成度 |
| 周末 | 写笔记/文章,更新 GitHub |
简历预期写法(三个月后)
开源项目 / 自研:AI 运维知识库系统(AI-SRE-KnowledgeBase)
- 将 2 年内部运维答疑知识(yum、ntp、syslog、故障修复)沉淀为结构化知识库
- 接入 RAG 实现自然语言问答,支持引用溯源,自助解决率提升 65%
- 开发智能巡检 + 自愈脚本,异常自动识别并生成修复方案
- 技术:LLM + LangChain + Qdrant + Python + Docker当前待办(立即执行)
- 新建 GitHub 仓库
yourname/ai-sre-knowledgebase - 盘点并整理过去 2 年的答疑文档
- 把文档统一转成结构化 JSON