关于我
目录
一句话
从虚拟机运维做到云原生平台,再做到 LLM 告警分析——每一段都是因为「重复劳动太多」而往上走了一层。
现在关注的问题是:运维领域积累的大量数据(告警、指标、变更、历史案例),能不能真的交给模型去产出结论,而不只是做个更好看的看板? 这个站点上的两个 Agent Demo 就是这个思路的具体化。
经历
沐瞳科技 · SRE 工程师 · 2024.10 — 至今
- 负责竞技线业务运维:支持 MLBB(决胜巅峰)国服区域上线、MCGG(魔法战旗)等内部孵化项目从 0 到 1 上线;发布流程改造见项目案例。
- 牵头业务容器化转型,推动资源统一调度和标准化交付。
- 开发并上线磁盘告警自愈平台:Prometheus 告警 → 规则匹配 → 自动清理 → 验证恢复 → 升级/人工审批的闭环,用两级 dry-run 门控、危险路径白名单、阈值复核、规则无关的突增熔断这一整套机制兜住「自动删文件」的风险。
- AI 运维探索:基于 Eino 框架构建 LLM 告警分析 Agent——MySQL 存历史故障案例做长期记忆、Redis 存会话状态做短期记忆、火山云向量库做检索增强,实现告警根因初步定位。定位是辅助值班同学,不是替代。本站的两个 Demo 是这条思路的延伸。
腾讯 IEG · SRE 工程师 · 2021.11 — 2024.04
- 牵头英雄联盟端游的云原生改造,从 IDC 物理机迁移到 K8s,累计节省成本 500 万/年;方案复用到新游无畏契约的上线,见项目案例。
- 设计 runtime 双态兼容方案:游戏服务只需切换一个 runtime 关键字即可在物理机与云原生环境间无缝切换,做到可灰度、可回退;搭建 Grafana 统一观测体系,新旧环境一起看。
- 优化 Riot 游戏交付物与公司内部发布平台的对接流程,完成云原生适配改造。
- 独立负责线上故障响应和应急处理,沉淀故障分析方法论。
- 协助掌上英雄联盟 APP 接入分布式编译、代码检查、测试服发布等 DevOps 流程。
易鲸捷 · DevOps 工程师 · 2020.06 — 2021.10
- 独立开发 esgynDB / qianbaseDB 分布式数据库的 Kubernetes Operator,达到 OperatorHub.io Level 3 Full Lifecycle,管理效率提升 40%,见项目案例。
- 开发数据库命令执行器与节点采集器,把安装文档从 10 页精简到 5 页,安装效率提升 50%。
钢银电商 · 运维开发工程师 · 2019.04 — 2020.06
- 维护 vSphere 虚拟化集群和 Kubernetes 集群,管理 2500+ 虚拟机与 5000+ Pod;通过 request/limit 调优、闲置资源清理、混部,资源利用率提升 25%。
- 参与开发内部运维平台(异地灾备快速切换、CMDB、CI/CD、Arthas 接入、Pod 模板 Web 化),运维效率提升 20%。
技能
| 层面 | 内容 |
|---|---|
| 熟练 | Go、Python、Docker、Kubernetes、Prometheus |
| 掌握 | MySQL |
| 了解 | C、Java、C++、JavaScript、Elasticsearch、Istio、Etcd、ZooKeeper、Kafka、Redis、Eino |
| 在做 | LLM Agent 工程化:用 Eino 写过告警分析 Agent,本站两个 Demo 也是手写的 |
教育
计算机网络与安全 学士 · 英国伯明翰城市大学 · 2014 — 2018
联系
- 邮箱:sunheng1235@126.com
- GitHub:SHenry07
电话没有放在公开页面上——留邮箱就行,我会回。