关于我
目录
一句话
从虚拟机运维做到云原生平台,再做到数据链路和 AI 分析——每一段都是因为「重复劳动太多」而往上走了一层。
现在关注的问题是:运维领域积累的大量数据(告警、指标、变更、账单),能不能真的交给模型去产出结论,而不只是做个更好看的看板。 这个站点上的两个 Agent Demo 就是这个思路的具体化。
经历
沐瞳科技 · SRE / 数据基础设施 · 2024.10 — 至今
- AI 告警数据智能分析框架:告警、指标、变更记录原本分散在不同系统,值班同学要靠经验串起来。我把这些源接成统一数据链路,再让模型在这套上下文里做根因定位。
- 智能成本数据分析模型:把资源使用画像、计费数据、业务波动周期喂给模型,产出带依据和风险等级的优化建议——而不是一句「利用率低,建议缩容」。
- 负责海外服与国服的发布与稳定性保障,详见 项目。
腾讯 IEG · 运维开发 · 2021.11 — 2024.04
- 英雄联盟端游、无畏契约的云原生化改造,覆盖容器化、资源调度、发布流程与故障自愈。
- 累计节省集群成本 500 万/年——主要来自规格错配的纠正和闲置资源的回收,不是靠压缩业务配额。
- 稳定性提升 60%,问题定位效率提升一倍。
- 掌上英雄联盟的交付流程改造,交付效率提升 40%。
易鲸捷 · 云原生研发 · 2020.06 — 2021.10
- 开发两款分布式数据库的 Kubernetes Operator(esgynDB / qianbaseDB),通过 OperatorHub.io Level 3 认证。
- 把原先靠文档和人工执行的部署流程收敛成声明式配置:部署出错率降低 80%,交付效率提升 50%。
钢银电商 · 运维工程师 · 2019.04 — 2020.06
- 管理 2500+ 虚拟机、5000+ Pod 的混合环境。
- 通过资源画像与调度策略调整,资源利用率提升 25%,年节省成本百万级。
- 建设内部运维平台,协作效率提升 35%。
技能
| 层面 | 内容 |
|---|---|
| 熟练 | Go、Python、Kubernetes、Prometheus、数据采集与链路建设 |
| 掌握 | Docker、MySQL、CI/CD、可观测性体系 |
| 在做 | LLM Agent 工程化:提示词编排、工具调用、结果可验证性 |
教育
计算机网络与安全 学士 · 英国伯明翰城市大学 · 2014 — 2018
联系
- 邮箱:sunheng1235@126.com
- GitHub:SHenry07
电话没有放在公开页面上——留邮箱就行,我会回。