岗位描述
岗位职责
* 统筹企业级混合云基础设施、Kubernetes 容器集群、物理机房与底层网络的生命周期规划、建设运营与架构调优。
* 主导多云战略落地(AWS、阿里云、腾讯云等),负责多云环境网络互联、权限边界收敛、资源治理、成本度量及多活容灾体系建设。
* 规划并落地现代化软件交付流水线(CI/CD),打通从代码托管、自动化流水线、制品版本管控、安全合规扫描到灰度发布与秒级回滚的全链路闭环。
* 负责大体量、生产级 Kubernetes 集群的容量伸缩、版本演进、核心网关维护、节点故障自愈、性能瓶颈突破与安全容器防护。
* 深度参与全球 CDN 网络及核心动静分离业务的架构规划,攻坚智能调度、缓存命中率、源站回源、DNS 解析、HTTPS 加密传输及跨网链路抖动等难题。
* 建立跨地域、多机房及规模化物理服务器的统一管理机制,实现服务器标准化交付、自动化配置、全景监控与容量自适应。
* 打造高扩展、一体化的可观测性工程,打通指标聚合、分布式日志索引、调用链追踪、智能告警降噪与根因自动定位能力。
* 强化系统韧性工程,主导高可用架构设计、秒级弹性伸缩策略、异地容灾恢复及应急响应规范,常态化参与重大线上故障复盘与机制迭代。
* 深度应用 AI 编程助手(AI Coding)协同开展自动化脚本编写、IaC 代码生成、线上故障分析、配置安全审计及技术文档沉淀。
* 持续追踪云原生、容器安全、自动化运维及 AI 辅助研发前沿,驱动技术演进与业务场景的深度契合。
任职要求
* 统招本科及以上学历,计算机、通信、软件工程等相关专业优先。
* 具备 5 年及以上 DevOps、SRE、大型云平台架构或系统稳定性运维实战经验。
* 熟练驾驭 AWS、阿里云或腾讯云等主流公有云,具备从零到一的云原生资源架构设计、业务部署及复杂故障排查能力。
* 精通云核心组件,包括弹性计算、虚拟私有云、负载均衡体系、对象存储、分布式数据库、DNS、CDN、IAM 及安全边界划分。
* 精通 CI/CD 交付方法论,熟练运用 Jenkins、GitLab CI、Argo CD 等工具链,具备复杂流水线的设计与落地能力。
* 精通 Kubernetes 容器编排及云原生生态,对 Docker、Helm、Ingress、CNI 网络、CSI 存储及集群调度机制有深刻理解。
* 具备大规格生产集群运维功底,能够独立排查并解决集群网络阻塞、节点宕机、资源抢占及 Pod 异常等疑难杂症。
* 熟悉 CDN 运行底层逻辑,具备边缘节点性能调优、带宽成本控制及跨运营商网络链路质量分析经验。
* 精通 Linux 操作系统内核,深入理解进程调度、虚拟内存、文件系统、网络协议栈及系统参数调优。
* 具备大规模物理服务器管理经验,熟悉带外管理、批量带外升级、系统初始化及自动化资产盘点。
* 熟练掌握 Terraform、Ansible、Pulumi 等基础设施即代码(IaC)工具。
* 扎实掌握 TCP/IP 协议栈、DNS 递归解析、BGP 路由、HTTPS 握手、NAT 转换、防火墙策略及网络抓包排查方法。
* 精通 Prometheus、Grafana、ELK/OpenSearch、Loki、SkyWalking 等监控及可观测性技术栈。
* 具备至少一种编程语言(Shell、Python 或 Go)的工程化开发能力,能独立编写运维工具与平台化服务。
* 具备极强的抗压能力和故障现场决策力,能在复杂紧急情况下快速阻断风险、控制影响面并推动根因根治。
AI 辅助研发(AI Coding)硬性要求
* 具备将 AI 编程工具深度内化至日常运维与开发流的实战背景,非停留在尝鲜阶段。
* 熟练掌握主流 AI 辅助工具(如 GitHub Copilot、Cursor、Claude Code 等)的高阶使用技巧。
* 能够高效借助 AI 完成以下场景支撑:
* Shell、Python、Go 运维脚本编写与重构;
* Terraform、Ansible、Kubernetes YAML 配置文件编写;
* CI/CD 流水线逻辑编排;
* 海量日志深度分析与故障异常定位;
* 安全合规配置审查;
* 自动化测试用例与运维手册编写。
* 严格坚持“零信任”原则,对 AI 生成的内容具备独立校验、安全审计及风险把控能力,杜绝未审查直接投产。
* 具备出色的提示词工程设计与复杂任务拆解思维,能通过 AI 工具实现人效的指数级提升。
* 面试环节需进行真实的 AI Coding 生产实践案例演示或现场实操。
加分项
* 具备企业级网络安全、云安全、主机加固及容器安全运营防护经验。
* 熟悉抗DDoS、WAF 防护、IDS/IPS、零信任架构、堡垒机及漏洞生命周期管理。
* 精通 iptables、nftables、eBPF、Nginx、OpenResty、HAProxy 或 Envoy。
* 拥有主流 CDN 厂商、头部云厂商、大型互联网或基础设施平台核心团队工作背景。
* 具备海量并发流量、高可用业务系统的稳定性治理与大容量规划经验。
* 具有跨地域、多云架构、混合云灾备或混沌工程落地实战经验。
* 熟悉 FinOps 理念,具备云资源精细化成本分析与降本增效落地案例。
* 持有 CKA、CKS、AWS/阿里云/腾讯云高级认证或信息安全相关证书。
