About this role
技术环境 核心生产环境运行于 AWS / EKS,服务于 7×24 小时数字资产交易业务,对系统可用性、实时性、安全性、变更质量和故障恢复能力有较高要求。
岗位职责
• 负责 7×24 小时核心交易业务的生产稳定性保障,覆盖交易链路、行情服务及相关基础设施;参与重大生产故障的应急响应,及时完成问题定位、风险控制、服务恢复和故障复盘,保障交易连续性和用户资产安全。
• 负责 AWS 及 EKS/Kubernetes 生产基础设施的建设和持续优化,涵盖云架构、网络、高可用、容量规划及容灾,以及 Kubernetes 集群升级、节点生命周期、调度与资源管理、Ingress/负载均衡、DNS、存储和弹性伸缩等;持续优化云资源使用效率和成本,并从稳定性、安全性和可运维性角度参与业务技术架构设计。
• 建设和持续完善可观测性与生产稳定性体系(Metrics、Logs、Tracing、Alerting、SLI/SLO、Incident Response、Postmortem),提升生产问题的发现、定位和恢复效率,并与研发团队共同解决系统瓶颈、单点风险及架构层面的长期稳定性问题。
• 推动 IaC、CI/CD 和自动化运维体系建设(Terraform/Terragrunt、GitHub Actions、Ansible 等),实现基础设施和应用交付的标准化、自动化,并完善变更评审、发布、验证和回滚机制,降低生产变更风险。
• 负责或协同完成 MySQL、Redis、Kafka 等核心数据及中间件服务的生产运维,包括高可用、监控、容量规划、备份恢复、性能优化及故障处理。
• 推动 AWS、Kubernetes 及生产环境安全治理,包括最小权限和访问控制(IAM/RBAC)、网络隔离、容器及镜像安全、密钥与敏感信息管理(Secrets/KMS)、漏洞治理和安全审计,并协同相关团队完成安全事件响应。
任职要求
• 计算机或相关专业统招本科及以上学历,5 年以上 DevOps、SRE、云基础设施或相关工作经验;具备中大型生产环境的一线运维、变更管理和复杂故障处理经验,兼具基础设施架构设计和实际落地能力,能够独立推进相关方案的实施和持续优化,并具备较强的风险意识和跨团队协作能力。
• 具备扎实的 Linux、网络和容器技术基础,以及生产级 Kubernetes/EKS 实践经验,能够独立完成集群建设、升级、调优,以及 Pod、Node、网络和集群层面的复杂故障排查;了解 Java、Go 等常见应用的运行环境和基本排障方法。
• 具备 AWS 生产环境建设和运维经验,熟悉核心云服务(IAM、VPC、EC2、EKS、ALB/NLB、Route 53、S3、CloudWatch 等),理解多可用区、高可用、网络隔离、最小权限、弹性伸缩、容量规划及成本治理等设计原则,具备生产基础设施架构设计、风险评估和故障排查能力。
• 具备较强的 IaC、CI/CD 和自动化能力,有相关工具(Terraform/Terragrunt、GitHub Actions、Ansible 等)的实际使用经验;熟练使用脚本语言(Bash、Python 等),能够通过自动化提高基础设施和应用交付的可靠性。
• 具备生产级可观测性和稳定性治理经验,熟悉相关技术栈(Prometheus、Grafana、ELK/Loki、OpenTelemetry 等),理解 Metrics、Logs、Tracing、SLI/SLO、告警治理、容量规划和容灾机制。
• 熟悉 MySQL、Redis、Kafka 等常见数据及中间件服务的基本生产运维,并具备实际的安全运维或 DevSecOps 经验(AWS IAM、Kubernetes RBAC、网络安全、主机及容器安全、Secrets/KMS、漏洞治理、安全审计等),具备生产安全风险识别和处置能力。
• 具备 Web3 / Crypto 行业生产环境运维经验,对区块链及链上业务的基本运行机制有一定理解,能够结合数字资产交易业务识别和处理相关的稳定性与安全风险。
加分项
• 有数字资产交易所、证券、金融交易、支付等高可用实时系统生产环境经验者优先。
• 有大规模或高流量 Kubernetes/EKS 生产环境,以及 AWS 多账号治理、跨 Region 容灾或灾备演练实践经验者优先。
• 有较深入的云原生、云安全或成本治理实践经验者优先(如 Karpenter、Argo CD/Flux、OpenTelemetry、eBPF、FinOps 等)。
公司概述
Davion Labs 现诚邀一位具备丰富云基础设施和生产稳定性经验的高级运维 / SRE 工程师(Senior Cloud Infrastructure & SRE Engineer)加入 ApeX Protocol 核心团队。
ApeX Protocol 是领先的去中心化交易平台(DEX),核心业务 7×24 小时持续运行,对系统的稳定性、安全性、实时性及故障恢复能力有较高要求。生产基础设施以 AWS、EKS/Kubernetes(K8s) 为核心,并通过自动化、可观测性和稳定性治理持续提升系统可靠性。
在这个岗位上,您将深度参与云基础设施建设、Kubernetes 平台、IaC/CI/CD、可观测性、生产稳定性及安全治理。我们希望您既具备基础设施架构设计和系统性思考能力,也保持较强的实际落地能力,能够深入生产环境处理复杂问题,并推动问题从应急响应走向长期改进。
我们期待您具备 Web3 / Crypto 行业生产环境经验,理解链上业务的基本运行机制,并能够与研发团队紧密协作,共同建设稳定、安全、高效且具备良好扩展能力的交易基础设施。