Head of Machine Learning Infrastructure
关于我们
安贤投资 ( AXQ Capital ) 是一家全球量化投资机构。我们立足不同地域、资产类别和交易周期,持续构建多元化的投资优势。我们的策略植根于严谨的量化研究与深入的市场理解,并通过对数据、技术和人工智能的长期投入不断强化。我们汇聚来自全球顶尖高校及领先量化机构的优秀人才,倡导以好奇心、严谨精神和主人翁意识为基础的合作文化。在这里,最好的想法能够脱颖而出,每个人也能与公司共同成长。
岗位使命
作为 Head of Machine Learning Infrastructure ,你将向 CTO 汇报,负责公司面向机器学习和量化研究的核心计算与平台基础设施,包括 GPU/CPU 集群、分布式训练、研究计算平台、机器学习平台及开发者工具 。 核心目标是打造一套能够支撑 大规模特征工程与机器学习训练 的基础设施体系,支持 PB 级数据处理能力 ,并能够高效利用 数十 TB 级别训练数据进行模型训练与实验迭代 。系统需具备高性能、可扩展、可复现、易使用且成本高效的特性,持续提升研究与工程效率。
主要职责
负责机器学习基础设施团队建设、技术规划和项目推进,制定中长期平台路线。
建设和优化 GPU/CPU 集群、任务调度和分布式计算平台,支持大规模模型训练、特征计算和量化研究。
构建支持 PB 级数据规模的特征工程与数据处理平台 ,提升海量数据的计算、存储与访问效率。
支持基于 数十 TB 级训练数据 的分布式训练与实验体系,优化数据加载、并行训练与资源调度效率。
建设统一的机器学习平台,包括开发环境、实验管理、模型版本、依赖管理和模型部署流程。
优化训练与研究场景下的存储、网络、数据管道和计算性能,提高 GPU/CPU 资源利用率并控制基础设施成本。
建设模型训练、批量/在线推理及相关生产基础设施,提升模型从研究到生产的效率和可靠性。
持续优化开发者工具和研究工作流,提升大规模数据与模型实验的迭代效率。
建设平台监控、容量规划、权限、安全和自动化体系,保障大规模系统的稳定性与可维护性。
岗位要求
8 年以上机器学习基础设施、分布式系统、平台工程、高性能计算或云基础设施相关经验。
有基础设施或平台团队管理经验,以及复杂系统架构和落地能力。
扎实的 Linux、网络、存储、分布式系统和容器技术基础。
熟悉 GPU 计算、分布式训练和大规模机器学习工作负载,对任务调度、数据 I/O、特征工程和系统性能优化有实践经验。
熟悉 Python、Go、C++、Rust、Java 等至少一门编程语言。
熟悉 Kubernetes、Docker、CI/CD、Infrastructure as Code、监控和云计算基础设施。
具备较强的平台产品意识,能够深入理解量化研究员、机器学习研究员和工程师在大规模数据与模型训练场景下的需求。
加分项
有量化投资、对冲基金、机器学习平台或大规模研究计算平台经验。
有 GPU 集群、分布式训练或 HPC 平台建设经验。
熟悉 PyTorch Distributed、Ray、Slurm、NCCL、CUDA、RDMA 等技术。
有大规模特征工程平台、数据管道系统或 PB 级数据处理经验。
有 AWS、GCP、阿里云、腾讯云等云平台的 GPU 资源和成本优化经验。
熟悉 Claude Code、Codex、Cursor 等 AI coding tools,并有推动其团队化应用的经验。