此信息由前程无忧(51JOB)审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者前程无忧(51JOB)核实,并请同时联系本站处理该转载信息。
[北京]中移九天人工智能科技(北京)有限公司
职位:算法开发岗(大模型高性能推理优化)-金种子(北京)
发布时间:2026-09-16
工作地点:北京
信息来源:前程无忧(51JOB)
职位类型:全职
职位描述
职能类别:产品运营
工作职责:
1、负责大模型高性能推理核心技术研究与优化,面向 Dense、MoE 等不同模型架构,围绕吞吐、时延、显存/内存利用率及资源效率开展系统性优化,持续提升大模型在线推理服务性能。
2、负责大模型推理框架优化,深入研究 vLLM、SGLang等主流推理框架,开展调度策略、并行策略、显存管理、模型加载、通信及计算优化,推动推理框架在 GPU、NPU 等异构算力平台上的高效适配与落地。
3、负责 KV Cache 体系及长上下文推理优化,研究 Prefix Cache、多级 KV Cache、HBM/DRAM 分层缓存、Cache-aware/Affinity Scheduling 等关键技术,提升长上下文及高前缀复用场景下的缓存命中率与推理效率。
4、负责大模型分布式推理架构研究,探索 Prefill-Decode 分离、TP/DP/EP 并行、MoE Expert Parallel、动态专家负载均衡等技术,针对大规模集群开展通信、负载均衡及资源调度优化。
5、建立大模型推理性能评测与优化体系,围绕 TTFT、TPOT、端到端时延、吞吐量、并发能力、缓存命中率及资源利用率等核心指标,构建标准化 Benchmark、性能 Profiling 与自动化调优能力。
6、跟踪大模型推理系统、Serving、分布式计算及软硬件协同优化领域前沿技术,推动创新方案在实际业务和大规模生产集群中的落地。
任职要求:
1、博士学历,计算机科学、人工智能、软件工程等相关专业。
2、具备扎实的计算机体系结构、并行计算、深度学习及大模型基础,对 Transformer、MoE、Attention、KV Cache 及大模型推理过程有深入理解。
3、具备大模型推理系统研发或性能优化经验,熟悉 vLLM、SGLang、MindIE 等至少一种主流推理框架,对调度、显存管理、Continuous Batching、Prefix Cache、CUDA/NPU Graph 等关键机制有深入理解者优先。
4、熟悉大模型分布式推理技术,理解 Tensor Parallel、Data Parallel、Pipeline Parallel、Expert Parallel、Prefill-Decode 分离等并行与部署架构;具备 MoE 专家负载均衡、KV Cache 优化或大规模 Serving 系统实践经验者优先。
5、熟悉AI 加速硬件及其软件栈,具备昇腾 Ascend 等平台上的模型部署、性能分析或软硬件协同优化经验者优先。
6、熟练掌握 Python、C/C++ 等编程语言中的至少一种,熟悉 PyTorch;具备性能 Profiling、通信分析、算子优化、分布式系统或高性能计算相关开发经验。
7、具备较强的系统问题分析与技术攻坚能力,能够从模型、框架、通信、调度、缓存及硬件等多个层面定位性能瓶颈,并独立推动复杂优化方案从研究验证走向规模化生产落地;具有相关高水平论文、开源社区核心贡献或大型推理系统研发经验者优先。
公司简要介绍:
公司名称:中移九天人工智能科技(北京)有限公司
公司类型:民营公司
公司规模:10000人以上
公司介绍:中移九天人工智能科技(北京)有限公司,公司规模为10000人以上,公司类型为民营公司,所属行业为通信/网络设备
