首页 > 北京 全职 > 职位详细
说明:

此信息由前程无忧(51JOB)审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者前程无忧(51JOB)核实,并请同时联系本站处理该转载信息。

[北京]中移九天人工智能科技(北京)有限公司

职位:算法开发岗(智能体与强化学习)-金种子(北京)
发布时间:2026-09-03
工作地点:北京
信息来源:前程无忧(51JOB)
职位类型:全职
职位描述
职能类别:机器学习工程师
工作职责:
1、负责大模型智能体能力建设,负责智能体轨迹数据与RL训练环境体系搭建,分析真实用户场景与任务特性,提取典型任务流程与交互规则,设计构建可复现的容器化、沙箱化任务镜像,探索可验证任务数据生成与自动化评测方法,搭建贴近真实场景的智能体训练与执行环境;
2、深耕大模型智能体与强化学习前沿算法创新,跟踪复现LLM Agent与RL前沿技术,研究PPO、GRPO等算法在大规模语言模型中的应用,探索RL scaling、多任务强化学习、Agentic RL、长时序推理、多步规划、工具调用等核心能力,优化训练稳定性、样本效率与计算效率;
3、研发长程智能体核心能力,设计并优化智能体记忆与检索体系,搭建短期工作记忆与长期外部记忆的分层架构,研究记忆写入、更新、遗忘、冲突消解、上下文压缩等技术,结合RAG、Agentic Retrieval实现智能体主动知识检索,降低长交互Token开销,提升多轮对话状态一致性;
4、聚焦Long Horizon长时序强化学习训练系统研发,攻克百轮级长交互场景下稀疏奖励、信用归因、目标漂移、错误累积等核心难题,结合Critic Model、过程奖励模型(PRM)与环境反馈机制设计有效奖励策略,探索长上下文强化学习、搜索规划融合、自我反思与多Agent协作等优化方案;
5、研究长上下文复杂推理与任务规划技术,实现复杂问题分解、多文档信息整合、长程任务动态规划与状态纠错,解决上下文干扰、关键信息遗漏、跨文档依赖等问题,结合微调、偏好优化与强化学习优化智能体决策与执行闭环;
6、建设智能体与强化学习评测体系,围绕前沿Benchmark与真实业务场景设计自动化评测流程,持续跟踪Agentic RL、长程决策、奖励建模等前沿技术,具备论文复现、Benchmark分析与工程落地优化能力。
任职要求:
1、博士学历,计算机科学、人工智能、机器学习、自然语言处理、数学、自动化等相关专业,具备大模型、智能体、长上下文建模或强化学习相关研究与项目经历;
2、具备扎实的深度学习与NLP基础,深刻理解Transformer架构、注意力机制及大模型训练推理全流程,熟悉长上下文建模、长程依赖、位置外推、上下文干扰等核心技术难点;
3、熟练掌握Python、PyTorch,熟悉大模型后训练全流程,深入理解强化学习原理,熟悉PPO、GRPO等主流RL算法及其应用范式,熟悉VeRL、Slime、ROLL等RL训练框架,熟悉常见的分布式训练与推理加速工具;
4、具备完整智能体系统设计能力,熟练掌握Function Calling、Tool Use、ReAct、多步推理等核心能力,了解RAG、上下文压缩、智能体记忆检索、Agentic Retrieval、Critic Model、过程奖励建模等相关技术;
5、具备完善的数据治理与工程落地能力,可独立完成语料清洗、轨迹标注、数据集构建、实验验证与算法迭代,熟悉长时序信用分配、稀疏奖励优化、长程任务评测体系搭建,具备大规模强化学习管线搭建优化经验;
6、具备良好的科研探索与问题攻坚能力,有NeurIPS、ICML、ICLR、ACL、EMNLP、NAACL等顶会论文、ACM/ICPC等算法竞赛获奖、开源项目贡献或大模型科研项目经验者优先。 公司简要介绍:
公司名称:中移九天人工智能科技(北京)有限公司
公司类型:民营公司
公司规模:10000人以上
公司介绍:中移九天人工智能科技(北京)有限公司,公司规模为10000人以上,公司类型为民营公司,所属行业为通信/网络设备

登录打开APP 查看全部

上一条:没有了

下一条:[北京]中移九天人工智能科技(北京)有限公司

申请该职位 收藏该职位