此信息由南开大学审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者南开大学核实,并请同时联系本站处理该转载信息。
[浙江]杭州阿里巴巴海外数字商业有限公司
职位:Agentic模型后训练算法研究员
发布时间:2026-09-14
工作地点:其它
信息来源:南开大学
职位类型:兼职
专业标签:数学类 计算机
职位描述
算法研究员-Agentic模型后训练
杭州阿里巴巴海外数字商业有限公司
职位投递网址链接:ca***com[点击查看]
工作地域:浙江省
职位类别:其他专业技术人员
学历要求:硕士研究生 / 博士研究生
招聘人数:5人
发布时间:2026-09-11
* 专业要求:
1. 深厚的技术背景:计算机、信息科学、数学或相关专业硕士/博士学位,业界AI/Agent团队的相关实习和工作经验;
2. 有较好工程能力,有Coding/Search Agent构建、Agent记忆系统构建、Multi-agent协作设计者优先;
3. 有较强的自驱力、学习力、创新力和抗压能力,能够跟上正在快速变化的AI时代;
4. 加分项:在ICLR、CVPR、ICCV、ACL、NeurIPS等顶会上发表过高质量论文,有高质量github开源项目者优先。
* 职位描述:
一、团队介绍
团队负责Accio Agentic模型整体后训练,核心关注coding和computer use能力,现有团队成员来自Top Tier大厂的基模团队,大多毕业于清华/上交等知名院校,有训练 T 级规模模型的经验,团队支持项目开源和顶会论文发表。
二、职责描述
1. 核心模型演进: 深度参与大规模Agentic LLM的全链路研发,涵盖Mid-train/CPT、SFT 及RL阶段,探索领域知识增强与多任务学习的前沿技术,表现突出者可在核心tech report中署名。
2. 工程化与基准建设: 参与构建代码库级别的Benchmark,优化模型在多语言、多框架环境下的跨模块调用与依赖分析性能。
3. Black-box Agent RL & Online Learning
a. 策略建模与优化: 深入研究Black-box Reward/Value Function的建模,解决Agent在不可导环境反馈下的策略梯度估计问题。
b. 持续探索架构: 设计并实现高性能的Online RL框架,支持Agent在真实操作系统与开发环境中进行大规模并发探索与在线策略迭代。
c. 长程推理研究: 针对Long-horizon RL场景,攻克Credit Assignment(信用分配)难题,提升Agent在多步推理(Multi-step Reasoning)下的决策稳定性。
4. Computer-Use Agent系统建设
a. 全链路数据Scaling: 参与构建海量真实用户交互数据的自动化生产流水线,覆盖办公场景与自动化流程,实现数据的高效回流与训练闭环。
b. 数字任务执行核: 开发基于Bash、Skills、MCP(Model Context Protocol)的执行引擎,构建能够熟练使用各种CLI工具与数字插件的Agent核心模型。
c. 多场景交互闭环: 探索Agent与真实操作系统、浏览器及专业开发环境的交互,在 Terminal、MLE-bench等复杂基准测试中验证模型的端到端任务完成率。
上一条:[广东]珠海安保集团有限公司
相关招聘信息:
[浙江]杭州阿里巴巴海外数字商业有限公司 Agent Harness算法研究(2026-09-14,其它) [浙江]杭州阿里巴巴海外数字商业有限公司 Agentic模型后训练算法研究员(2026-09-14,其它) [宁波-奉化区]宁波市奉化区人才服务中心 工程师(2026-09-14,其它) [甘肃]甘肃巨化新材料有限公司 2027招聘计划与成本管理工程师(2026-09-12,其它) [北京天津成都陕西其它]北京市昆仑数智科技有限责任公司 2027校园招聘算法与数据工程|数智化与信息工程|能源化工业务咨询顾问|产品与业务咨询顾问(2026-09-12,北京 天津 成都 其它) [北京山西]煤炭科学技术研究院有限公司 2027校园招聘(2026-09-12,北京 其它)