此信息由五邑大学审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者五邑大学核实,并请同时联系本站处理该转载信息。
[上海]深圳虾皮信息科技有限公司
职位:大模型对齐算法工程师
发布时间:2026-08-29
工作地点:上海
信息来源:五邑大学
职位类型:兼职
职位描述
深圳虾皮信息科技有限公司
(ASPIntern)LLM-大模型对齐算法工程师
20K-40K/月 上海 上海市 硕士及以上
发布时间:2026年8月28日
职位描述
岗位职责:
关于团队
Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 的演进。当前我们正聚焦下一代基座大模型(Compass V4,MoE 架构)的 Post-training,目标是在数学、代码、逻辑推理、指令遵循、长文本、多语言等核心能力上全面对标并超越业界最新开源模型。
岗位描述
我们正在系统性地推进大模型的能力对齐(Alignment),覆盖 Mid-training → SFT → RL 的全链路优化:用 mid-training 补齐基座能力上限,用 SFT 冷启,用全方位的强化学习算法(PPO、GRPO、DPO等)把模型潜力锐化为稳定可靠的输出。你将参与 Reasoning(数学 / 逻辑 / STEM)、Coding(代码生成 / SWE Agent)、General(指令遵循 / 多轮 / 长文本 / 多语言)中一个或多个方向的算法与数据建设,推动自训模型在关键 benchmark 上追平至超越目标模型。
重点研究方向
模型训练机理与可解释性。Motivation:Scaling 收益正显现边际递减效应,低垂的果实已被快速收获,新的突破必须从底层原理出发——深入理解 mid-training / SFT / RL 过程中模型能力如何形成、迁移与遗忘,为训练决策提供机理级依据而非经验试错。
强化学习与模型能力边界提升。Motivation:前瞻性的强化学习技术储备。实验计划:细粒度反馈(fine-grained / process-level feedback)、类 AlphaZero 的自我探索(self-play / self-exploration)提升基础模型的能力上限。
多领域能力合并(Multi-domain Merge)。研究在合并多个能力域(数学 / 代码 / 逻辑 / 指令遵循 / 长文本等)时如何减少相互掉点,探索达到帕累托最优的合并算法。
数据构建。面向数学、代码、逻辑、STEM 等推理能力的高质量数据构建,包括:长思维链(long CoT)轨迹的合成与蒸馏、教师选型与胜者筛选、可验证答案 / 用例的自动生成、按考点分布与失败机制的定向配比、难度分层与去污染,以及 generate → verify → filter → train → regenerate 的自迭代闭环。
岗位职责
参与 Mid-training / SFT / RL 全链路 post-training 方法的研究与落地,掌握并灵活运用全方位的强化学习算法,包括 PPO、GRPO、DPO 等,在真实训练环境中做能力对齐。
参与各阶段的联合优化:mid-training 的数据配比与基座能力抬升、SFT 的教师选型与配方、RL 的奖励设计与策略优化,理解并权衡三个阶段在能力天花板(pass@k)与稳定输出(pass@1)上的分工。
探究 post-training 的 scaling 规律与能力边界提升,例如如何做更久 / 更稳定的 RL(延长有效训练步数、缓解熵坍缩与奖励饱和)、细粒度 / 过程级反馈(fine-grained / process reward),以及类 AlphaZero 的自我探索(self-play / self-exploration),持续抬升基础模型的能力上限。
设计并实现奖励信号与自动评测器(如代码判题、数学答案校验、指令约束校验、Agent 任务成功率),保证 reward 正确性锚定在模型之外、不产生自我强化误差。
参与高质量训练数据构建:数据合成与蒸馏、去重去污染、质量打分、失败样本挖掘、偏好数据构建,以及按「有效监督 token / 考点分布 / 失败机制」的定向配比策略。
打通并优化 mid-training / SFT / RL 的训推链路(如 verl / SGLang / vLLM / Megatron),定位并修复训推不一致、熵坍缩、显存与吞吐瓶颈等工程问题。
跟踪 LLM post-training、RL for LLM、reasoning models、Agentic RL、agent evaluation 等方向的前沿论文与开源框架,并快速复现或落地。
岗位要求:
岗位要求
计算机、人工智能、机器学习、数学等相关专业硕士或博士在读。
熟悉机器学习与深度学习基础,了解大模型训练、微调或 post-training 的基本流程。
对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。
熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。
对 LLM 的推理能力、代码智能体、指令遵循、多轮对话、RAG、长文本或多语言中的一个或多个方向有兴趣或实践经验。
能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。
每周可实习 4 天及以上,实习期 3 个月以上优先。
加分项
有 LLM post-training、SFT、RLHF、RLAIF、DPO、PPO、GRPO、RLVR 等实践经验。
熟悉 verl、TRL、Ray、vLLM、SGLang、Megatron、DeepSpeed 等训练 / 推理框架。
有数据合成与蒸馏、reward design、自动判题、trajectory analysis、sandbox execution、Docker / 容器环境经验。
在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。
有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。
你将获得
深入参与前沿 LLM Mid-training / SFT / RL 全链路 post-training 方向的研究与落地,直接对标业界最新开源模型。
接触真实的大规模训练与推理环境、可验证奖励体系、诊断驱动的数据引擎和完整的实验流程。
与算法、工程、产品团队协作,将研究结果转化为下一代基座模型的核心能力。
有机会产出论文、技术报告、开源项目或核心业务成果。
投递说明:
网申/内推 > 2-3轮专业面试 > HR沟通 > Offer
单位简介
Shopee是东南亚领航电商平台,覆盖新加坡、马来西亚、菲律宾、印度尼西亚、泰国及越南等市场,同时在中国深圳、上海和香港设立跨境业务办公室。2019 年 Shopee总订单量高达12亿,同比增长100.5%。根据权威移动数据分析平台 App Annie,2019年Shopee强势跻身全球购物类App下载量前五,同时斩获东南亚及中国台湾市场购物类App年度总下载量、平均月活数、安卓使用总时长三项冠军,并领跑东南亚两大头部市场,拿下印尼及越南年度购物类App下载量与月活量双冠王。 
提示:在微信扫描关注,可以直接投递简历哟
深圳虾皮信息科技有限公司
领域:信息传输、软件和信息技术服务业
规模:1000-5000人
地址:深圳市南山区粤海街道高新区社区科技南一路28号达实大厦3302
上一条:[上海]深圳虾皮信息科技有限公司
下一条:[上海]上海沪超会务服务有限公司
