此信息由四川大学审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者四川大学核实,并请同时联系本站处理该转载信息。
[上海]深圳虾皮信息科技有限公司
职位:ASP Intern LLM-大模型对齐算法工程师
发布时间:2026-08-28
工作地点:上海
信息来源:四川大学
职位类型:全职
职位描述
(ASP Intern)LLM-大模型对齐算法工程师
发布企业:深圳虾皮信息科技有限公司 丨 发布时间:2026-08-20
职位信息
职位名称 类型 性质 最低学历要求 人数 薪资
(ASP Intern)LLM-大模型对齐算法工程师 前端|后端|系统集成|软件开发 实习 硕士 5 20000以上
发布时间 2026-08-20 16:53:35
职位有效期 2026-11-29 23:59:59
专业 人工智能;信号与信息处理;信息与通信工程;信息安全;信息系统安全;光电信息工程;数学;数理统计;新一代电子信息技术(含量子技术等);计算金融交叉试验班;通信与信息系统;通信工程
工作地址 上海市市辖区松江区
职位要求 岗位要求计算机、人工智能、机器学习、数学等相关专业硕士或博士在读。熟悉机器学习与深度学习基础,了解大模型训练、微调或 post-training 的基本流程。对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。对 LLM 的推理能力、代码智能体、指令遵循、多轮对话、RAG、长文本或多语言中的一个或多个方向有兴趣或实践经验。能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。每周可实习 4 天及以上,实习期 3 个月以上优先。加分项有 LLM post-training、SFT、RLHF、RLAIF、DPO、PPO、GRPO、RLVR 等实践经验。熟悉 verl、TRL、Ray、vLLM、SGLang、Megatron、DeepSpeed 等训练 / 推理框架。有数据合成与蒸馏、reward design、自动判题、trajectory analysis、sandbox execution、Docker / 容器环境经验。在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。你将获得深入参与前沿 LLM Mid-training / SFT / RL 全链路 post-training 方向的研究与落地,直接对标业界最新开源模型。接触真实的大规模训练与推理环境、可验证奖励体系、诊断驱动的数据引擎和完整的实验流程。与算法、工程、产品团队协作,将研究结果转化为下一代基座模型的核心能力。有机会产出论文、技术报告、开源项目或核心业务成果。
政治面貌 无要求
实习实践经验 有要求
职位简介 岗位描述 我们正在系统性地推进大模型的能力对齐(Alignment),覆盖 Mid-training SFT RL 的全链路优化:用 mid-training 补齐基座能力上限,用 SFT 冷启,用全方位的强化学习算法(PPO、GRPO、DPO等)把模型潜力锐化为稳定可靠的输出。你将参与 Reasoning(数学 / 逻辑 / STEM)、Coding(代码生成 / SWE Agent)、General(指令遵循 / 多轮 / 长文本 / 多语言)中一个或多个方向的算法与数据建设,推动自训模型在关键 benchmark 上追平至超越目标模型。 重点研究方向 模型训练机理与可解释性。Motivation:Scaling 收益正显现边际递减效应,低垂的果实已被快速收获,新的突破必须从底层原理出发 深入理解 mid-training / SFT / RL 过程中模型能力如何形成、迁移与遗忘,为训练决策提供机理级依据而非经验试错。 强化学习与模型能力边界提升。Motivation:前瞻性的强化学习技术储备。实验计划:细粒度反馈(fine-grained / process-level feedback)、类 AlphaZero 的自我探索(self-play / self-exploration)提升基础模型的能力上限。 多领域能力合并(Multi-domain Merge)。研究在合并多个能力域(数学 / 代码 / 逻辑 / 指令遵循 / 长文本等)时如何减少相互掉点,探索达到帕累托最优的合并算法。 数据构建。面向数学、代码、逻辑、STEM 等推理能力的高质量数据构建,包括:长思维链(long CoT)轨迹的合成与蒸馏、教师选型与胜者筛选、可验证答案 / 用例的自动生成、按考点分布与失败机制的定向配比、难度分层与去污染,以及 generate verify filter train regenerate 的自迭代闭环。 投递方式 进入校招官网,选择心仪的岗位网申: ap***com[点击查看] 联系我们 微信公众号:Shopee虾皮招聘 官方招聘小红书:Shopee 校招咨询邮箱:campus.cndc@
岗位职责 岗位职责参与 Mid-training / SFT / RL 全链路 post-training 方法的研究与落地,掌握并灵活运用全方位的强化学习算法,包括 PPO、GRPO、DPO 等,在真实训练环境中做能力对齐。参与各阶段的联合优化:mid-training 的数据配比与基座能力抬升、SFT 的教师选型与配方、RL 的奖励设计与策略优化,理解并权衡三个阶段在能力天花板(pass@k)与稳定输出(pass@1)上的分工。探究 post-training 的 scaling 规律与能力边界提升,例如如何做更久 / 更稳定的 RL(延长有效训练步数、缓解熵坍缩与奖励饱和)、细粒度 / 过程级反馈(fine-grained / process reward),以及类 AlphaZero 的自我探索(self-play / self-exploration),持续抬升基础模型的能力上限。设计并实现奖励信号与自动评测器(如代码判题、数学答案校验、指令约束校验、Agent 任务成功率),保证 reward 正确性锚定在模型之外、不产生自我强化误差。参与高质量训练数据构建:数据合成与蒸馏、去重去污染、质量打分、失败样本挖掘、偏好数据构建,以及按「有效监督 token / 考点分布 / 失败机制」的定向配比策略。打通并优化 mid-training / SFT / RL 的训推链路(如 verl / SGLang / vLLM / Megatron),定位并修复训推不一致、熵坍缩、显存与吞吐瓶颈等工程问题。跟踪 LLM post-training、RL for LLM、reasoning models、Agentic RL、agent evaluation 等方向的前沿论文与开源框架,并快速复现或落地。
单位信息
单位名称 深圳虾皮信息科技有限公司 
单位性质 三资企业 单位行业 信息传输、软件和信息技术服务业
标签
隶属单位 下属单位 单位官微
单位图片
视频介绍
单位介绍 Shopee是东南亚领航电商平台,覆盖新加坡、马来西亚、菲律宾、印度尼西亚、泰国及越南等市场。改变数百万人的生活方式,与我们一起创造历史!
上一条:[上海]深圳虾皮信息科技有限公司
下一条:[上海]浙江时空道宇科技有限公司
