此信息由安徽省大中专毕业生就业指导中心审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者安徽省大中专毕业生就业指导中心核实,并请同时联系本站处理该转载信息。
[北京上海]清昴智能科技(北京)有限公司
职位:2026校园招聘
发布时间:2026-08-06
工作地点:北京 上海
信息来源:安徽省大中专毕业生就业指导中心
职位类型:全职
职位描述
清昴智能科技(北京)有限公司2026年秋季招聘简章
招聘单位:清昴智能科技(北京)有限公司
发布日期:2026-08-06
清昴智能2027届“星耀人才”校招简章
?
【企业概况】
清昴智能成立于2022年,聚焦自主可控Agent基础设施(Agent Infra)赛道,获评高新技术企业、专精特新中小企业。我们提出“AaaS(Agent as a Service)”理念,搭建安全、高效、可扩展的AI Agent底层基座,打通AI技术落地商业化的最后一环。
公司打造双核心产品体系:
1. “Token智算底座”:玄武智算云、Token工厂,负责算力管控、推理降本;
2. “Agent治理框架”:MLGuider、Harness,覆盖智能体全生命周期管理。
团队成员源自清华、斯坦福等海内外名校与华为、阿里头部科技企业,已获得多家顶级机构亿元战略投资,处于高速发展阶段。
?
【星耀人才专项计划】
面向顶尖应届毕业生设立,招募致力于解决大模型落地难题的优秀同学:
1. 招募标准:拥有顶会论文/专利、ASC超算等国际赛事奖项、头部AI企业核心实习经历;
2. 专属权益:无上限定薪、一对一成长规划、快速晋升通道、核心架构项目参与资格。
?
【薪酬福利】
1. 保障福利:五险一金、带薪年假、年度免费体检、节日福利;
2. 日常福利:下午茶零食补给、弹性扁平化办公氛围;
3. 成长激励:完善导师带教体系、开源专项奖金、技术分享激励、清晰专家/管理双向晋升通道;
4. 星耀人才专项:上不封顶薪资、定制成长方案、极速晋升通道。
?
【招聘对象】
2027届应届毕业生(毕业时间:2026.09-2027.08,内地以毕业证时间为准,港澳台及海外以学位证时间为准)
工作地点:北京、上海
(部分岗位开设实习,非应届生感兴趣可投递)
?
【岗位1:推理工程师(Senior Inference Engineer)】
职位描述:
1. 在主流开源推理框架(vLLM / SGLang / TensorRT-LLM / lmdeploy 等)基础上做深度?次开发;
2. 参与前沿模型 Day-0 ?持:分析模型结构与权重,完成算?、并?策略、量化和框架适配,推动模型 从发布到?产上线;
3. 参与新模型上架、性能调优、?产事故处置的全链路协作;
4. 撰写可复现的性能报告、压测?案、复盘?档;
5. 阅读模型架构与推理优化?向的前沿论?,验证其中具备业务价值的?案并完成?程化落地;
6. 与推理系统、SRE、性能、存储和?络等技术??横向协作。
?
职位要求:
1、本科及以上,高性能系统 / 分布式后端研发经验;
2、精通 SGLang(首选)/vLLM/TensorRT-LLM/lmdeploy 源码,能独立提交非平凡功能/性能改动;
3、深入理解 Transformer 推理全链路(Attention/KV Cache/量化/投机采样/MoE)及调度问题(Continuous Batching/Chunked Prefill/PD 特征差异);
4、有可量化性能优化战绩,能清晰讲清“做了什么、为什么有效、收益多少”;
5、能读论文并工程化落地,判断方案适用前提与生产可维护性;
6、数据驱动、可复现实验、可对外分享的工程师文化。
专业方向(A 与 B 满足其一即可)
方向 A · 计算/通信算子专项
精通 CUDA 编程及 GPU 架构;熟悉 CUTLASS/Triton;有 Kernel 优化 20%+ 战绩;熟练使用 Nsight 工具(计算子方向);
或:熟悉 NCCL/HCCL 底层实现;深入理解 RDMA/RoCE/InfiniBand;熟悉 TP/PP/EP/SP/CP 通信特征;有通信优化 30%+ 或解决生产级通信故障经验(通信子方向)。
方向 B · 系统与服务专项
精通 Python + C++/Rust;熟悉 gRPC/HTTP2/流式响应/RDMA;有生产级高并发服务调优与排障经验;熟悉 Prometheus/OpenTelemetry。
加分项
开源社区贡献(SGLang/vLLM/FlashAttention等)|FP8 生产部署|H100/H200/国产芯片|MaaS 平台落地|超长上下文/多模态|跨硬件统一抽象|Day-0 接入机制
?
【岗位2:国产芯片推理优化工程师】
职位描述
1. 主导?款或多款国产芯?上的推理引擎适配与深度优化,交付可上?产的?性能推理服务;
2. 深度使?国产芯?的原?编程栈(CANN / MLU-Ops / BangC / MACA / ROCm 类)编写与优化算子;
3. 针对国产芯?的架构特点(内存层次、互联拓扑、算?库能?)重设计 Attention、GEMM、MoE、量 化等关键路径;
4. 与推理系统架构师协同,抽象跨硬件统?接?,保证国产芯?路线与 NVIDIA 路线在框架层复?最?化;
5. 建?国产芯?性能基准与调优?法论,输出与 NVIDIA 对?的性能报告(tokens/s、TTFT、TPOT、每百万 Token 成本);
6. 与国产芯?原?(如华为、寒武纪等)建?技术沟通渠道,推动关键问题解决与新特性落地;
7. 培养团队国产芯??向的技术?量。
?
?任职要求
1、 计算机 / 电?相关本科及以上,有?性能计算经验,其中有国产 AI 芯?深度优化经验优先; 精通?少?款国产 AI 芯?的编程栈:CANN / Ascend C(昇腾)、BangC / MLU-Ops(寒武纪)、 MACA(沐曦)、DTU(燧原)等;
2、 有可量化的国产芯?性能优化战绩(相对芯??原?实现或 baseline 提升 30%+,或达到 NVIDIA 同 类卡型 70%+ 性能?平);深?理解 Transformer 推理过程,熟悉 Attention、KV Cache、量化、MoE 等关键结构在国产芯?上 的实现难点; 熟悉?少?款主流开源推理框架(vLLM / lmdeploy / SGLang / MindIE 等),有源码级适配经验; 具备与硬件原?协作、推动技术闭环的能?。
?
【岗位3:平台后端工程师】?
岗位简介
MaaS商业化落地核心后端岗,承接推理网关、Token计量计费、客户鉴权流量治理全链路开发,搭建稳定可靠的商业化服务底座。
?
岗位职责
1. 计费计量系统:Token精准统计、流式用量聚合、实时账单、对账审计链路开发,保障资金数据准确可追溯;
2. 统一推理网关:OpenAI兼容API、SSE流式转发、长连接保活、标准化错误处理、全量客户请求流量接入;
3. 客户权限体系:API Key签发/校验/轮换、基础访问鉴权;
4. 流量治理:TPM/RPM限流、突发削峰、跨推理副本负载均衡,保障高优客户SLA;
5. 云原生落地:K8s部署、灰度发布、网关&计费链路监控可观测,协同SRE保障线上稳定性。
?
?任职要求
1. 计算机本科及以上,有高性能分布式后端研发经验;
2. 熟练Golang/Python,扎实Linux网络编程功底;
3. 精通K8s云原生体系,有生产集群落地经验;
4. 熟悉微服务、高并发低延迟系统,懂gRPC/SSE/HTTP2流式协议;
5. 99.9%+高可用线上服务开发调优经验。
?
?加分项
1. 对外商业化LLM MaaS平台、OpenAI兼容API后端落地经验;
2. Token计费、账单对账、资金类系统开发经历;
3. Kong/APISIX/Envoy网关二次开发;
4. vLLM/SGLang推理引擎服务封装部署经验。
?
?岗位收益
从0到1搭建MaaS商业化全链路,兼顾通用后端与大模型推理特有业务;与架构师配合主导平台后端落地,成长为商业化平台核心骨干。
?
?
【岗位4:Infra 研发工程师】
职位描述:
1.参与自研推理集群的建设,针对推理负载特征(Prefill/Decode阶段差异、请求长度不KV Cache动态占用)设计显存/带宽感知调度策略,消除GPU资源碎片;
2.优化Kubernetes/Volcano调度框架,支持GPU拓扑(NVLink域、PCIe带宽)感知的推理Pod放置,降低跨卡通信对推理尾延迟(P99)的影响;
3.设计推理任务的弹性排队与优先级抢占机制,保障高优业务在资源争抢下的服务质量。
4.探索GPU显存与算力的动态切分技术(MIG/时间分片),将单卡按需分配给多个轻量推理负载,提升卡级利用率。
5.构建推理集群的过载保护与全局流控体系,规避突发流量下的集群雪崩(如排队超时、OOM);
?
职位要求:
1.硕士以上学历优先,计算机、电子信息等相关专业。
2.深入理解进程调度、内存管理、I/O模型与网络协议栈,熟练使用perf/eBPF等工具进行系统级性能分析;
3.了解大语言模型推理的基本流程(Prefill + Decode),清楚KV Cache对显存占用的影响,理解批处理(Continuous Batching)对吞吐和延迟的权衡关系;熟悉至少一种推理框架(vLLM、TGI、TensorRT-LLM、SGLang)的基本架构。
?
加分项
1.有Kubernetes Scheduler Framework扩展或Volcano/Kueue等批量调度系统开发经验;
2.熟悉eBPF编程,有基于Cilium或自定义探针对网络/内核延迟的监控实践;
3.了解vLLM/TensorRT-LLM的源码或有过二次开发经验;
4.熟悉PD(Prefill-Decode)分离部署架构或KV Cache分布式缓存等前沿推理集群方案;
5.有大规模在线推理服务(日均百万级请求)的压测与调优经验;
6.在ACM/ICPC等编程竞赛获奖,或有系统顶会(OSDI/SOSP/ATC)论文发表。
?
【岗位5:大模型推理测试开发工程师】
岗位职责
1.测试策略与方案设计
-负责大模型推理集群的全链路质量保障,制定功能、性能、稳定性、安全等维度的测试策略与计划。
-深入理解推理引擎(如vLLM、TensorRT- LLM、TGI等)、调度系统与GPU集群架构,设计高覆盖、可复用的测试方案。
2.功能与精度验证
-验证模型推理结果的正确性与数值精度(如与训练框架对齐、不同量化精度对比),确保多模型、多版本、多硬件环境下的输出一致性。
-构造覆盖正常、边界、异常、对抗性的测试用例,评估提示词鲁棒性、多轮对话记忆、长上下文等特性。
3.性能与压力测试
-设计并执行延迟、吞吐、首token时间、并发用户数等关键指标的压测方案,建立性能基线。
-分析GPU利用率、显存占用、网络带宽、调度延迟等瓶颈,配合研发团队进行性能调优与回归验证。
4.稳定性与混沌工程
-开展长时间稳定性测试,验证内存泄漏、显存碎片、资源回收、故障自愈等能力。
-引入故障注入(节点宕机、网络分区、GPU错误、Etcd异常等),检验集群高可用与容错机制。
5.自动化测试与工具链建设
-搭建持续集成/持续测试流水线,开发自动化测试框架与工具沉淀测试数据集(模型集对话集、压力脚本)。
-实现指标监控、日志采集、异常检测的自动化链路,推动测试左移与质量门禁建设。
6.缺陷管理与质量分析
-全流程跟踪缺陷,准确定位至组件层(推理引擎、调度器、网关、模型服务、节点环境),推动高效闭环。
-定期输出质量报告,量化风险,提出改进建议,参与发布评审与上线决策。
?
任职要求必备条件
学历与经验:全日制本科及以上学历,计算机科学、软件工程等相关专业;有质量保障或系统测试经验优先,有从事大型分布式系统或AI基础设施测试经验优先。
编程能力:熟练掌握Python/Shell,具备良好的编码习惯,能够开发复杂测试工具与脚本。
大模型推理知识:理解Transformer架构及推理流程(Prefill/Decode、KV Cache、
Continuous Batching、PagedAttention等),熟悉至少一种主流推理框架(vLLM、TensorRT-LLM、SGLang、TGI、Triton Inference Server) .
性能工程:有丰富的性能测试经验,熟练使用 Locust、JMeter、wrk或自研压测平台;能独立分析 GPU Profile(Nsight Systems/ncu)、 Trace数据并定位瓶颈。
集群与云原生:熟悉Kubernetes、Docker,掌握GPU Operator、Volcano/Koordinator等调度器原理,理解InfiniBand/RoCE网络、并行文件系统等基础。
思维与沟通:具备优秀的逻辑分析、问题拆解能力,强质量风险意识,良好的团队协作与推动能力。
?
加分项
-有大模型训练/微调经验,了解Megatron, DeepSpeed PEFT技术。
-熟悉MLPerf、LLMPerf或内部基准测试体系,有服务器性能调优经验。
-掌握Go/Rust/C++中的一种,能阅读推理框架源码并编写扩展。
-有构建模型评测平台、自动化模型质量监控体系的经验。
-熟悉安全测试,对模型提示注入、隐私泄露等风险有验证经验。
?
我们能提供
-参与构建千卡至万卡级推理集群,直面超大并发场景的挑战。
-紧跟前沿的推理加速技术(Speculative
Decoding、FP8量化、MoE并行等),与资深工程及算法团队紧密协作
?
【岗位6:AI推理引擎工程师(Agent优化方向)】
职位描述
1. 参与智能体自动化优化框架的设计与实现,构建“感知-决策-执行-反馈”闭环系统,覆盖算子生成、图调度、内存管理等环节。
2. 开发Agent与编译工具链(编译器、性能分析器、运行时)的标准化交互接口,实现优化流程自动化。
3. 利用自动化代码生成或搜索技术,对CUDA/Triton/OpenCL等异构算子进行性能调优,探索Agent自主编写或重构高性能内核的方法。
4. 建立性能回归测试与反馈机制,持续提升算子库在多硬件(A100/H100/国产NPU)上的效率。
5. 参与计算图融合、并行调度、内存复用等Pass的自动化改造,使框架能根据输入特征和硬件状态动态调整执行计划。
6. 协助构建代价模型(Cost Model)的在线学习与校准模块。
7. 开发自动化评测与实验管理平台,支持多模型(LLM/ViT等)在多硬件上的快速验证。
8. 参与搭建CI/CD流水线,确保优化效果的稳定性和可重复性。
9. 跟踪MLSys、AutoML、代码生成等领域前沿成果,推动有效方法落地生产环境。
?
职位要求
1、计算机、人工智能、电子工程等相关专业,硕士/博士在读(优秀本科生可放宽)。
2、扎实的C++和Python编程能力,熟悉Linux开发环境,具备良好的工程实践(版本控制、单元测试、CI/CD)。了解计算机体系结构、内存模型、并行计算基础知识。
3、对至少一种异构编程模型(CUDA/OpenCL/Triton)有实际使用或系统学习经历。
4、熟悉PyTorch/TensorFlow等深度学习框架基本原理,了解推理引擎(如TensorRT、ONNX Runtime、TVM、MLIR)常见架构。
5、对性能优化有浓厚兴趣,具备数据分析与瓶颈定位能力,自驱力强,能独立解决问题。
?
加分项(非必需,但优先)
1、有使用智能体或自动调优技术(如AutoTVM、Ansor)进行算子/图优化的项目经验。
2、熟悉编码智能体系统(如Claude Code、Cursor、Aider等),有将其应用于自动化开发或代码生成的经验。
3、熟悉编译原理、LLVM/MLIR中间表示,或有自定义Pass开发经历。
4、有性能分析工具(NVIDIA Nsight、Perf、VTune等)实际使用经验,能定位微架构级性能瓶颈。
5、有开源推理引擎(如TVM、OpenPPL、FastTransformer)贡献经历。在MLSys、ASPLOS、CGO、ICLR等会议发表过相关论文。
?
【岗位7:Agent 研发工程师】
职位描述
1.参与自研Agent Harness框架的核心模块设计与开发,包括但不限于:Agent执行循环(Loop) :构建ReAct、Plan-and-Execute等多范式执行引擎,支持工具分发、传感器反馈与自动修复(auto-fix),在Token预算约束下运行直至任务可验证完成;
2、工具调用(Tool Calling)与函数编排:设计工具注册、参数解析、权限分级与调用链路追踪机制,支持MCP(Model Context Protocol)等标准化工具协议接入;
3、记忆系统(Memory) :构建三层本地记忆架构——程序性记忆(Skills)、语义记忆(Facts)、情景记忆(可检索历史),实现跨会话知识累积;
4、多Agent协作与子Agent调度:设计复杂任务分解、子Agent委派与结果聚合的编排引擎;
5、设计Agent分级自主机制(如L1报告级 → L2人工辅助级 → L3无人值守级),让Agent在信任建立过程中渐进式获得自主权;
6、实现操作系统级沙箱隔离(如Linux Bubblewrap / macOS Seatbelt),确保Agent执行的工具操作安全可控;
7、构建Agent行为的可观测性体系(Telemetry),对每一次工具调用、模型推理、子Agent调度进行结构化追踪与回放。
?
职位要求:
1.硕士以上学历,计算机、人工智能等相关专业。
2.入理解大语言模型的基本原理与调用范式(Function Calling、Tool Use、ReAct等);了解 LangChain、LlamaIndex、AutoGen 等至少一种主流Agent开发框架的核心原理。
3.对AI Agent技术有强烈的好奇心与探索欲,热衷于将前沿模型能力转化为可用的工程产品;
4.具备系统性思维与复杂问题拆解能力,能够从模型层到系统层全局思考问题;
5.优秀的团队协作与沟通能力。
?
加分项
1.有Agent/Harness相关开源项目贡献或个人项目实践(如基于LangChain/AutoGen等框架构建的完整Agent应用);
2.了解MCP(Model Context Protocol)等Agent工具调用标准协议; ?
?
【岗位8:招聘专员】
职位描述
1.熟练运用并持续拓展各类招聘渠道(主流招聘平台、社交招聘、内推、猎头合作、行业社群、技术社区等),针对不同岗位类型匹配最优渠道组合。
2.针对紧急或高端岗位,能够快速绘制目标公司/目标行业的人才地图(Mapping)
3.负责简历筛选、初步电话/视频面试,对候选人的专业能力、综合素质、文化匹配度进行初步判断;
4.协调面试官时间,组织并跟进技术面试、交叉面试、高管面试等环节,确保流程高效顺畅;
5.参与面试评估标准的制定与优化,提升面试官团队的识人能力。
职位要求
1.本科及以上学历,人力资源管理相关专业。
2.熟悉招聘全流程操作,了解常用人才测评工具与面试方法(如结构化面试、行为面试法等。
3.出色的沟通与谈判能力:能与不同层级(应届生到高管)、不同背景的候选人及面试官进行有效对话;
4.极强的目标导向与抗压能力:能在多岗位并行推进的情况下,保质保量完成招聘交付;
5.敏锐的人才洞察力:能从简历和对话中快速识别关键信息,判断人岗匹配度;
?
【招聘流程】
P0首批急招岗,简历匹配快速推进面试
简历投递 → 技术面试 → HR综合面试 → 发放意向Offer → 实习/正式入职
?
【投递方式】
1、平台投递
2、邮箱直递:简历命名「姓名-意向岗位-联系方式」发送至官方招聘邮箱hr@;
?
?【公司地址】
北京:海淀区东升大厦B座5层
上海:浦东新区郭守敬路498号19号楼1层
?
上一条:[北京]联想(北京)有限公司
