此信息由浙江大学审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者浙江大学核实,并请同时联系本站处理该转载信息。
[浙江]杭州微纳核芯电子科技有限公司
职位:算子开发工程师
发布时间:2026-09-03
工作地点:其它
信息来源:浙江大学
职位类型:全职
职位描述
杭州微纳核芯电子科技有限公司
招聘信息
算子开发工程师
2026-09-02 21:37:57
职位描述
岗位职责
参与深度学习算子(如Conv、GEMM、Attention等)在自研NPU上的编译器端设计与优化工作,协助完成算子融合、自动代码生成及性能调优任务。
参与高性能算子库的开发与维护,针对计算密集型算子进行硬件特性适配(如向量化、内存访问优化等),提升算子执行效率。
结合主流AI模型结构(如Transformer、扩散模型等),参与定制化编译优化策略的设计与验证,协助提升端到端推理效率。
参与NPU等硬件平台的算子适配工作,在资深工程师指导下解决指令集适配、内存带宽、并行化等性能瓶颈问题。
与算法团队协同,参与编译器技术在模型部署中的创新应用探索。
任职要求
1. 教育背景
专业: 计算机科学、软件工程、电子信息、人工智能、自动化等相关专业,硕士或博士毕业生。
核心知识: 扎实掌握编译原理、计算机体系结构、数据结构与算法、线性代数等核心课程知识。
2. 专业技能
编程语言: 精通 C/C++ 编程,熟悉现代C++特性;熟练使用 Python 进行脚本开发与模型部署实验。
AI编译基础: 了解 TVM、XLA、TensorRT 等至少一种AI编译框架的基本架构与工作流程;理解算子融合、内存布局优化、循环优化等基本编译优化技术。
硬件理解: 对CPU/NPU/GPU等处理器基本架构有基本认知,理解SIMD/SIMT、缓存层次(Cache Hierarchy)、内存带宽等对算子性能的影响。
AI模型基础: 了解主流AI模型(如CNN、Transformer、扩散模型等)的基本计算特性与算子构成,有PyTorch/TensorFlow使用经验者优先。
3. 项目/科研经历(满足任一即可)
有AI编译器或算子开发相关课题或项目经历,完成过算子实现、算子调优或编译优化Pass开发等工作。
有高性能计算(HPC) 或异构编程(CUDA/OpenCL/OpenMP) 相关项目经验,对循环优化、内存优化、并行化等技术有实践体会。
参与过AI模型从训练到推理部署的全流程项目,对模型推理性能优化有一定理解。
有开源编译框架(TVM、MLIR、LLVM等) 使用经验或社区贡献经历。
有NPU/GPU/DSP等异构计算平台的算子开发或适配经验者优先。
有CUDA Kernel开发或Triton语言使用经验者优先。
熟悉Transformer类模型结构或有相关图编译/图优化处理经验者优先。
4. 综合素质
英语能力: 能熟练阅读英文技术文档及学术论文,能够跟进AI编译/系统领域前沿研究成果。
性能思维: 具备良好的性能分析与瓶颈定位能力,对程序优化有浓厚兴趣,有钻研精神。
沟通与协作: 具备良好的团队协作和沟通能力,能够与算法、芯片等团队高效协同。
加分项
有CUDA Kernel开发或OpenCL异构编程实际经验。
了解NPU/DSP等专用加速器架构或RISC-V向量扩展指令集。
有TVM/MLIR/LLVM开源社区代码贡献或实际项目优化案例。
熟悉TensorRT、OpenVINO、ONNX Runtime等推理后端的使用与优化。
有MLSys、PPoPP、ASPLOS等系统/编译器方向顶会论文发表或参与经历。
职位类别:计算机软、硬件/互联网/IT
专业要求:不限
单位简介
微纳核芯(NCC)成立于2021年,是一家全球技术领先的存算一体AI芯片公司,全球首创了三维存算一体3D-CIM 技术体系,通过存内计算CIM + 3D近存在存储器内完成计算,从根本上消除数据搬运开销,突破了数据带宽、计算能效和算力密度瓶颈,破解了 高性能+低功耗+低成本 不可能三角,被视为后摩尔时代延续算力持续增长的核心路径;为AI手机、AI PC、云端智算中心、AI机器人应用提供高性能、低功耗和极致性价比的芯片解决方案。
微纳核芯孵化于浙江省北大信息技术高等研究院,总部位于浙江省杭州市,拥有无锡、合肥、北京子公司和上海、深圳分公司;依托国际领先的创新团队和业界一流的工程化队伍,公司打造出一支以持续创新为驱动力的高效、坚韧、强大的产业团队,已拥有数十名知名高校博士/博士后和头部大厂工程大牛,高层次人才密度领跑行业第一梯队。团队在 芯片设计国际奥林匹克ISSCC 上近六年连续发表十余项突破当前世界纪录的芯片实测成果,稳居全球第一梯队。
联系方式
公司地址
