职位描述
岗位职责:
1、深入研究 DeepSeek V4、Qwen、LLaMA 等主流大模型架构(Transformer、MoE、MLA/CSA/HCA 注意力机制),分析其在硬件部署中的计算特征与访存瓶颈;
2、参与 FP8/FP4/INT8 量化方案的设计与验证,在精度与硬件效率之间寻找最优解;
3、设计高性能矩阵乘加速器,支持 FP8/INT8 计算与 FP32 累加,适配 prefill 与 decode 两种推理阶段;
4、算子优化和实现: Flash Attention 分块计算、在线 Softmax、RoPE 旋转编码、滑动窗口注意力,以及 CSA 压缩器与 Lightning Indexer(Top-k 稀疏检索)等;
5、用户需求算法在产品中的落地实现,协同软硬件进行产品交付和维护。
任职要求:
1、硕士及以上学历,2027届应届毕业生(优秀本科生可破格考虑)
2、熟练掌握 Python / C/C++;熟悉至少一种硬件描述语言(Verilog / SystemVerilog / VHDL)或高层次综合工具(Vitis HLS / oneAPI);
3、具有一定算法基础,扎实的线性代数、概率统计基础;理解 Transformer 架构基本原理(Self-Attention、Multi-Head Attention、FFN等);
4、扎实的硬件基础:理解数字电路设计基本概念(组合逻辑、时序逻辑、流水线、状态机);了解 FPGA 基本资源结构(LUT、DSP Slice、BRAM/URAM、HBM);
5、素质要求:具备强烈的求知欲与自驱力,优秀的团队协作与沟通能力。
注:一人一薪,具体薪资结构请以面试评估结果和签约情况为准。