首页 > 其它 全职 > 职位详细
说明:

此信息由浙江大学审核并发布(查看原发布网址),应届生求职网转载该信息只是出于传递更多就业招聘信息,促进大学生就业的目的。如您对此转载信息有疑义,请与原信息发布者浙江大学核实,并请同时联系本站处理该转载信息。

[杭州]杭州小影创新科技股份有限公司

职位:视觉|音频多模态大模型算法工程师
发布时间:2026-09-23
工作地点:其它
信息来源:浙江大学
职位类型:全职
专业标签:数学类 物理学 自动化 计算机
职位描述
杭州小影创新科技股份有限公司

招聘信息

多模态大模型算法工程师—视觉 × 音频

2026-09-23 11:42:07

职位描述

让 AI 听懂音乐,并把音乐变成画面。
岗位介绍
如果你对 AIGC、视觉大模型、音频、音乐、视频生成、多模态 AI 感兴趣,这个方向非常适合你。我们正在探索下一代视觉-音频多模态生成能力,让 AI 不只是生成一张图片,而是能够理解 画面 + 人物 + 音乐 + 歌词 + 节奏 + 情绪 ,并进一步生成完整的视频内容。
你将负责

参与视觉、音频及多模态大模型研发;

研究图像、视频、音频之间的跨模态理解与生成;

参与 T2V / I2V / S2V / A2V 等生成模型研究;

研究音乐、歌词、节奏、情绪与视觉内容之间的关联;

参与人物驱动、歌唱视频、Lip Sync 等技术研发;

构建多模态数据集、训练 Pipeline 和模型评测体系;

探索多模态 Agent,实现 理解 创作 生成 的完整流程。

我们希望你

计算机、人工智能、软件工程、自动化、电子信息、数学、声学等相关专业;硕士优先,本科优秀毕业生同样欢迎;

掌握 Python / C++,掌握机器学习、深度学习基础;

了解 Transformer / Diffusion / Multimodal LLM;

对计算机视觉、语音、音频、NLP 至少一个方向有深入了解。

加分项

有 CVPR / ICCV / ECCV / NeurIPS / ICASSP / INTERSPEECH / ACM MM 等相关研究经历;

有 Stable Diffusion、Flux、Wan、Qwen、LLaMA 等模型实践经验;

有 ASR / TTS / 音频分析 / 音乐生成项目经验;

熟悉 CLIP、VLM、LLM、AudioLM 等多模态技术;

有 AIGC、视频生成、数字人、Lip Sync、LoRA 微调或数据集构建经验。

职位类别:计算机软、硬件/互联网/IT

专业要求:不限

单位简介

联系方式

公司地址

登录打开APP 查看全部

上一条:[浙江]浙江恒拓电子科技有限公司

下一条:[杭州]杭州小影创新科技股份有限公司

相关招聘信息:

[深圳]深圳市紫光同创电子股份有限公司 2027招聘混合信号设计工程师(2026-09-23,深圳 其它) [杭州]杭州小影创新科技股份有限公司 视觉|音频多模态大模型算法工程师(2026-09-23,其它) [广东]东莞市以纯集团有限公司 数据分析(2026-09-23,其它) [深圳]深圳市紫光同创电子股份有限公司 2027招聘数字电路设计工程师(2026-09-23,深圳 其它) [深圳]深圳市紫光同创电子股份有限公司 2027招聘软件开发工程师(2026-09-23,深圳 其它) [广东]东莞市以纯集团有限公司 商品运营(2026-09-23,其它)