20000元以上
* 职位描述:
职位描述
1. 主导⼀款或多款国产芯⽚上的推理引擎适配与深度优化,交付可上⽣产的⾼性能推理服务;
2. 深度使⽤国产芯⽚的原⽣编程栈(CANN / MLU-Ops / BangC / MACA / ROCm 类)编写与优化算子;
3. 针对国产芯⽚的架构特点(内存层次、互联拓扑、算⼦库能⼒)重设计 Attention、GEMM、MoE、量 化等关键路径;
4. 与推理系统架构师协同,抽象跨硬件统⼀接⼝,保证国产芯⽚路线与 NVIDIA 路线在框架层复⽤最⼤化;
5. 建⽴国产芯⽚性能基准与调优⽅法论,输出与 NVIDIA 对⻬的性能报告(tokens/s、TTFT、TPOT、每百万 Token 成本);
6. 与国产芯⽚原⼚(如华为、寒武纪等)建⽴技术沟通渠道,推动关键问题解决与新特性落地;
7. 培养团队国产芯⽚⽅向的技术⼒量。
任职要求
1、 计算机 / 电⼦相关本科及以上,有⾼性能计算经验,其中有国产 AI 芯⽚深度优化经验优先; 精通⾄少⼀款国产 AI 芯⽚的编程栈:CANN / Ascend C(昇腾)、BangC / MLU-Ops(寒武纪)、 MACA(沐曦)、DTU(燧原)等;
2、 有可量化的国产芯⽚性能优化战绩(相对芯⽚⼚原⽣实现或 baseline 提升 30%+,或达到 NVIDIA 同 类卡型 70%+ 性能⽔平);深⼊理解 Transformer 推理过程,熟悉 Attention、KV Cache、量化、MoE 等关键结构在国产芯⽚上 的实现难点; 熟悉⾄少⼀款主流开源推理框架(vLLM / lmdeploy / SGLang / MindIE 等),有源码级适配经验; 具备与硬件原⼚协作、推动技术闭环的能⼒。







清昴智能科技(北京)有限公司
招聘信息

津公网安备12010402000967号