20000元以上
* 职位描述:
职位描述:
1. 在主流开源推理框架(vLLM / SGLang / TensorRT-LLM / lmdeploy 等)基础上做深度⼆次开发;
2. 参与前沿模型 Day-0 ⽀持:分析模型结构与权重,完成算⼦、并⾏策略、量化和框架适配,推动模型 从发布到⽣产上线;
3. 参与新模型上架、性能调优、⽣产事故处置的全链路协作;
4. 撰写可复现的性能报告、压测⽅案、复盘⽂档;
5. 阅读模型架构与推理优化⽅向的前沿论⽂,验证其中具备业务价值的⽅案并完成⼯程化落地;
6. 与推理系统、SRE、性能、存储和⽹络等技术⻆⾊横向协作。
职位要求:
1、本科及以上,高性能系统 / 分布式后端研发经验;
2、精通 SGLang(首选)/vLLM/TensorRT-LLM/lmdeploy 源码,能独立提交非平凡功能/性能改动;
3、深入理解 Transformer 推理全链路(Attention/KV Cache/量化/投机采样/MoE)及调度问题(Continuous Batching/Chunked Prefill/PD 特征差异);
4、有可量化性能优化战绩,能清晰讲清“做了什么、为什么有效、收益多少”;
5、能读论文并工程化落地,判断方案适用前提与生产可维护性;
6、数据驱动、可复现实验、可对外分享的工程师文化。
专业方向(A 与 B 满足其一即可)
方向 A · 计算/通信算子专项
精通 CUDA 编程及 GPU 架构;熟悉 CUTLASS/Triton;有 Kernel 优化 20%+ 战绩;熟练使用 Nsight 工具(计算子方向);
或:熟悉 NCCL/HCCL 底层实现;深入理解 RDMA/RoCE/InfiniBand;熟悉 TP/PP/EP/SP/CP 通信特征;有通信优化 30%+ 或解决生产级通信故障经验(通信子方向)。
方向 B · 系统与服务专项
精通 Python + C++/Rust;熟悉 gRPC/HTTP2/流式响应/RDMA;有生产级高并发服务调优与排障经验;熟悉 Prometheus/OpenTelemetry。
加分项
开源社区贡献(SGLang/vLLM/FlashAttention等)|FP8 生产部署|H100/H200/国产芯片|MaaS 平台落地|超长上下文/多模态|跨硬件统一抽象|Day-0 接入机制







清昴智能科技(北京)有限公司
招聘信息

津公网安备12010402000967号