企业登录
当前位置:首页 > 学生 > 招聘信息
招聘信息
Infra 研发工程师

20000元以上

职位投递邮箱:hr@tsingmao.com
工作地域:北京市
职位类别: -
学历要求:本科 / 硕士研究生 / 博士研究生
招聘人数:5人
发布时间:2026-08-04浏览量:81

* 职位描述:

职位描述:

1. 参与自研推理集群的建设,针对推理负载特征(Prefill/Decode阶段差异、请求长度不KV Cache动态占用)设计显存/带宽感知调度策略,消除GPU资源碎片;

2. 优化Kubernetes/Volcano调度框架,支持GPU拓扑(NVLink域、PCIe带宽)感知的推理Pod放置,降低跨卡通信对推理尾延迟(P99)的影响;

3. 设计推理任务的弹性排队与优先级抢占机制,保障高优业务在资源争抢下的服务质量。

4. 探索GPU显存与算力的动态切分技术(MIG/时间分片),将单卡按需分配给多个轻量推理负载,提升卡级利用率。

5. 构建推理集群的过载保护与全局流控体系,规避突发流量下的集群雪崩(如排队超时、OOM);

职位要求:

1.硕士以上学历优先,计算机、电子信息等相关专业。

2.深入理解进程调度、内存管理、I/O模型与网络协议栈,熟练使用perf/eBPF等工具进行系统级性能分析;

3.了解大语言模型推理的基本流程(Prefill + Decode),清楚KV Cache对显存占用的影响,理解批处理(Continuous Batching)对吞吐和延迟的权衡关系;熟悉至少一种推理框架(vLLM、TGI、TensorRT-LLM、SGLang)的基本架构。

加分项

1.有Kubernetes Scheduler Framework扩展或Volcano/Kueue等批量调度系统开发经验;

2.熟悉eBPF编程,有基于Cilium或自定义探针对网络/内核延迟的监控实践;

3.了解vLLM/TensorRT-LLM的源码或有过二次开发经验;

4.熟悉PD(Prefill-Decode)分离部署架构或KV Cache分布式缓存等前沿推理集群方案;

5.有大规模在线推理服务(日均百万级请求)的压测与调优经验;

6.在ACM/ICPC等编程竞赛获奖,或有系统顶会(OSDI/SOSP/ATC)论文发表。