简介
2017 年进入商汤研究院实习,之后先后参与 SDK、量化框架、模型部署框架、模型生产平台和推理服务的设计与开发。曾负责 10+ 人团队,支持公司多个研发和业务团队的模型部署工作。
2023 年至 2025 年在 Momenta 负责自动驾驶模型推理优化;目前在 Vivix 负责 Vivix-A1 / Vivix-W1 的推理优化与基础设施建设,重点包括多卡并行、动态卸载和流式生成链路的 TTFB 优化。
工作经历
2025.02 — 至今 | Vivix
推理优化
Vivix-A1 / Vivix-W1 · 实时流式多模态生成
- 负责 A&W 系列模型的推理优化与基础设施建设:A1 面向实时全双工角色交互,W1 面向流式原生音视频生成与实时交互(约 30B 活跃参数)。
- 面向音视频小分段连续生成,优化端到端时延、吞吐、显存占用和多卡扩展效率。
- 设计和实现多卡加速方案,覆盖 SP(Sequence Parallelism)、TP(Tensor Parallelism)和 HP(Hybrid Parallelism)。
- 实现 Dynamic Offload,在 GPU 显存、主机内存和计算开销之间进行动态调度,提高大模型推理的可运行规模和资源利用率。
- 优化请求调度、输入准备、模型执行和首个音视频分段输出链路,降低 TTFB(Time to First Byte)。
- 建设以业界领先性能为目标的高性能推理 Infra,为 A&W 系列模型的快速迭代和规模化服务提供稳定、可扩展的运行基础。
2023.04 — 2025.02 | Momenta
Staff R&D Engineer · 推理优化负责人
MPilot / DDInfra
- 负责自动驾驶业务模型的推理性能优化,包括时延、吞吐、显存和精度分析。
- 支持 NVIDIA Orin GPU / DLA 上的模型量化、部署和性能优化。
- 探索 TVM 在车端模型部署中的应用,并将相关能力接入现有工具链。
2021.06 — 2023.03 | 商汤科技 · 研究院
高级经理 / 高级研究员 · 部门负责人
模型工具链、推理部署与服务|团队 10+ 人
自动驾驶量产项目
- 负责感知 Codebase 向 NVIDIA Orin 平台迁移,包括功能实现、代码优化和问题排查。
- 支持 GPU / DLA 模型量化与部署;完成 CyberRT、AUTOSAR、SenseAuto Middleware 等中间件的迁移适配。
- 处理 ROS Message、Cap’n Proto、Protobuf 等格式的消息转发与发布订阅,并参与感知 HMI 可视化调试。
Adela 模型部署管理平台
- 平台服务近 2,000 名用户,累计完成 70,000+ 次模型部署、80,000+ 次评测和 20,000+ 次发布,覆盖公司 90%+ 的相关业务。
- 提供自动化部署、评测和 API 接入,支持研究员批量生产和验证模型。
- 支持 30+ 类硬件和 200+ 种硬件、软件及精度组合;基于 NART 统一模型与量化数据的处理方式。
推理服务
- 基于 Triton Inference Server 和 Slurm,使用训练集群空闲资源提供动态推理服务。
- 主要用于自动驾驶 Auto-labeling,日均处理约 2,000 万条数据,资源规模约 400 张 NVIDIA 1080 / Titan XP。
UNRT 推理框架
- 基于 MLIR 设计模型部署方案,处理内存优化、前后处理融合和代码生成等问题。
- 实现自定义 Dialect 和编译 Pass。
2019.04 — 2021.05 | 商汤科技 · 研究院
研究员 · 模型部署小组负责人
- 设计统一 IR、运行时 API 和后端接入方式,支持 TensorFlow、PyTorch、Caffe 和 ONNX 模型。
- 实现模型拆分以及 CPU / GPU 默认算子,降低新模型和新硬件平台的接入成本。
- 核心运行时使用纯 C 实现,最小库体积为百 KB 级。
- 在 ARM 平台实现 2–8bit 量化方案,MAC 利用率达到 95%+。
- 在 NVIDIA GPU 上实现 4bit Tensor Core 方案,相比 8bit 方案性能提升约 30%。
- 实现模型等价变换 Pass,用于扩展不同硬件平台的算子支持。
2018.08 — 2019.04 | 商汤科技 · 研究院
研究员 · 智能视频基础技术与工具
- 负责 NVIDIA GPU、海思 NNIE 平台的模型部署、量化和优化,并验证 TensorRT 量化方案。
- 参与 SenseFace SDK 的开发和维护。
2017.10 — 2018.08 | 商汤科技 · 研究院
见习研究员 · 智能视频
- 维护 TX1 / ARM 平台人脸 SDK,将部分 CPU 实现迁移至 GPU,重点优化检测模型后处理。
- 负责相关模型的部署与性能优化。
教育背景
2014 — 2018 | 北京航空航天大学
计算机科学与技术 · 学士
技术能力
- 编程语言: C / C++、Python
- 系统与平台: Linux、NVIDIA GPU / DLA、ARM
- 并行与服务: SP / TP / HP、多卡推理、Dynamic Offload、TTFB 优化
- 相关工具: TensorRT、TVM、MLIR、Triton Inference Server、Docker、Slurm
- 工程协作: GitLab CI、Jira、Confluence、飞书、ONES