Speech AI Engineer

你好,我是 chenpaopao。 语音算法工程师

专注语音识别与多模态语音大模型,把前沿算法变成稳定、可用的产品能力。

旅行中的个人照片

移动鼠标摇动灯光 · 右键切换颜色

让模型真正进入产品。

从数据挖掘、训练优化到部署维护,我关注的不只是指标,更是算法在真实场景里的稳定表现。

高质量语音数据建设 150万h 设计数据挖掘 Pipeline,解决语音理解大模型的数据供给问题
输入法实时语音识别 +9% 准确率领先竞品
长音频推理优化 +100% 并行推理与聚类 GPU 加速
实时视觉技术 4K 支持超高清实时 2D 转 3D
业务增长 +80% 输入法语音业务访问量提升

工作经历

持续在语音人工智能与计算机视觉方向做深入研发,也负责把技术能力带到业务一线。

奇虎 360

语音算法工程师

负责语音识别与语音理解大模型能力建设,为输入法、搜索、会议、录音笔等业务提供服务,并探索通用语音理解能力。

联想研究院

算法实习生

负责图像分割与新视点合成算法,实现业界首个支持 4K 超高清实时 2D 转 3D 技术。

项目经历

覆盖语音理解大模型、实时与离线语音识别、小语种能力,以及计算机视觉技术落地。

语音理解大模型与数据

2024.10 - 2026.06 | 项目负责人

  • 设计数据挖掘 Pipeline,建设 150 万小时高质量语音数据,解决训练数据不足问题。
  • 使用上亿条数据训练优化语音理解大模型,支持 ASR、AST、语音问答等通用任务。
  • 重点建设多语种语音识别与翻译能力,提升模型覆盖面与业务实用性。
  • “大模型语音识别引擎”获得 360 极客大赛创始人奖与优秀项目落地奖。

专业能力

研究与工程并重,熟悉从数据到服务的完整技术链路。

Python FunASR Transformers Git ASR Speech LLM Multimodal AI TTS Computer Vision GPU Inference

教育背景

北京邮电大学 · 人工智能硕士

研究方向:计算机视觉、语音识别与合成

北京邮电大学 · 信息工程学士

研究方向:人工智能、信号处理

按住鼠标拖动粒子流场 · 右键切换颜色

学术发表

研究覆盖语音转换、实时目标检测与图像分割边界优化。

  1. Pyramid Attention CycleGAN for Non-Parallel Voice Conversion ICCC
  2. Enhancing FPGA-Based YOLO Object Detection: Multi-Bank Storage Optimization and Model Refinement for Real-Time Applications ICICM
  3. MRCI: Multi-range Context Interaction for Boundary Refinement in Image Segmentation ICPR

个人爱好

工作之外,换一个地方行走,也常常带来解决问题的新视角。

聊聊语音 AI,或者一起做点有意思的事。

欢迎交流语音识别、多模态大模型、工程落地与相关合作机会。