移动鼠标摇动灯光 · 右键切换颜色
让模型真正进入产品。
从数据挖掘、训练优化到部署维护,我关注的不只是指标,更是算法在真实场景里的稳定表现。
工作经历
持续在语音人工智能与计算机视觉方向做深入研发,也负责把技术能力带到业务一线。
奇虎 360
语音算法工程师
负责语音识别与语音理解大模型能力建设,为输入法、搜索、会议、录音笔等业务提供服务,并探索通用语音理解能力。
联想研究院
算法实习生
负责图像分割与新视点合成算法,实现业界首个支持 4K 超高清实时 2D 转 3D 技术。
项目经历
覆盖语音理解大模型、实时与离线语音识别、小语种能力,以及计算机视觉技术落地。
- 设计数据挖掘 Pipeline,建设 150 万小时高质量语音数据,解决训练数据不足问题。
- 使用上亿条数据训练优化语音理解大模型,支持 ASR、AST、语音问答等通用任务。
- 重点建设多语种语音识别与翻译能力,提升模型覆盖面与业务实用性。
- “大模型语音识别引擎”获得 360 极客大赛创始人奖与优秀项目落地奖。
- 构建输入法语音识别能力,提升模型在室外噪声与口音场景中的表现。
- 设计业务数据自动标注和筛选流程,利用线上弱标签数据快速优化模型。
- 推动实时语音识别大模型落地,输入法场景准确率领先竞品 9%。
- 负责模型部署与服务维护,支持业务访问量提升 80%,保障服务稳定运行。
- 为音视频解析业务提供长音频 ASR、时间戳预测和说话人预测能力。
- 通过闭源大模型投票标注、纠错百万小时数据,并使用 TTS 合成专有领域数据。
- 创新模型架构,支持热词、标点和上下文输入,在会议及字幕场景领先竞品 10%。
- 优化模块并行推理和聚类 GPU 加速,推理速度提升 100%,支持 10 小时音频文件。
- 优化端点检测与分段策略,减少长句截断、漏识别和重复识别,改善实时转写可读性。
- 建设会议热词与自定义词表能力,增强人名、产品名、项目名和技术术语识别。
- 针对多人会议中的噪声、回声、远场收音及幻觉问题进行强化训练优化。
- 打造东南亚语种语音识别能力,为业务出海提供技术支持。
- 采集互联网公开音视频并进行弱标注,获取小语种数据用于模型训练。
- 通过 ASR 与文本翻译大模型级联,对外提供同声传译服务。
- 完成图像分割后处理算法实现、实验验证与论文撰写,在 Cityscapes 数据集达到 SOTA。
- 首次将类别信息和位置信息作为 Global Knowledge Prompt,辅助分割后处理任务。
- 实现业界首个支持 4K 超高清实时 2D 转 3D 技术,入选 2023 联想研究院十大科技。
- 解决视频抖动与大视差技术难题,发表相关专利,为裸眼 3D 显示器提供算法支持。
专业能力
研究与工程并重,熟悉从数据到服务的完整技术链路。
Python
FunASR
Transformers
Git
ASR
Speech LLM
Multimodal AI
TTS
Computer Vision
GPU Inference
教育背景
北京邮电大学 · 人工智能硕士
研究方向:计算机视觉、语音识别与合成
北京邮电大学 · 信息工程学士
研究方向:人工智能、信号处理
按住鼠标拖动粒子流场 · 右键切换颜色
学术发表
研究覆盖语音转换、实时目标检测与图像分割边界优化。
- Pyramid Attention CycleGAN for Non-Parallel Voice Conversion ICCC
- Enhancing FPGA-Based YOLO Object Detection: Multi-Bank Storage Optimization and Model Refinement for Real-Time Applications ICICM
- MRCI: Multi-range Context Interaction for Boundary Refinement in Image Segmentation ICPR
个人爱好
工作之外,换一个地方行走,也常常带来解决问题的新视角。
聊聊语音 AI,或者一起做点有意思的事。
欢迎交流语音识别、多模态大模型、工程落地与相关合作机会。