
面向高效视频异常检测的跨架构跨模态知识蒸馏方法研究
构建跨架构、跨模态的双向知识蒸馏框架,在 RGB/DVS 数据上提升 CNN 表征与 SNN 在视频监控异常检测中的性能。
王翀,博士,副教授,现任 宁波大学 计算机科学与技术研究所 所长。主要从事计算机视觉、图像/视频处理、人工智能相关的理论与应用的研究,研究领域包括:视频异常检测、模型轻量化、目标检测/识别、类脑智能、人机交互、深度图像处理、基于图像的渲染等。
以第一作者/通讯作者在IEEE/ACM汇刊(TIP, TMM, TCSVT, TOMM, TCDS, TCAS-II, TAI等)、CCF推荐会议(AAAI, ICASSP, ICME等)及其他知名期刊、会议上已发表论文44篇,其中在IEEE Trans. Multimedia(TMM)上发表的关于手势识别的论文被引用431次,曾入选ESI高被引用论文。合作在TCSVT, TGRS, TCI, IoTJ, CHI等国际知名期刊和会议上发表论文39篇。目前,Google Scholar总被引1569次,h指数21。现担任包括TIP, TMM, TCSVT, CVPR, ICML, AAAI, MM等多种学术期刊和会议的审稿人。任国际会议DSP 2017,ICME 2022(CCF-B类)分会主席。
相关研究成果获得2025年度中国商业联合会科技进步一等奖(2/11)、2024年度宁波市科技进步二等奖(3/9)、2024年度宁波市十佳大模型(2/5)、2024年度宁波市人工智能学会人工智能科技进步奖(2/5)等。相关解决方案获首届中国创新挑战赛优秀奖,第六届中国创新挑战赛优胜奖。作为建站博士,与乐歌公司建立首批“浙江省博士创新站”,以第二完成人获2022年宁波大学服务地方突出贡献奖(团队奖)。
目前主持(结题)国家自然科学基金青年项目,浙江省自然科学基金探索项目,浙江省自然科学基金青年项目,国家重点实验室开放课题,浙江省教育厅科研项目和宁波市自然科学基金项目。曾参与多项香港政府创新及科技基金项目、香港政府优配研究金项目和国家重大科学工程项目。
指导研究生获得全国研究生数学建模竞赛一等奖、二等奖多项、华为昇腾众智计划并获金质量奖、华为昇腾AI创新大赛(浙江)金、银奖、宁波市计算机优秀学生论文,以及国家奖学金和优秀毕业论文多位。指导本科生获得2016、2018、2021届校级优秀毕业设计(论文)。获学院优秀班主任称号,2024年被评为“阳光教授”。
哲学博士, 电机电子工程, 2014
香港大学
工学硕士, 电子工程与信息科学, 2010
中国科学技术大学
工学学士, 通信工程 (健行学院), 2007
浙江工业大学
快乐的学术氛围,优良的硬件环境(4卡、8卡服务器)
与国内外名校交流(港大、新国大、浙大、北大、哈工大)
参加国际知名会议(AAAI、ICASSP、ICME、ISCAS)
一流企业实习机会(商汤、大疆、乐歌)

构建跨架构、跨模态的双向知识蒸馏框架,在 RGB/DVS 数据上提升 CNN 表征与 SNN 在视频监控异常检测中的性能。

面向国产全栈AI基础设施的“风华·苍鹭”视频大模型应用示范,围绕异常检测、群体检索、视频检索和场景嵌入构建应用能力。

面向智能人机交互中“未见动态手势”难以理解的瓶颈,研究基于多路 Transformer 的语义特征提取与融合、结合知识图谱与图卷积推理的零次手势识别方法。

研发一套面向人体工学的办公学习智能健康感知系统,实在在办公学习时,可快速准确地检测人体姿态和面部表情,有效预防近视、人体颈腰椎疾病,以及检测面部负面情绪的功能。

通过在厂区门口架设监控摄像机,实现对出入货车的集装箱号自动检测、识别和记录,用于集装箱管理和追踪,为后续出入库自动化管理提供支持。

本研究在结合了超像素分割、手势结构和EMD距离的基础上,提出了一种新的手势表示形式和新的距离度量标准。

在时域引入注意力机制,利用三维卷积网络和时间卷积网络分别提取短时和长时动态手势特征,进而构建高精度的动态手势识别算法。

基于乐歌升降台上的摄像头设备,提取各类表官特征,进行基于视频的心率检测和健康风险分析。
A prompt-guided framework learns suspected anomaly events for weakly supervised video anomaly detection.
A new Knowledge Sharing and Feedback (KSF) framework is designed to unify the representation of anomalies across both video and text.
We introduce UCF-Crime-DVS, the first DVS video anomaly detection benchmark, and a multi-scale spiking fusion network for weakly supervised video anomaly detection.
In this paper, we propose a new self-distillation framework called restructured self-distillation (RSD), which involves restructuring both the teacher and student networks. The self-distilled model is expanded into a multi-branch topology to create a more powerful teacher.