ECCV(European Conference on Computer Vision,欧洲计算机视觉会议)是全球计算机视觉领域的三大顶级会议之一。日前,ECCV 2024 在意大利米兰召开。自动化所多篇论文被本届大会录用,其中2篇论文入选Award Candidate(全球共15篇论文入。。


Award Candidate入选名单
01.整数训练脉冲推理的高精度低能耗目标检测脉冲神经网络
Integer-Valued Training and Spike-Driven Inference Spiking Neural Network for High-performance and?Energy-efficient Object Detection
(☆ Award Candidate)
论文作者:罗昕昊,姚满,侴雨宏,徐波,李国齐
研究介绍:
SNN领域长久存在且难以克服的一个问题是如何在大规模复杂的检测任务上取得具有竞争力的性能。该研究提出的SpikeYOLO极大地弥合SNN和ANN在目标检测任务上的性能差距,主要包括两点贡献。首先,网络架构方面,该团队发现SNN中过于复杂的网络架构会导致脉冲退化,因此简化了架构设计(图1)。其次,脉冲神经元设计方面,提出一种新型脉冲神经元,采用整数训练和脉冲驱动推理,在有效降低脉冲神经元量化误差的同时保证脉冲驱动计算特性(图2)。实验结果表明,该方法在保证低功耗的同时,能够大幅提升任务性能。在静态数据集COCO上,SpikeYOLO的mAP达到了48.9%,比当前SNN领域SOTA结果高出18.7%。在神经形态数据集Gen1上,SpikeYOLO和同架构的ANN网络相比,mAP提高了2.7%,且能效提升5.7倍。
本研究展现了SNN在超低功耗边缘视觉端的广阔应用前景。目前,研究团队在进行SNN在更多典型边缘视觉场景中应用研究的同时,开展了通用SNN架构的硬件仿真及设计工作。这一工作在算法层面挖掘了SNN在性能/能效上的潜力,证明SNN在未来有能力实现对现有人工神经网络的低功耗替代,对于下一代神经形态算法/芯片的发展有着重要指导意义。

图1. SpikeYOLO架构设计

图2. I-LIF神经元
02.扩展场景图边界:通过视觉概念对齐和保持实现完全开放词汇的场景图生成
Expanding Scene Graph Boundaries:Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and Retention
(☆ Award Candidate)
论文作者:陈祖耀,吴锦林,雷震,张兆翔,陈长汶
研究介绍:
我们在这篇文章中探讨了如何应对场景图生成(SGG)任务在开放词汇环境下的挑战。传统的 SGG 模型通常只能够识别预先定义的对象和关系类别,这在实际应用中限制了模型的泛化能力,尤其是在面对未见过的对象和关系时。因此,我们提出了一个名为 OvSGTR 的框架,旨在解决这些问题。
OvSGTR 框架采用端到端的 Transformer 架构,通过视觉-概念对齐技术,使得模型能够识别未见过的对象和关系。我们特别针对关系识别的难题,设计了基于图像-字幕数据的弱监督关系预训练,并通过知识蒸馏技术防止模型在引入新数据时遗忘之前学到的信息。此外,我们提出了四种场景图生成设置,涵盖了从封闭集到完全开放词汇的不同场景。
实验结果验证了我们方法的有效性。在Visual Genome数据集上的测试显示,OvSGTR在处理未见对象和关系类别时表现显著优于现有模型。这项研究不仅扩展了场景图生成的应用边界,还为未来在开放词汇环境下的视觉概念对齐和生成任务提供了新的思路。

图1.本文提出的四种 SGG 场景设定 (虚线表示训练阶段未见过的目标类或关系类)

图2.本文所提出的 OvSGTR 框架示意图
WPS-SAM: Towards Weakly-Supervised Part Segmentation with Foundation Models
论文作者:吴鑫。湃鹚,覃杰,马时杰,刘成林
研究介绍:
为了克服部件级分割任务中细粒度标注不足的问题,我们提出了一种新颖的弱监督部件分割方法,仅依赖部件的边界框或中心点形式的弱标签,实现高质量的像素级分割,显著减少了对高成本像素级标注的依赖。为了达到这一目的,我们深入挖掘了预训练视觉基础模型 SAM 的零样本泛化能力,设计了一个端到端的弱监督部件分割框架,在训练过程中冻结来自预训练 SAM 的部分参数模块,并引入基于轻量级查询式 Transformer 架构的学生提示模块,进一步增强了模型在弱标签条件下的分割性能。该框架不仅减轻了标注负担,还在更细细粒度的分割任务上取得了领先的性能,展示了该方法在实际应用中的强大潜力。

图1. 训练数据对比示意图:(a) 全监督部件分割任务,(b) 我们提出的弱监督部件分割 (WPS)任务,(c) 弱监督语义分割(WSSS)任务。与全监督方法相比,我们的方法显著减轻了数据标注的负担,同时在更细粒度的任务中表现优于WSSS方法。

图2. 所提出的WPS-SAM框架概览,该框架在训练过程中仅依赖成本较低的弱标签,实现端到端的部件分割。图中带有冻结参数的模块来自预训练的SAM。此外,所使用的学生提示是基于轻量级的查询式Transformer架构生成的。
04.?PILoRA:原型引导增量式LoRA的联邦类别增量学习
PILoRA: Prototype Guided Incremental LoRA for Federated Class-Incremental Learning
论文作者:郭海洋,朱飞,刘文卓,张煦尧,刘成林
研究介绍:
现有的联邦学习方法已经有效地处理了涉及数据隐私和非独立同分布(non-IID)数据的去中心化学习场景。然而,在实际应用中,每个客户端动态地学习新类别,这要求全局模型能够对所有已见类别进行分类。为了在低通信成本下有效缓解灾难性遗忘和数据异质性,我们提出了一种简单而有效的方法,命名为PILoRA。一方面,我们采用原型学习来获得更好的特征表示,并利用原型与类别特征之间的启发式信息设计了一个原型重标定模块,以解决数据异质性导致的分类器偏差,而无需重新训练分类器。另一方面,我们将增量学习视为学习不同任务向量的过程,并将它们编码到不同的LoRA参数中。因此,我们提出了增量LoRA来缓解灾难性遗忘。在CIFAR100和Tinyimagenet上的实验结果表明,我们的方法显著优于当前最先进的方法。更重要的是,我们的方法在不同设置和数据异质性程度下展现了强大的鲁棒性和优越性。

PILORA框架示意图
05.生成式端到端自动驾驶
GenAD: Generative End-to-End Autonomous Driving
论文作者:郑文钊,宋瑞琦,国显达,张宸鸣,陈龙
研究介绍:
在本文中,探讨了一种新的端到端自动驾驶范式,其关键在于预测给定过去场景时自车辆和周围环境如何演变。本文提出了GenAD,一个生成式框架,将自动驾驶转化为一个生成式建模问题。文章提出了一种以实例为中心的场景标记器,首先将周围场景转换为地图感知的实例标记。然后,作者使用变分自编码器在结构化潜在空间中学习未来轨迹分布,用于轨迹先验建模。进一步采用时间模型来在潜在空间中捕捉代理和自车运动,以生成更有效的未来轨迹。GenAD最终通过在学习的结构化潜在空间中根据实例标记条件采样分布,并使用学习到的时间模型生成未来,同时进行运动预测和规划。在广泛使用的nuScenes基准上的大量实验表明,所提出的GenAD在以视觉为中心的端到端自动驾驶方面取得了SOTA性能,并且具有高效率。

图1. 生成式端到端自动驾驶框架

图 2. GenAD 与 VAD结果的可视化对比
06.通过提示提升无参考图像质量IM官方网页版-IM中国性能和泛化性
PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
论文作者:陈泽文,覃海纳,王隽,原春锋,李兵,胡卫明,王亮
研究介绍:
由于图像质量IM官方网页版-IM中国(IQA)任务在不同应用场景中IM官方网页版-IM中国需求的多样性,现有的IQA方法在训练后难以直接适应这些多样化的需求。因此,当面对新的需求时,典型的做法是对这些模型在专门为这些需求创建的数据集上进行微调。然而,构建IQA数据集是非:氖钡。在本研究中,我们提出了一种基于提示的IQA方法(PromptIQA),它在训练后可以直接适应新的需求,而无需进行微调。一方面,PromptIQA利用一小段图像-评分对(ISP)作为提示进行有针对性的预测,这显著减少了对数据要求的依赖性。另一方面,PromptIQA在混合数据集上进行训练,并提出了两种数据增强策略来学习多样化的需求,从而使其能够有效地适应新的需求。实验表明,PromptIQA在性能和泛化能力方面均优于现有的最先进方法(SOTA)。

图1.提出方法(Prompt-Based IQA)和经典IQA框架对比

图2.网络结构图
07.事件感知的视频文本检索
EA-VTR: Event-Aware Video-Text Retrieval
论文作者:马宗扬,张子琦,陈禹昕,祁忠昂,原春锋,李兵,骆颖民,李旭,齐晓娟,单瀛,胡卫明
研究介绍:
理解视频中发生的事件内容及其内在的时序逻辑对于视频文本检索十分重要。然而,网络爬取的预训练数据集通常缺乏足够的事件信息,而广泛采用的视频级跨模态对比学习也难以捕捉详细而复杂的视频文本事件对齐。为此,我们从数据和模型两方面入手进行改进。在预训练数据方面,我们提出了事件增强策略来补充缺失的特定事件内容和事件时序转场变化。基于事件增强后的训练数据,我们构建了新的事件感知视频文本检索模型,它可以同时高效地编码帧级和视频级视觉表征,从而实现详细的事件内容和复杂的事件时序跨模态对齐,最终获得对视频事件的全面理解。结果表明,我们的方法不仅在视频文本检索和行为识别任务的多个数据集上优于现有方法,而且在多事件视频文本检索和视频时刻检索任务上表现出卓越的事件内容感知能力,并在时间测试任务上表现出更好的事件时序理解能力。

事件内容增强(a)和事件时序增强(b)用于补充预训练数据集中的事件信息。事件内容学习(c)和事件时间学习(d)从增强后的数据中学习跨模态事件信息对齐。
08.?LASS3D: 基于语言辅助和渐进式不可靠点挖掘的半监督3D语义分割
LASS3D: Language-Assisted Semi-Supervised 3D Semantic Segmentation with Progressive Unreliable Data Exploitation
论文作者:李嘉楠,董秋雷
研究介绍:
对大规模3D数据集进行精细标注以进行点云分割会耗费大量的时间和人工成本。为了减轻注释负担,研究者们开始探索半监督3D分割方法。然而,现有的方法中仍面临着如下两个问题:
1) 大型语言视觉模型如何应用在半监督3D语义分割任务中。
2) 如何有效利用预测置信度较低的无标签点(不可靠点)。
基于这两个问题,我们提出了一种名为LASS3D的语言辅助半监督3D语义分割方法,该方法建立在常用的MeanTacher框架之上。在LASS3D中,已有的视觉语言模型被用于生成多级字幕,图像被作为连接文本数据和点云的桥梁来构建点云-文本对。在学生分支中,语义感知的自适应融合模块将文本编码的语义信息注入到3D特征中,然后通过知识蒸馏将经文本增强后的3D特征中的语义信息传递给教师分支。此外,针对教师分支中的不可靠点,渐进式开发策略通过负标签学习有效地挖掘不可靠点中包含的信息。在室外和室内的公开数据集上的实验结果表明,LASS3D在大多数情况下都优于九种主流对比方法。

LASS3D结构示意图
09.步态识别的新型关系描述符
Free Lunch for Gait Recognition: A Novel Relation Descriptor
论文作者:王继。钊,黄岩,曹春水,刘旭,黄永。盘熘,王亮
研究介绍:
这篇文章提出了一种新的步态识别表征,名为“关系描述符”。传统的步态识别方法通常依赖于提取个体特征,而忽略了个体之间的“关系”特征。作者提出了一种新颖的方式,通过重新利用分类器权重作为步态锚点,构建出相似度分布,使得步态特征在分类器权重的帮助下更具鲁棒性和泛化能力。然而,直接使用关系描述符会导致维度扩展问题,因为描述符的维度取决于训练集的身份数量。为了解决这一问题,作者提出了最远步态锚点选择算法,选择最具区分性的步态锚点,并采用正交正则化损失增加锚点间的多样性。
实验结果表明,该方法在GREW、Gait3D等五个数据集上超越了现有方法,几乎无需增加额外成本,提升了步态识别的精度和效率。总的来说,该工作为步态识别领域提供了一种新的视角,即通过步态特征之间的关系来表征个体的步态,从而提高识别性能。

图1.特征提取器的独立特征与关系描述步态的比较。(a)传统的步态识别利用提取的特征进行最终身份识别。(b)通过将步态特征投影到预训练的步态锚点向量上,步态通过与固定语义方向的相似度进行描述。

图2.?流程概述。步态锚点从预训练的分类器中选出,步态特征被投影到余弦相似度空间中。
10.OneTrack:解明端到端3D追踪器中检测与追踪任务冲突的本质
OneTrack: Demystifying the Conflict Between Detection and Tracking in End-to-End 3D Trackers
论文作者:王启泰,何嘉伟,陈韫韬,张兆翔
研究介绍:
本文提出了一种解决视觉3D感知中端到端多目标追踪器在检测任务中性能退化的方法。 现有研究趋于在统一模型中同时完成端到端的多目标检测和追踪,但这种共同优化往往导致模型检测能力相对于单纯检测器的大幅下滑。 此前,这一问题常被:毓橐蛴诓煌挝裥枨蟮哪勘晏卣鞑患嫒,而缺乏明确解释。我们发现,检测和追踪任务的冲突源于正样本分配的部分差异,导致两任务优化过程中的分类梯度部分矛盾。
基于此观察,我们通过部分裁剪在两任务中具有相反样本正负性的目标样本的梯度以修复了两任务在优化过程中的冲突。 提出的OneTrack方法基于完全统一的检测/追踪物体特征表示,在其检测性能等同于单纯检测器的同时,其多目标追踪性能大幅超越前有工作。

图1.分类梯度的反向传播。 在两任务中样本正负性冲突的训练样本的分类梯度被部分裁剪,如(b),以避免梯度冲突

图2.OneTrack训练管线
11.可扩展室内场景的单目占用预测
Monocular Occupancy Prediction for Scalable Indoor Scenes
论文作者:于泓潇,王宇琪,陈韫韬,张兆翔
研究介绍:
基于摄像头的3D占用预测最近在户外驾驶场景中引起了越来越多的关注。然而,室内场景的研究仍然相对未被探索。室内场景的核心差异在于场景尺度的复杂性和对象大小的差异。本文提出了一种新的方法,称为ISO,用于使用单目图像预测室内场景占用率。ISO利用预训练深度模型的优点来实现精确的深度预测。此外,我们在ISO