北方工业和新国立提出全新方法HSA:不训练、不改权重,跨模态检索性能直接翻倍
原创 52CV 2026-09-23 23:47 江苏
我们所处的世界,本身就是多模态的。
一辆车从街口驶过,它同时产生图像、声音、深度、热辐射和振动。这些观测的形式天差地别,但它们描述的是同一个物体——只是各自切下了它的一个侧面。
于是一个非常自然的问题浮上来:既然描述的是同一个东西,那这些模态的样本之间,是不是天生就带着对齐的成分?
这个问题不是修辞。近日,来自北方工业大学、中南大学、悉尼大学、中山大学与新加坡国立大学NExT++的联合团队,把它形式化成了一个可以计算、可以检验、也可以划边界的量——潜在多模态知识,并推出配套的读出方法 HSA(Hub-Spectral Activation),把这份本就存在、却一直读不出来的对齐,直接从冻结模型里取了出来。
论文标题:Hub-Spectral Activation of Latent Multimodal Knowledge
01 天生同源的关系,为什么模型"看不见"?
如今ImageBind、LanguageBind这类绑定模型,已经是跨模态检索的基础设施。它们靠一个中枢模态当「枢纽」,把文本、音频、深度、热成像、惯性传感器全拴上去,本来要N次方级别的配对数据,现在只需要N条枢纽连接,省钱又省力。
但一个残酷的现实是:那些从没一起训练过的模态之间,检索效果差到没法用。
团队把这种只通过枢纽间接相连的模态叫做留出对,在两个骨干上整理出19个非退化的留出关系,横跨7种模态、10个数据集,然后只用冻结特征算余弦相似度——平均双向Recall@10只有 18.27%。单项更难看:深度对热成像 0.34%,文本对惯性传感器 1.53%,文本对热成像 7.68%。
但低分,并不等于关系不存在。
这正是本次工作最关键的判断:既然两个模态观测的是同一个源,那份同源依赖就一定被保留在冻结表示里。读不出来,问题出在打分方式——这份关系在两个空间里耦合的,是彼此错位的坐标方向;而余弦相似度只会沿着各自原本的坐标轴去比。方向对不上,再强的关系也会被算成零。
简单来说:关系一直都在,缺的只是一把能读出它的尺子。
偏偏现有的补救方案,无一例外都要另付一笔钱:要么去拿目标模态的配对数据,要么借一个重叠模态,要么训代理生成器再用梯度微调编码器。想用,就得再掏一份数据或再训一次模型。
于是真正的问题被逼了出来:训练已经结束、权重已经冻死,只靠已经训好的那两条枢纽边,这份天生的对齐还能被读出多少?
02 HSA问世:一个梯度都不加,把关系直接读出来
为了打破「要么加数据、要么加训练」的死循环,研究团队打造了 HSA,一套完全后训练、完全闭式的跨模态关系读出方法:不要目标配对样本,不要梯度优化,不动骨干网络一行权重。
整套方法由两大部分构成,一个划边界,一个做读出:
✅ 理论侧:先算清楚"到底能读出多少"
团队把潜在多模态知识严格定义为同源导致的依赖——两个模态在给定共同源因子之后,条件均值之间的交叉协方差。在此基础上证明:这份关系里存在一个完全由两条枢纽边的二阶统计量决定的分量,即hub可读分量。
配套给出两条硬边界:精确恢复的充要条件,说清楚什么时候能一分不差地读出完整关系;以及hub容量界,直接指出枢纽本身分辨不出来的东西,下游谁也变不出来。
✅ 方法侧:用成对谱载体把关系"点亮"
这是本次最大的创新点!既然问题出在坐标错位,HSA就先把坐标对上:把两条枢纽边的矩系统合成、标准化后做奇异值分解,取出成对的谱载体——两个目标空间里互相耦合的低维方向。每个载体自带强度,强度决定它在打分里说话的分量;再叠加源门控控制的候选分辨项,合成最终配对分数。
同一个分数矩阵,转置就是反方向检索;把类别原型当候选,就是原型分类。可训练参数0个,梯度步数0步。
03 实测数据曝光:19个关系全部提升,直逼全监督
团队在两个主流绑定骨干、19个检索关系和11个分类关系上做了大规模实测,结果直接打破了「不加训练就提不动」的固有认知。
数据对比一目了然:
冻结余弦(模型原生打分):平均双向Recall@10 仅 18.27%
ReAlign(非配对边缘对齐):只挪到 18.48%,几乎原地不动
HSA(零训练闭式读出):直接拉到 31.15%
Full A–B(拿配对数据全监督训练):31.49%
也就是说,一个不看配对、不加梯度的闭式读出,追平了全监督训练的量级。在ImageBind上HSA甚至反超——24.90%对22.95%,恢复率高达 108.5%。
更值得关注的是覆盖面:19个关系一个不落,全部提升;38个有向关系里 37个提升;单项最大涨幅出现在文本对热成像,从7.68%直接干到74.87%,涨了67.20个点。
分类这边同样彻底翻盘:11个关系的平均宏Top-1,从29.01%提到52.43%,热成像那一项 28.10%→90.92%。而且检索拟合好的参数原封不动拿来做分类,在8个关系上仍有48.01%,远高于冻结余弦的26.46%。
而真正让这套方法站住脚的,是四组反事实实验:
打乱任一条枢纽边的样本对应,再允许完整重新拟合:31.15%直接塌到 4.6%左右
让两条枢纽边用完全不相交的源实例估计:增益仍保留 90.2%
领先载体换成后续或随机方向(数量与可靠度谱完全对齐):31.15% 对 14.72% 对 11.77%
把载体可靠度从0连续加到1:Recall@10从19.15%一路爬到31.15%,秩相关中位数 0.913
成本更是几乎可以忽略:拟合一个关系中位 6.5秒,打一百万对分数 0.031秒,一次拟合,后续无限次查询全部摊销。
04 应用价值:重新定义冻结模型的能力边界
在多模态模型越做越大、配对数据越来越贵的当下,HSA的推出意义重大:
它打破了「提升能力必须加数据、加训练」的路径依赖,证明了同源带来的那份对齐,确实被完整保留在已经冻结的表示里——不需要新数据,不需要新训练,只要换一个读出方式,就能把它取出来。
更关键的是,HSA同时给出了这层知识的可测边界。hub容量界意味着:一个绑定模型能向下游输出多少跨模态关系,上限写在枢纽自己身上。HSA因此既是一个读出器,也是一个诊断工具——可以直接用来衡量一个绑定模型的枢纽究竟有多「通透」,而不再只能靠下游指标反推。
世界是多模态的,模态之间的关系本就源自同一个世界。如何把这份关系从已有模型中读出来、用起来、并知道它的上限在哪,已成为落地部署、算力节约与能力评估的核心刚需。HSA的问世,将为跨模态检索、跨模态分类与表示诊断等方向,提供关键的方法支撑与思路指引。
论文标题:Hub-Spectral Activation of Latent Multimodal Knowledge
研究团队:北方工业大学AI+领域应用关键技术北京市重点实验室、中南大学地球科学与信息物理学院、悉尼大学计算机学院、中山大学深圳校区网络空间安全学院、新加坡国立大学NExT++研究中心