破解视频生成压缩延迟
阅读全文原创 52CV 2026-09-27 23:29 江苏 一场大火,画面里火焰猛烈蹿起,声音却没有在关键时刻跟上;一位小提琴手正在演奏,旋律与画面中的动作却未必合拍。联合音视频生成要做好两件事:各自生成得好,也要在同一个事件上配合得好。针对这一难题,我们提出 AV-GRPO:一种用于联合音视频扩散模型后训练的模态锚定强化学习方法。同时,我们构建了五维解耦的训练提示集 5DAV,让模型可以在可控的音画事件上学习。图 1|四组音画生成案例。每组上方的画面与波形来自原始 LTX-2.3,下方来自 AV-GRPO(全参数微调)。提示词中的加粗部分标出了尤其需要音画同步的事件。静态图展示关键帧与音频波形;完整视听效果可在文末项目仓库查看。联合训…
阅读全文差分辅助自监督,动态要素尽保留
阅读全文原创 52CV 2026-09-24 23:50 江苏 让 AI 根据一张图片生成视频,已经不是什么新鲜事。但如果告诉 AI 当前的世界状态,再给它一个动作,它能不能真正推演之后会发生什么?比如,一辆自动驾驶汽车准备左转,它能否提前“想象”其他车辆的反应?一个机器人准备抓起杯子,它能否预判杯子是否滑动、机械臂是否发生碰撞?这时,我们讨论的就不再只是“视频生成”,而是一个更大的问题:AI 能不能在内部构建一个可以预测、交互和推演未来的世界?这正是 World Model(世界模型)想解决的问题。论文标题:Diffusion-Based World Models: A Survey论文链接:https://www.preprints.o…
阅读全文原创 52CV 2026-09-23 23:47 江苏 我们所处的世界,本身就是多模态的。一辆车从街口驶过,它同时产生图像、声音、深度、热辐射和振动。这些观测的形式天差地别,但它们描述的是同一个物体——只是各自切下了它的一个侧面。于是一个非常自然的问题浮上来:既然描述的是同一个东西,那这些模态的样本之间,是不是天生就带着对齐的成分?这个问题不是修辞。近日,来自北方工业大学、中南大学、悉尼大学、中山大学与新加坡国立大学NExT++的联合团队,把它形式化成了一个可以计算、可以检验、也可以划边界的量——潜在多模态知识,并推出配套的读出方法 HSA(Hub-Spectral Activation),把这份本就存在、却一直读不出来的对齐,直接…
阅读全文我爱计算机视觉 2026-09-22 21:56 江苏 准备做多模态融合方向的朋友看过来,我这次整理了260篇多模态融合论文+多模态代码库,其中论文部分包括:6篇入门必读论文103篇今年最新顶会论文151篇前沿高分论文这里的顶会论文筛选自CVPR/ICLR/AAAI/IJCAI/ACM MM/NeurIPS/WWW/ICML等主流会议。前沿高分论文则按照基础→架构→应用→方法论四条主流研究路线重新整理,方便你根据自己的研究进度和兴趣点找论文。如果你是刚准备入门多模态、正在做相关课题、准备选题找创新点,以及需要论文复现和找Baseline,这套资料就非常适合你,可以直接收好!扫码添加小享,回复“多模态融合25” 免费获取全部论文+经典…
阅读全文分享一篇文章。
阅读全文视频模型推理频域巧桥接
阅读全文空间几何驱动端到端规划
阅读全文流式视频迈入空间时代
阅读全文单核极速解码新范式
阅读全文导师团队:前爱丁堡图灵所和东大博士后,全球第三UK第一animation机构的博士。 目前英国教职,团队共有几十篇 AAAI,CVPR,ECCV,ACMM,IJCAI等记录。各大顶会审稿人。CVPR outstanding reviewer ( 5.7% ),带学生拿过 UK VibeHack 第三名。 目标会议: [ ICLR / NeurIPS / ICML / CVPR 等 ] 团队只投顶会感兴趣的方向:Creative Art/Animation/Media角度的 AI trustworthy,explainablity,alignment,Agentic相关的问题方向好找工作,好玩有趣,追求 paper impact 大。…
阅读全文偏振物理引导单目几何深度修正
阅读全文52CV 2026-09-17 23:04 江苏 八款前沿大模型在真实网站上替你完成购物、预约、投简历……最强的 Claude Sonnet 4.6 成功率仅 33.3%。实验室里的"高分选手"为何在现实世界频频翻车?本文深度解读 EMNLP 2026 论文 ClawBench: Can AI Agents Complete Everyday Online Tasks?作者:UBC、Vector Institute、UniPat AI、CMU、滑铁卢大学、上海交大、港科大、清华大学、曼彻斯特大学、复旦大学、里海大学、南京大学等一、当 AI Agent 走出"温室"过去两年,AI Agent 在网页任务上的跑分一路飙升。WebAren…
阅读全文三维长上下文新范式
阅读全文做 3D 纹理一直有个死结:曲面没法完美摊平。一展开,接缝、拉伸和扭曲就跟着来。 帝国理工团队拿了 ECCV 2026 最佳论文奖。他们甩开 UV 展开,直接在曲面上铺“测地高斯”。说白了,就是把热扩散核原生长在网格表面。这样既没接缝,也不会飘到半空。 具体怎么落地?靠一套新管线。先预计算特征基,再用双调和距离压掉伪影。渲染时只挑最近的几个核算颜色。优化时让核贴着曲面滑行,冗余的剪掉,细节不够就分裂。 效果挺猛。UV 拟合只用 96.6KB,多视角重建 78.7KB。结构相似度飙到 98.9,比神经隐式场更锐利,体积还小近十倍。 代码已经开源,以后做 3D 纹理不用再跟 UV 较劲了。
阅读全文极小存储下的高保真神经几何渲染
阅读全文原生统一跨入4K时代
阅读全文原创 52CV 2026-09-13 14:22 江苏 同一张假脸,一个模型判断为真,另一个却能发现异常。面对不断变化的换脸、表情驱动和整脸生成技术,鉴伪器的难点已经不只是记住训练集里的破绽:当伪造方式改变,它依赖的线索还有效吗?北京交通大学、清华大学与蚂蚁集团的研究者提出 UCF-Net,将 CLIP 的语言对齐语义先验与 DINO 的自监督视觉结构先验结合起来。模型先汇聚各自不同深度的特征,再根据特征不确定性动态分配融合权重。在论文的统一基准上,UCF-Net 的域内和跨域平均 AUC 分别达到 95.33% 和 92.15%,均为所比较方法中的最高值。论文标题:Harnessing CLIP and DINO: An Unce…
阅读全文原创 52CV 2026-09-12 15:28 江苏 近日,西北工业大学与新加坡管理大学研究团队合作完成的综述论文 “A Survey on Foundation Model-Driven Video Anomaly Understanding” 被SCI一区Top期刊 Pattern Recognition 正式录用。该论文系统梳理了基础模型驱动的视频异常理解(Video Anomaly Understanding, VAU)研究进展,提出统一的 “异常感知—异常认知” 分类框架,深入分析基础模型如何推动视频异常分析从传统的异常检测,逐步迈向具有语义解释、逻辑推理与因果分析能力的异常理解。论文题目: A Survey on Fo…
阅读全文