1
cs.CV
cs.CL
多模态
Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs (Ariadne)
Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren · 北京大学、小米、香港大学
研究揭示了视觉 Transformer 中不同注意力头分别关注前景物体和背景的语义专化现象,并据此提出 Ariadne 混合注意力机制。该方法将全注意力计算量削减至约六分之一,而多模态大模型性能仅下降 0.52 分,大幅提升了高分辨率图像输入的推理效率。
💡 核心洞察:利用注意力头天然语义分工,以极低成本实现高效混合注意力,为高分辨率多模态推理提供实用方案。
arXiv:2608.28383 →
2
cs.CV
cs.AI
几何学习
Video Generative Models as Geometry Learner (GeoNeXt)
Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng · 萨里大学、帝国理工学院
提出 GeoNeXt,将预训练视频生成模型重新利用为统一的几何学习器。将图像与深度/法线视为连续帧序列,沿同一去噪过程生成,使模型同时输出单目深度和表面法线。相比传统方法,数据效率更高且泛化性更强。
💡 核心洞察:将视频生成模型改造为几何估计器,把深度估计重新定义为"下一帧预测",开辟了几何学习新范式。
arXiv:2608.28549 →
3
cs.CV
电商
多模态
CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code
阿里巴巴、同济大学
提出 CommerceVibe,输入商品图、卖点文案和尺寸要求后,不再输出扁平栅格图片,而是直接生成可渲染的 HTML/CSS 电商广告代码。商品图以原样引用,文字以原生 DOM 元素存在,运营人员可继续换图、改字和调整布局,解决了扩散模型输出难以编辑的痛点。
💡 核心洞察:将电商广告设计从"生成图片"转向"生成代码",使 AI 产出真正可编辑、可复用,打通了创意生成与运营修改的链路。
arXiv:2608.27893 →