AI 前沿论文日报

每日检索 · 汇总 · 解读 AI 领域最新研究动态
2026 年 9 月 1 日 星期二  |  覆盖 arXiv · Hugging Face · LMSYS Arena · C-Eval · MMLU

今日重点论文 Top 3

2026-08-28 ~ 2026-08-31 提交
1
cs.CV cs.CL 多模态

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs (Ariadne)

Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren · 北京大学、小米、香港大学
研究揭示了视觉 Transformer 中不同注意力头分别关注前景物体和背景的语义专化现象,并据此提出 Ariadne 混合注意力机制。该方法将全注意力计算量削减至约六分之一,而多模态大模型性能仅下降 0.52 分,大幅提升了高分辨率图像输入的推理效率。
💡 核心洞察:利用注意力头天然语义分工,以极低成本实现高效混合注意力,为高分辨率多模态推理提供实用方案。
arXiv:2608.28383 →
2
cs.CV cs.AI 几何学习

Video Generative Models as Geometry Learner (GeoNeXt)

Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng · 萨里大学、帝国理工学院
提出 GeoNeXt,将预训练视频生成模型重新利用为统一的几何学习器。将图像与深度/法线视为连续帧序列,沿同一去噪过程生成,使模型同时输出单目深度和表面法线。相比传统方法,数据效率更高且泛化性更强。
💡 核心洞察:将视频生成模型改造为几何估计器,把深度估计重新定义为"下一帧预测",开辟了几何学习新范式。
arXiv:2608.28549 →
3
cs.CV 电商 多模态

CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code

阿里巴巴、同济大学
提出 CommerceVibe,输入商品图、卖点文案和尺寸要求后,不再输出扁平栅格图片,而是直接生成可渲染的 HTML/CSS 电商广告代码。商品图以原样引用,文字以原生 DOM 元素存在,运营人员可继续换图、改字和调整布局,解决了扩散模型输出难以编辑的痛点。
💡 核心洞察:将电商广告设计从"生成图片"转向"生成代码",使 AI 产出真正可编辑、可复用,打通了创意生成与运营修改的链路。
arXiv:2608.27893 →

新模型发布与权重

2026-08-28 ~ 2026-09-01
Hy4 Preview
Tencent / 腾讯混元 · 2026-08-28
770B MoE 49B 激活 1M 上下文 Apache 2.0
腾讯混元团队发布 Hy4 preview,770B 总参数、49B 每 Token 激活的 MoE 大模型,通过 256 个路由专家 + 1 个共享专家实现,上下文窗口超 100 万 Token。权重以 Apache 2.0 协议开源,同时提供 FP8 量化版和 vLLM/SGLang Docker 部署方案。BF16 权重约 1.5TB,FP8 约 770GB。
Hugging Face → GitHub →
LFM2.5-DSpark Draft Models
Liquid AI · 2026-08-21
投机解码 3.2x 加速 llama.cpp SGLang
Liquid AI 发布 LFM2.5 系列的 DSpark 草稿模型,包括 1.2B、2.6B 和 8B-A1B 三个规格。通过投机解码(Speculative Decoding)实现 GPU 端最高 3.18 倍、设备端最高 2.87 倍推理加速,且不改变贪心输出结果。已在 llama.cpp 和 SGLang 中原生支持。
Hugging Face → 详情 →
Ling-mini-2.0
InclusionAI · 近期
16B MoE 1.4B 激活 128K 上下文 300+ tok/s
InclusionAI 开源 Ling 2.0 系列,首款 Ling-mini-2.0 为 16B 总参数、1.4B 激活参数的 MoE 模型,非嵌入层仅 789M 激活。支持 128K 上下文,在 H20 上可达 300+ token/s 生成速度,质量对标 7-8B 密集模型。
Hugging Face → GitHub →
MiMo-V2-Flash
Xiaomi / 小米 · 近期
MoE 旗舰 56K 上下文 150 tok/s MIT 协议
小米 MiMo 团队发布 MiMo-V2-Flash,MoE 架构语言模型,采用混合全注意力/滑动窗口注意力机制,支持 56K 上下文,推理速度达 150 tok/s。融合 MTP 多 Token 预测加速,可实现 2.5-3.7 倍实际加速。以 MIT 协议开源。
Hugging Face → GitHub →
📄

按方向分类论文列表

2026-08-28 ~ 2026-08-31 提交

◆ 计算机视觉 (CV)

cs.CV 2026-08-31

ABot-Recon: 长视频三维重建误差降低约 40%

阿里巴巴高德视觉团队
长视频三维重建中,固定保留第一帧和最近 10 帧,即可连续估计相机轨迹、深度与场景点云,极大降低内存消耗和计算量,重建误差降低约 40%。
arXiv:2608.27529 →
cs.CV 2026-08-31

Manifold4D: 单目视频换机位重拍,平移误差最高降低 32%

浙江大学、Manifold Tech、上海科技大学、剑桥大学
输入一条新的六自由度相机轨迹,模型沿新机位重新生成画面。有效处理视频换机位重拍中的几何漂移和相机控制误差,平移误差最多降低 32%。
arXiv:2608.28174 →
cs.CV 2026-08-31

VATIX: 法雷奥驾驶视频扩散模型缩放研究

法雷奥 AI、索邦大学
在 100 万到约 90 亿参数范围内研究驾驶视频扩散模型的缩放规律,基于最高 5500 小时驾驶数据,揭示固定数据池下"更多训练轮次"可能优于"更大模型"的反直觉结论。
arXiv:2608.28404 →
cs.CV 2026-08-28

Ring Forcing: 视频模型记住分钟级历史信息

斯坦福大学、北京大学、字节跳动
自回归视频模型按片段生成时,人物或物体离开镜头再出现后容易变化。提出 Ring Forcing 环形训练 + 历史压缩 + 稀疏位置编码,使模型利用分钟级远距离信息。
arXiv:2608.26794 →
cs.CV 2026-08-28

HUG-VIS: 8400 段视频同时测情绪、生成、克隆与抠像

深圳大学、中科院自动化所、清华大学、华为
发布包含 8400 段同步视频/音频/文本/透明度蒙版的多任务基准,覆盖情绪识别、视频生成、声音克隆和人物抠像四类任务。
arXiv:2608.26517 →
cs.CV 2026-08-28

GSSC: 生成式语义场景补全,只看 1% 体积也能生成稠密语义

复旦大学、卡内基梅隆大学
车载激光雷达一次扫描仅占目标三维体积约 1%。提出离散扩散框架 GSSC,同时合成训练数据、从噪声生成完整场景并修正已有模型输出。
arXiv:2608.26737 →

◆ 自然语言处理 / 大模型 (CL/AI)

cs.CL 2026-08-31

75.9% 真实任务不是一句话说完:小米北大让智能体学会追问

北京大学、小米、香港大学、中国人民大学
对 1.6 万条真实会话的分析显示,75.9% 包含两轮或更多用户发言,多轮会话用户发言中位数达 10 轮。提出让智能体适应多轮交互的追问策略。
arXiv:2608.28378 →
cs.CL 2026-08-28

TTPO: 无标签测试时训练,Qwen3-1.7B 从 38.0% 升至 45.2%

浙江大学、阿里巴巴
提出测试时策略优化(TTPO),让模型将多次解答分为"同意多数结果"和"反对多数结果"两组,用不同目标继续学习,无需标准答案即可提升性能。
arXiv:2608.27448 →
cs.AI 2026-08-28

ASIL: 软件智能体从截图点击转向结构化操作

上海交通大学、北京通用人工智能研究院
提出 Agent-Software Interaction Layer (ASIL),用结构化 JSON 状态替代像素观察,用可执行语义动作替代坐标点击,使智能体操作更鲁棒。
arXiv:2608.26991 →
cs.AI 2026-08-28

Behavior2Trip: 旅行规划智能体从用户行为推断偏好

美团、北京航空航天大学、北京理工大学
从历史点击、收藏和预订行为推断用户偏好,再调用工具生成行程。最难任务 GPT-4.1 全约束通过率仅 0.5%,揭示旅行规划智能体的巨大挑战。
arXiv:2608.26807 →
cs.CL 2026-08-28

Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi · Accepted to Findings of EMNLP 2026
提出用符号编辑作为测试 LLM 逻辑推理能力的新方法,超越表面形式理解,评估模型在符号层面的推理深度。
arXiv:2608.30237 →

◆ 机器人 / 具身智能 (RO)

cs.RO 2026-08-31

接触引导多评论家强化学习:四足机器人无抓取移动操作

比萨大学、苏黎世联邦理工学院、英伟达
无机械臂和夹爪的四足机器人,用肩部、机身或腿接触物体,覆盖推箱、搬椅和开洗碗机三类非抓取移动操作任务。
arXiv:2608.28140 →
cs.RO 2026-08-31

Aero Hand Open: 314 美元的五指机器人手

Chestnut Robotics、加州理工学院
五指机器人手,16 个转动关节由 7 个电机通过腱绳驱动,整手 374 克,物料成本仅 314 美元。开源机械设计、仿真模型和强化学习环境。
arXiv:2608.28578 →
cs.RO 2026-08-28

VLAct: 只用 20% 数据反超全量基线,新本体更快学会操作

香港中文大学、上海人工智能实验室
机器人模型换到未见过的本体,仅用 20% 下游轨迹达到 49.5% 成功率,高于 GR00T-N1.6 使用全部数据时的 47.6%。将预训练重点从"堆数据"转向"先学好表示"。
arXiv:2608.27550 →
cs.RO 2026-08-28

SOLO: 人形机器人零样本穿越 1.5 公里户外复杂地形

中国科学技术大学、X-Humanoid、清华大学
仅用胸前深度相机和本体感知,零样本部署完成 1.5 公里连续户外路线,持续处理台阶、斜坡、窄落脚点和感知噪声。
arXiv:2608.26583 →
cs.RO 2026-08-28

ESRP: 机器人第一视角重排 5400 组房间

北京理工大学
机器人从第一视角找到家具、抓起、搬运并摆到正确位置。构建 ESRP-Bench,包含超过 5400 组初始-目标场景和 8200 个物体。
arXiv:2608.27371 →

◆ 机器学习 / 其他 (LG)

cs.LG 2026-08-31

Can a Model Catch Its Own Hallucinations for Free? Label-Free Doubt Signals

Ali Asaria, Tony Salomone, Deep Gandhi
研究无标签"怀疑信号"在 LLM 幻觉检测中的有效性,表明无需标注数据也能达到与有标签数据集相当的戒断(abstention)性能。
arXiv:2608.26120 →
cs.LG 2026-08-28

Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal

Philipp E. Glass et al. · Accepted at EMNLP 2026 Main
研究发现微调可以逆转激活引导的效果,行为恢复无需反转权重编辑。为 LLM 对齐和安全研究提供了新视角。
arXiv:2608.30270 →
cs.LG 2026-08-28

DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving

Yanqi Yu et al.
提出衰减感知状态压缩方法,用于混合线性注意力模型的高效服务,优化长序列推理的 KV 缓存管理。
arXiv:2608.30378 →

排行榜变动

数据同步至 2026-09-01

◆ LMSYS Chatbot Arena 文本对话榜

#模型Elo 评分备注
1Claude Fable 51507连续霸榜
2Claude Opus 4.6 (High)1505
3Claude Opus 4.7 (High)1502
4Muse Spark 1.2 (xHigh)1498
5Claude Opus 4.61497

前端开发榜 Top 3

#1 Claude Opus 5 (Max)1688
#2 Kimi K3 (Max)1674
#3 Qwen 3.8 (Max)1669
Hy4 (Preview) 以 1631 分位列第 5

视觉多模态榜 Top 3

#1 Claude Fable 51313
#2 Claude Opus 4.7 (High)1301
#3 Qwen 3.8 (Max)1300

Agent 榜 Top 3(净改善度)

#1 Claude Opus 5 (High)13.77%
#2 Claude Opus 5 (Max)11.61%
#3 Claude Fable 5 (High)10.58%

文生视频榜 Top 3

#1 Gemini Omni 1.1 Flash1515
#2 Gemini Omni Flash1512
#3 Flux 3 Video1495

近期新入榜模型: GLM 5.3 Flash(1 天前,文本/视觉/Agent 三榜同步上线)、 Hy4 Preview(4 天前,前端开发榜 #5)、 Qwen 3.8 Flash Next(4 天前,前端开发榜)

◆ C-Eval / CMMLU / MMLU-Pro

C-Eval 中文综合评测

#1 Qwen3.6 Plus93.3%
#2 DeepSeek V4 Pro92.8%
#3 Kimi K3~92%
数据更新于 2026-08-27

CMMLU 中文多任务理解

#1 DeepSeek V4 Pro Base90.8%
数据更新于 2026-08-29

MMLU-Pro 标准层

#1 Claude Sonnet 591.8%
#2 DeepSeek V4-Pro91.0%
Gemini 3.1 Pro92.5%

Open LLM Leaderboard 开源模型

#1 Qwen3.8 Max79.2
#2 Qwen3.8-27B72.6
#3 MiniMax M368.0
数据更新于 2026-08-27

其他值得关注的动态

产业

8月 AI 模型发布创纪录:20 天内 11 个前沿模型发布

2026 年 8 月成为 AI 行业史上最密集的模型发布月,20 天内 11 个前沿模型相继发布,涵盖文本、多模态、视频生成等方向,竞争进入白热化阶段。
工具

NVIDIA Nemotron 3.5 ASR 语音识别模型发布

NVIDIA 发布 600M 参数的多语言语音识别模型 Nemotron 3.5 ASR,支持低延迟流式和高吞吐批处理转录,内置标点和大写功能。