Finite-size scaling of hetero-associative retrieval in continuous-signal-driven Ising spin systems
异关联记忆在连续信号驱动的伊辛自旋系统中的有限尺寸缩放
专题命中 跨模态检索 :cross-modal(abstract)
AI总结 本文提出多层伊辛框架,结合几何保持的连续到伊辛编码器与Kanter-Sompolinsky伪逆记忆耦合,实现跨模态回忆,并验证有限尺寸修正对存储容量的影响。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
异关联记忆在连续信号驱动的伊辛自旋系统中的有限尺寸缩放
专题命中 跨模态检索 :cross-modal(abstract)
AI总结 本文提出多层伊辛框架,结合几何保持的连续到伊辛编码器与Kanter-Sompolinsky伪逆记忆耦合,实现跨模态回忆,并验证有限尺寸修正对存储容量的影响。
LangPrecip: 基于语言的多模态降水现在预报
机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science(智能协同计算实验室,电子科学科技大学) ; School of Computer Science(计算机科学学院) ; Technology (School of Artificial Intelligence), Yibin University(技术(人工智能学院),宜宾大学) ; College of Humanities(人文学院) ; General Education, Chengdu Textile College(通识教育,成都纺织学院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出LangPrecip框架,通过将气象文本作为语义运动约束,结合雷达信息进行降水演变预测,提升预测精度。
医学报告生成:基于层次任务结构的跨模态因果干预框架
专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出HTSC-CIF框架,通过层次任务分解解决医学报告生成中领域知识不足、跨模态对齐差和虚假相关性三大问题,提升生成效果。
Comments Due to issues with the training epochs and training strategy in our paper, there are numerical errors in the result comparison table presented in the preprint. Therefore, we have decided to withdraw the manuscript for further revision
MIMIC-D: 多模态模仿用于多智能体协调的去中心化扩散策略
机构 * Department of Mechanical Engineering, University of California Berkeley(加州大学伯克利分校机械工程系)
专题命中 多模态生成 :multi-modal(title,abstract)
AI总结 本文提出MIMIC-D,通过去中心化扩散策略实现多智能体多模态模仿学习,解决了传统方法在多模态任务中协调效率低的问题。
Comments 8 pages, 4 figures, 5 tables
TOPOS: 高保真且高效的工业级3D人脸生成
机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 TOPOS框架通过统一拓扑结构实现单图像条件下的3D人脸生成,生成具有固定拓扑的高保真人脸网格,提升顶点级对应一致性,优于传统方法。
Comments Technical Report
CoCoEdit:通过区域正则化的强化学习实现内容一致的图像编辑
机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) ; OPPO Research Institute, ShenZhen, China(OPPO研究院,深圳,中国)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出CoCoEdit框架,通过区域正则化强化学习提升图像编辑内容一致性,利用改进的指令和掩码生成高质量训练集,并引入像素相似度奖励和区域正则化器,提升编辑质量和一致性。
Comments Accepted by ICML 2026
Do-Undo基准:图像生成中动作理解的可逆性
机构 * York University(约克大学) ; Vector Institute for AI(人工智能向量研究所) ; Qualcomm AI Research(高通人工智能研究)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。
Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/
编辑推荐:通过原子实体分析评估图像编辑中的抽象意图
机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) ; Google Research(谷歌研究)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出通过原子实体分析评估图像编辑中抽象意图的方法,引入Entity-Rubrics框架并构建AbstractEdit基准,揭示现有模型在平衡意图与保留之间的挑战,强调结合先进LLM和迭代思维的重要性。
UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。
GeRM:从物理真实到照片级的生成渲染模型
机构 * State Key Lab of CAD\&CG, Zhejiang University ; Zhejiang Lab China ; State Key Laboratory of Industrial Control Technology, Zhejiang University China ; Zhejiang University China ; Zhejiang Lab ; State Key Laboratory of Industrial Control Technology, Zhejiang University ; Zhejiang University
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。
HERO:高效世界模型的分层外推与刷新
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 HERO通过分层策略提升世界模型推理效率,采用补丁刷新和线性外推技术,在保持质量的同时实现1.73倍加速。
Comments 12 pages in total
加速的序列流匹配:从贝叶斯过滤视角
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出基于贝叶斯过滤的序列贝叶斯流匹配框架,通过学习概率流在时间步间传输后验分布,实现高效采样,提升实时流处理中的推断效率。
提升多模态语言模型:带有视觉偏见评估的分阶段训练
机构 * StepFun-Audio Team(StepFun-Audio团队)
专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。
Comments Project page: https://cheliu-computation.github.io/omni/
VLRS-Bench: 一种面向遥感的视觉-语言推理基准
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。
MemEye:一种以视觉为中心的多模态代理记忆评估框架
机构 * Rutgers(罗格斯大学) ; Notre Dame(圣母大学) ; Princeton(普林斯顿大学) ; UMN(明尼苏达大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 MemEye框架从视觉证据的粒度和证据使用的复杂性两个维度评估多模态代理记忆,通过8个生活场景任务构建新基准,验证记忆方法在细粒度视觉细节保留和时间状态推理上的不足。
Comments 46 pages, 15 figures
MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型
机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)
专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。
多领域多模态文档分类基准与多级分类法
机构 * Beijing Information Science and Technology University(北京信息科学与技术大学) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Guangzhou University(广州大学) ; Zhejiang Lab(浙江实验室)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL
AI总结 本文提出首个多级多领域多模态文档分类基准MMMBench,包含五级多级分类体系和12个商业领域的5990个真实多模态文档,通过系统实验识别出四个核心挑战并提供解决方案。
学习多模态嵌入用于交通事故预测和因果估计
机构 * Northeastern University(东北大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文通过结合道路网络数据与卫星图像,提出多模态学习方法,提升交通事故预测精度,并发现降水、高速道路和季节因素对事故率的影响。
Comments 17 pages. Appeared in KDD 2026
MMTutorBench:首个多模态AI数学辅导基准
机构 * Tongji University(同济大学) ; Fudan University(复旦大学) ; University of Notre Dame(圣母大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。
重新审视模型反向评估:从误导性标准到可靠的隐私评估
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; University of Maryland College Park(马里兰大学学院公园分校)
专题命中 多模态评测 :MLLM(abstract,abstract_cn)
AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。
Comments Accepted to CVPR Findings 2026
COTCAgent:通过概率性思维链完成实现预防性咨询
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(中国电子科学与技术大学深圳高级研究所) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出COTCAgent框架,通过概率性思维链完成实现纵向电子健康记录的预防性咨询,解决了现有大语言模型在纵向EHR推理中的统计学推理不足和时间序列依赖性捕捉困难问题。
SIEVES:通过视觉证据评分实现选择性预测
机构 * TU Darmstadt(图宾根大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。
DocScope:可验证推理的可信长文档理解基准测试
机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) ; Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) ; Independent Researcher(独立研究者) ; Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。
Comments 50pages, 25 figures, 14 tables;
SceneForge: 从3D干预中获取结构化世界监督
机构 * Canva Research(Canva研究院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 SceneForge通过生成可编辑3D世界状态的结构化监督,提升多模态学习中干预一致性。其利用显式干预和场景依赖传播,生成对齐的输出,如反事实观察和阴影反射信号,覆盖单视图和多视图场景。
GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) ; Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) ; School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。
Comments 26 pages, 24 figures
Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方
机构 * Independent Researcher(独立研究者)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。
Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/
神经信号在真实环境中生成临床笔记
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; SANKEN, Osaka University(大阪大学SANKEN)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出CELM模型,首个能从长期EEG记录中生成多尺度临床报告的EEG-语言基础模型,通过整合预训练EEG模型与语言模型,实现了可扩展的多模态学习,实验表明其在多个评估设置中均优于现有方法。
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 多模态评测 :multimodal(abstract)
AI总结 大型语言模型(LLMs)在解决问题前后能够产生自我监控信号,如对自身能否成功解决问题的预判以及对答案正确性的后验判断,但这些信号通常未被用于控制推理过程。本文提出一种元认知控制框架,基于认知心理学中的纳尔逊-纳雷恩斯理论,将监控与推理分离,使模型在推理过程中根据预判和后验判断动态决定是否信任当前结果、是否重试或汇总多轮结果。实验表明,该框架无需参数更新或特定任务微调,即可显著提升基础模型在文本、代码和多模态任务中的表现。
持续离散化:用于贝叶斯推断的均值偏移交互粒子系统
机构 * Center for Computational Science and Engineering(计算科学中心) ; Laboratory for Information and Decision Systems(信息与决策系统实验室) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出基于均值偏移交互粒子系统的新型方法,用于近似概率分布的积分,该方法通过最小化最大均差来构建权重样本,适用于连续分布的贝叶斯推断。
印度婚礼系统优化(IWSO):一种受社会文化动态启发的新型元启发式算法及其操作设计与分析
机构 * Department of Computer Science, the VIZJA University, Warsaw, 01-043, Poland(VIZJA大学计算机科学系)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出了一种基于群体的元启发式算法IWSO,受印度传统婚礼的社会文化动态启发,通过家庭、候选人和牵线人的协作模拟匹配过程,采用匹配师引导影响策略和自适应淘汰重初始化机制,提升收敛性与多样性,实验表明其在高维多模态函数上的收敛速度、解质量及鲁棒性优于GA、PSO、DE等算法。