GenClaw: Code-Driven Agentic Image Generation
GenClaw: 代码驱动的智能体图像生成
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。
Comments 21 pages, 7 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
GenClaw: 代码驱动的智能体图像生成
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。
Comments 21 pages, 7 figures
基于整流流的胶质瘤患者放疗前先验信息治疗后脑MRI预测
机构 * Amsterdam UMC, Department of Radiation Oncology(阿姆斯特丹大学医学中心放射肿瘤科) ; Cancer Center Amsterdam, Imaging and Biomarkers(阿姆斯特丹癌症中心影像与生物标志物) ; Department of Radiology and Nuclear Medicine(放射科与核医学科) ; Amsterdam UMC, Vrije Universiteit Amsterdam, Amsterdam Neuroscience, Brain Imaging(阿姆斯特丹大学医学中心、阿姆斯特丹自由大学、阿姆斯特丹神经科学、脑成像)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 提出一种基于整流流的条件图像生成模型,利用放疗前MRI和剂量图预测治疗后任意时间点的脑MRI,实现快速推理并保持语义和视觉保真度。
Comments 10 pages, 6 figures, 1 supplementary table, added GitHub url, corrected figure captions
表面约束策略:学习受表面约束且动态可行的机器人技能
机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(智能制造装备与技术国家重点实验室,华中科技大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出表面约束策略(SCP),通过二维加权高斯核编码表面几何约束,结合扩散策略和基于相似性的动作映射生成动态可行的表面约束运动,解决了自由曲面约束下动作随机性和接触不稳定的问题。
MuCRASP: 多模态思维链推理感知的结构化剪枝
机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。
Comments Preprint ver. 2
图像辩论:检测多模态大语言模型中的欺骗行为
机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。
Comments 39 pages, 16 figures, camera ready version for ICML 2026
ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; School of Materials Science and Engineering(材料科学与工程学院) ; China Mobile Research Institute(中国移动研究院) ; College of Computing and Data Science(计算与数据科学学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。
推进大型多模态模型中的创造性物理智能
机构 * UIUC(伊利诺伊大学香槟分校) ; Amazon(亚马逊)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大型多模态模型在开放式环境中缺乏基于视觉的创造性工具使用能力的问题,提出MM-CreativityBench基准和基于偏好学习的具身对齐方法,显著提升实体选择并减少幻觉。
Comments 51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910
FAM-Bench:面向条件感知的“食物即药物”推理的多模态基准
机构 * Department of Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) ; Muma College of Business, University of South Florida(佛罗里达州立大学Muma商学院) ; Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)
专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI
AI总结 提出FAM-Bench多模态基准,包含2500个营养专家验证的实例,通过菜肴适宜性评估和比较分析两个任务,测试模型在特定健康状况下对食物选择的推理能力。
BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动力学基准测试
机构 * Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 提出BilliardPhys-Bench基准,通过合成台球环境评估多模态大语言模型在物理推理(碰撞、反弹、最终位置预测)上的能力,发现模型存在“静态偏差”且性能随模拟时间与场景复杂度下降。
OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Southeast University(东南大学) ; Nanjing University(南京大学) ; Suzhou Laboratory(苏州实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。
Comments 22 Pages
何时多模态预测具有生物学支持?一个诊断性评估框架
机构 * Oncology Data Science & AI, R&D(肿瘤数据科学与人工智能,研发)
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 提出DECAT框架,通过五个零参考指标和规则决策,将多模态表示分类为四种诊断场景,以检测模型是否学到共享生物学、单模态生物学或虚假相关性。
一致贝叶斯局部空间特征选择及其在空间多模态组学中的应用
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 针对空间多模态组学中的高维回归问题,提出一种贝叶斯局部空间特征选择框架,通过随机域划分先验和局部特征选择先验实现域划分与特征选择的一致性理论,并开发高效的可逆跳跃MCMC算法。
基于EEG的多模态学习:曲率混合专家双曲空间方法
机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) ; BIFOLD, Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) ; University of Cambridge, Cambridge, UK(剑桥大学)
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 提出EEG-MoCE框架,通过可学习曲率的双曲空间为每个模态分配专家,并采用曲率感知融合策略,实现层次结构建模,在情绪识别、睡眠分期和认知评估任务上达到最优性能。
Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)
语言训练深度伪造检测器的正则化能力
机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。
FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导
机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) ; Microsoft(微软)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。
BEV感知能否在传感器故障下优雅降级?
机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System(天津智能无人群技术与系统重点实验室) ; School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) ; Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理重点实验室,中华人民共和国教育部)
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对多模态BEV感知在传感器损坏时性能骤降的问题,提出Grace-BEV框架,通过主动可靠性评估和动态特征重校准实现优雅降级,在极端LiDAR故障下将mAP从0.0%恢复至34.7%。
SPM-Bench:面向扫描探针显微镜的大型语言模型基准测试
机构 * Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.AI
AI总结 提出SPM-Bench,一个全自动数据合成管道和严格评估指标(SIP-F1),用于测试LLMs在扫描探针显微镜领域的推理能力,并首次量化模型“个性”。
SAW-Bench:在现实世界中学习情境感知
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Yale University(耶鲁大学) ; Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学学院市分校) ; Amazon(亚马逊) ; University of California, Merced(加州大学默塞德分校)
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。
一种新颖的全局上下文感知深度神经网络用于基于磁共振图像的增强脑肿瘤分割
机构 * National Institute of Technology Silchar(全国理工学院锡拉char分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出全局上下文感知的挤压激励残差UNet(GCSER-UNet),融合空间和通道注意力,在TCGA LGG和BraTS 2020数据集上取得优于现有技术的Dice分数。
Comments 11 pages, 9 figures, 6 tables. Submitted to arXiv cs.CV
用于汽车点云语义分割的普通ViT
机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, IP Paris, France(LIGM、CNRS、Université Gustave Eiffel、ENPC、IP Paris、法国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出VaViT,通过精心设计的标记器、轻量级解码器头和定制数据增强,使普通非分层ViT在大规模激光雷达点云语义分割中达到或超越现有最先进方法。
面向开放世界的自监督在线机器人无关可通行性估计
机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 提出COTRATE框架,通过自监督在线学习从多模态未标记机器人经验中估计可通行性,采用机器人无关的地形评估模块和多样性感知特征选择策略,实现跨平台知识迁移并降低遗忘。
Comments 14 pages, 16 Figures
特殊教育的强化学习:通过残疾适应性训练使LLM导师适应多样化学习者
专题命中 多模态评测 :multimodal(abstract)
AI总结 提出Special-R1框架,通过二维自适应系统提示和基于残疾特征的思维奖励,将强化学习扩展到特殊教育,显著提升对残疾学习者的适配性和帮助性。
面向多模态智能体的任务聚焦记忆
机构 * Fudan University(复旦大学)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。
EMBGuard:为具身智能体安全规划构建危险感知护栏
机构 * Independent Researcher(独立研究者) ; Department of Biomedical Engineering(生物医学工程系) ; the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) ; Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)
专题命中 多模态Agent :MLLM(summary_cn,abstract);分类 cs.CL
AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。
Comments Accepted at ICML 2026
PInVerify:面向主动实例验证的离线具身基准
机构 * University of Trento(特伦托大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。
Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify
任意场景检测:一种具有经验感知推理的目标检测智能体框架
机构 * Keio University(Keio大学) ; Tsinghua University(清华大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出DetAS/DetAS-X智能体框架,利用多模态大语言模型自适应组合恢复模块和专用检测器,通过自进化经验积累实现经验感知推理,在六个基准上平均F1提升28.36%。
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中
机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) ; Independent Researcher(独立研究者) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。
Comments Accepted by ICML 2026
DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图
机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出DGSG-Mind,一种混合实例感知的3D高斯动态场景图系统,通过概率体素网格与显式3D高斯结合实现鲁棒的跨模态实例融合和增量语义映射,并构建层次化场景图与3D高斯思维进行多模态推理,在零样本3D视觉定位、开放词汇语义分割和场景重建中取得领先性能。
Comments 9 pages, 6 figures
视觉信息在视觉-语言-动作模型驾驶行为中是否起决定性作用?
机构 * Intelligent Transportation Thrust, The Hong Kong University of Science and Technology (Guangzhou)(科技与交通智能 thrust,香港科学与技术大学(广州))
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出结构化多级视觉扰动框架,系统分析VLA驾驶模型对视觉信息的依赖程度,揭示依赖模式随评估方式变化且在不同抽象层次上不均匀。
先见后议:用视觉证据对齐多智能体共识
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Shandong University(山东大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。