Stability and bifurcation analysis in a mechanochemical model of pattern formation
机械化学模型中图案形成的稳定性与分岔分析
专题命中 多模态生成 :multimodal(abstract)
AI总结 该研究通过机械化学反馈机制,在无需第二抑制剂的情况下,实现单峰模式的稳健形成。
Comments 32 pages, 6 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机械化学模型中图案形成的稳定性与分岔分析
专题命中 多模态生成 :multimodal(abstract)
AI总结 该研究通过机械化学反馈机制,在无需第二抑制剂的情况下,实现单峰模式的稳健形成。
Comments 32 pages, 6 figures
UniM:一个统一的任意到任意交错多模态基准
机构 * NUS(新加坡国立大学) ; SCUT(上海交通大学) ; NTU(国立科技大学) ; NJU(南京大学) ; Microsoft Research(微软研究院)
专题命中 多模态评测 :multimodal(title,abstract);any-to-any(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。
Comments 70 pages, 63 figures, 30 tables, CVPR
多模态目标时刻在哪里?关于基础模型识别情境重要时刻的能力
机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文研究了多模态基础模型识别足球比赛中重要时刻的能力,发现现有模型在识别重要子事件时表现欠佳,需改进架构与训练方法以提升跨模态协同能力。
评估GPT-5作为多模态临床推理者的有效性:领域评论
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) ; Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。
迈向多模态终身理解:一个数据集和代理基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。
FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图
机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。
PhysLLM:利用大语言模型进行跨模态远程生理传感
机构 * Shenzhen University(深圳大学) ; Great Bay University(大鹏大学) ; National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) ; Guangdong Medical University(广东医科大学) ; Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) ; Macao Polytechnic University(澳门理工学院)
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV
AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。
Comments Accepted by International Conference on Learning Representations (ICLR) 2026
利用视觉与语言模型预测项目难度
机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 利用视觉与语言模型结合预测数据可视化测试项目难度,通过多模态方法实现更低的误差率,展示了LLMs在心理测量中的应用潜力。
一种360度多摄像头系统用于蓝色应急灯检测,采用颜色关注RT-DETR和ABLDataset
机构 * Institute of Telecommunications and Multimedia Applications, Universitat Politècnica de València(电信与多媒体应用研究所,巴塞罗那理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于颜色关注RT-DETR和ABLDataset的360度多摄像头系统,用于检测应急车辆蓝色灯光,实现高准确率和召回率,提升ADAS和道路安全性能。
Comments 16 pages, 17 figures. Submitted to IEEE Transactions on Intelligent Vehicles
为燃烧科学中的大语言模型知识注入和评估构建统一的基础框架
机构 * School of Mechanics and Engineering Science, Peking University(力学与工程科学学院,北京大学) ; AI for Science Institute(人工智能科学研究院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出一个统一框架,用于开发燃烧科学专用的大语言模型,通过三阶段知识注入路径提升模型性能。
Comments 5 figures, 1 table
SceneCOT: 在3D场景中引导链式推理
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。
Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/
SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。
基于智能鞋垫传感器数据的活动识别使用圆形扩张卷积神经网络
机构 * Yanhua Zhao
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 本文提出了一种基于圆形扩张卷积神经网络的活动识别方法,利用多模态时间序列数据实现高准确率的活动分类。
Comments 4 pages, 5 figures
Yukthi Opus:一种多链混合元启发式算法用于大规模NP难优化
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 Yukthi Opus通过结合MCMC、贪心局部搜索和模拟退火,提出了一种多链混合元启发式算法,用于解决大规模NP难优化问题,兼顾解的质量和稳定性。
Comments 22 pages, 9 figures, includes extensive ablation studies and benchmark comparisons
ViRC: 通过推理分块增强视觉交错数学思维链
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 ViRC通过引入推理分块机制,提升多模态数学任务中的推理能力,实现18.8%的性能提升。
Comments Accepted to CVPR 2026 (Main Track)
TEMPO-VINE:一个多时序传感器融合数据集用于葡萄园的定位与建图
机构 * Department of Electronics and Communications, Politecnico di Torino(电子与通信系,politecnico di torino大学) ; University Institute for Engineering Research, Miguel Hernández University(工程研究大学学院,miguel hernández大学)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 TEMPO-VINE数据集通过多时序传感器融合数据,为葡萄园的定位与建图提供全面的基准测试资源。
像狗一样行走:从未标记的动作数据中学习可调节的模仿控制器用于四足机器人
机构 * Computational Robotics Lab in the Department of Computer Science, ETH Zurich, Switzerland(计算机科学系计算机器人实验室,瑞士苏黎世联邦理工学院) ; Robot Intelligence Lab in the Department of Artificial Intelligence, Korea University, South Korea(人工智能系机器人智能实验室,韩国大学)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出了一种从未标记动作数据中学习可调节模仿控制器的方法,通过自动发现行为模式并生成风格一致的运动目标,实现四足机器人自主步态生成与转换。
Comments The supplementary video is available at https://youtu.be/DukyUGNYf5A
FMint-SDE:一种多模态基础模型,通过误差校正加速微分方程的数值模拟
机构 * University of Maryland(马里兰大学)
专题命中 多模态Agent :multimodal(title);multimodal foundation model(title);multi-modal(abstract);分类 cs.AI
AI总结 FMint-SDE通过多模态学习实现误差校正,提升微分方程数值模拟的精度与效率。
CCSD:跨模态组合自蒸馏用于缺失模态的鲁棒脑肿瘤分割
机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) ; College of Biomedical Engineering, Fudan University(生物医学工程学院,复旦大学) ; School of Medicine, Tongji University(医学院,同济大学) ; College of Information Engineering, China Jiliang University(信息工程学院,中国嘉兴大学)
专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 CCSD通过跨模态组合自蒸馏方法,提升在缺失模态下的脑肿瘤分割鲁棒性与泛化能力。
Comments 29 pages, 5 figures, 6 tables
VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Independent Researcher(独立研究者)
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。
Comments ICLR 2026
关于数据在开放集具身助益中的优势与劣势
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。
观察和控制视觉-语言-动作模型中的特征
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。
触觉在认知中的作用:记忆的破坏者还是促进者?
专题命中 多模态Agent :multimodal(abstract)
AI总结 本研究探讨触觉敏感度和运动强度对记忆的影响,发现增加书写压力略微降低即时回忆,但手套使用无明显影响,揭示了身体互动与认知表现之间的复杂关系。
Comments 22 Pages (including references), Book chapter
VizCrit: 探索在视觉设计工具中展示计算反馈的策略
专题命中 多模态Agent :multi-modal(abstract)
AI总结 VizCrit通过算法问题检测和视觉注释生成,探索在视觉设计工具中实现可操作反馈的策略,发现以解决方案为中心的反馈能提升初学者的创造力感知和设计质量。
LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索
机构 * Brown University(布朗大学)
专题命中 多模态Agent :multimodal(abstract)
AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。
Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)
MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Science and Technology Beijing(北京科技大学) ; NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; XYZ Embodied AI(XYZ具身AI) ; Shandong University(山东大学) ; Linketic ; D-Robotics
专题命中 多模态Agent :multi-modal(abstract)
AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。
Comments Project Page: https://xuhu0529.github.io/MarketGen
FedAFD: 通过对抗融合与蒸馏实现多模态联邦学习
机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江空间信息感知与传输重点实验室,杭州电子大学) ; Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(复杂系统建模与仿真实验室,计算机科学与技术学院,杭州电子大学) ; Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 FedAFD通过对抗融合与蒸馏方法,解决多模态联邦学习中的模态差异、任务差异和模型异质性问题,提升客户端与服务器的学习性能。
Comments Accepted by CVPR 2026
模态膨胀:MLLM推理的能量特性与优化机会
专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)
AI总结 本文研究了多模态大语言模型推理中的能量特性与优化机会,发现模态膨胀导致额外能耗,并提出阶段级DVFS优化方法以提升能效。
联邦模态特定编码器和部分个性化融合解码器用于多模态脑肿瘤分割
机构 * National Institute for Data Science in Health and Medicine(国家医学数据科学研究院) ; Department of Computer Science at School of Informatics(信息学院计算机科学系) ; Jarvis Research Center(Jarvis研究中心) ; Medical Artificial Intelligence Lab(医学人工智能实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出FedMEPD框架,通过联邦模态特定编码器和部分个性化融合解码器,解决多模态医学图像分析中的模态间异质性和个性化需求问题。
Comments Medical Image Analysis 2025. arXiv admin note: substantial text overlap with arXiv:2403.11803
深度学习中多模态遥感数据局部气候区分类的融合与分组策略
机构 * Graphics-Visualization-Computing Lab, International Institute of Information Technology Bangalore, Karnataka 560100, India(图形可视化计算实验室,国际信息学院班加罗尔,卡纳塔克邦560100,印度)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本研究提出了一种基于深度学习的多模态遥感数据局部气候区分类方法,通过融合与分组策略提升分类准确率,最终达到76.6%的整体准确率。
Comments 25 pages, 12 figures