Multimodal-NF: A Wireless Dataset for Near-Field Low-Altitude Sensing and Communications
Multimodal-NF: 一种用于近场低空传感与通信的无线数据集
专题命中 多模态评测 :multimodal(title,title_cn)
AI总结 本文提出Multimodal-NF数据集,用于近场低空极端大规模多输入多输出系统,通过融合多种模态数据提升无线传感与通信任务的性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Multimodal-NF: 一种用于近场低空传感与通信的无线数据集
专题命中 多模态评测 :multimodal(title,title_cn)
AI总结 本文提出Multimodal-NF数据集,用于近场低空极端大规模多输入多输出系统,通过融合多种模态数据提升无线传感与通信任务的性能。
衡量跨模态协同:VLM可解释性的一个基准
机构 * University of Luxembourg(卢森堡大学) ; Luxembourg Institute of Health (LIH)(卢森堡健康研究院)
专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 本文提出Synergistic Faithfulness作为衡量VLM跨模态协同的指标,解决了传统单模态评估方法在评估VLM可解释性时的不足,通过引入Shapley交互指数,实现了对多模态协同的准确评估,同时提升了计算效率。
视见之代价:在单体范式内实现可信的多模态推理
机构 * IIIT Delhi, India(德里印度理工学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种新的多模态评估方法,通过信息论视角揭示了多模态推理中的视见代价问题,提出了三个新指标并提出了语义充分性准则,挑战了传统多模态评估方法。
Comments Addresses practical viability of Vlabel construction. Writing is grounded. Acknowledgement is duly added
MOTOR: 两轮车骑行行为理解的多模态数据集
机构 * CVIT, IIIT-Hyderabad(IIIT-海得拉巴学院计算机视觉研究所)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出MOTOR数据集,用于研究两轮车在密集无结构交通中的骑行行为,通过多视角、多模态数据融合,为自动驾驶辅助系统提供新的研究基础。
AgroTools: 一个用于农业中增强工具的多模态代理基准
机构 * Sun Yat-Sen University(中山大学) ; Southwest University(西南大学) ; Northeastern University(东北大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; Southwest Jiaotong University(西南交通大学) ; China Agricultural University(中国农业大学) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。
弱监督跨模态学习用于4D雷达场景流估计
机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) ; Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。
Comments Accepted by ICML2026
模态迷失:评估基于文本的成员推断攻击在大型多模态模型中的有效性
机构 * Japan Advanced Institute of Science and Technology - Information Science(日本科学技术先进研究院-信息科学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文评估了基于文本的成员推断攻击(MIAs)在多模态模型中的有效性,发现其在分布内设置中表现相似,而在分布外设置中视觉输入起到正则化作用,有效掩盖了成员信号。
Comments accepted by ESANN 2026
向大规模多模态模型选择作为医疗图像中已烧毁保护健康信息检测引擎的方向
机构 * QwenLM(通义实验室)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文研究了如何利用大规模多模态模型进行医疗图像中保护健康信息的检测,通过对比三种主流模型在不同流程配置下的表现,发现大规模多模态模型在OCR性能上优于传统方法,但整体检测准确性提升不显著,尤其在复杂印模模式测试中表现更优,并提出了针对特定操作约束的模型选择建议和部署策略。
Comments Accepted at EMBC 2026
癫痫半相学套件(S3):一个临床多模态数据集、基准和模型用于癫痫半相学理解
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Pittsburgh(匹兹堡大学) ; Fudan University(复旦大学) ; University of California, Riverside(加州大学河滨分校) ; Hong Kong University of Science(香港科学大学) ; Maharishi International University(玛希拉国际大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出S3数据集和基准,用于细粒度、结构化的癫痫半相学理解,通过评估多模态大语言模型在低级视觉感知、时间序列处理、叙述报告生成和癫痫诊断中的能力,揭示了现有模型在左右脑推理、时间定位、症状序列和临床忠实报告方面的系统性弱点,并展示了针对癫痫的微调和双阶段神经符号框架在癫痫与非癫痫癫痫分类中的高F1分数。
Comments Accepted to ICML 2026 as a Spotlight presentation
CryoNet:一种用于多模态冰川覆盖区制图的深度学习框架。帕iqu盆地,中央喜马拉雅地区案例研究
机构 * University of Sannio(萨恩尼奥大学) ; Graz University of Technology(格拉茨技术大学)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV
AI总结 本研究提出CryoNet,一种利用多模态数据集的深度学习框架,用于区分干净冰川、覆盖冰川和冰湖,通过在喜马拉雅中央帕iqu盆地的案例研究展示了其在复杂高山环境中的有效性。
Comments 15 pages, 10 figures, 5 tables. Preprint submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS); currently under review
迈向现实的Wi-Fi故障诊断:一个多模态基准
专题命中 多模态评测 :multi-modal(title,abstract)
AI总结 本文提出一个多模态基准,用于评估Wi-Fi故障诊断方法,通过构建现实中的Wi-Fi测试床和收集超过10,000个故障样本的数据集,揭示了现有方法在利用异构操作数据方面的挑战,并评估了新兴的LLM方法。
MM-Conv: 一种多模态数据集和基准,用于上下文感知的3D对话中指代解析
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
AI总结 本文提出了一种多模态数据集和基准,用于在动态3D环境中实现上下文感知的指代解析,通过引入包含6.7小时第一人称VR交互的同步语音、动作、注视和3D场景几何数据的基准,以及一个两阶段的指代解析流水线,改进了对话中的指代解析性能。
Comments Extended version of the paper published at LREC 2026 (Palma de Mallorca, Spain), with expanded VLM baselines and inter-annotator agreement analysis
Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), Palma de Mallorca, Spain
重新审视图像与元数据整合用于DICOM系列分类:交叉注意力与字典学习
机构 * Bayer AG(勃林格殷曼公司)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种端到端的多模态框架,用于DICOM系列分类,通过联合建模图像内容和获取元数据,显式考虑异质切片内容、可变系列长度和完全缺失、不完整或不一致的DICOM元数据等挑战。
Comments Early acceptance at MICCAI 2026
SplAttN: 通过高斯软溅射和注意力在2D和3D之间架桥以实现点云补全
机构 * School of Computing and Artificial Intelligence(计算与人工智能学院) ; Southwest Jiaotong University(西南交通大学) ; Chengdu, China(中国成都)
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出SplAttN方法,通过高斯软溅射和注意力机制解决点云补全中2D和3D模态连接问题,改进了传统硬投影导致的跨模态熵塌陷问题,实现了更有效的跨模态连接学习。
Comments Accepted as a Spotlight paper at ICML 2026; camera-ready version
感知还是偏见:大语言模型能否超越个性的第一印象?
机构 * The University of Tokyo(东京大学) ; Shanda AI Research Tokyo(Shanda AI 研究所东京) ; Dalian University of Technology(大连理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨了多模态大语言模型(MLLMs)在感知个性方面的能力,提出了一种新的任务Grounded Personality Reasoning(GPR),并构建了一个新的数据集MM-OCEAN,通过三重评估体系揭示了MLLMs在人格推理中的偏见问题。
SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见
机构 * Nanyang Technological University(南洋理工大学)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。
AtelierEval: 人类与LLM作为文本到图像提示器的代理评估
机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。
Comments Accepted by ICML 2026
从识别到推理:在现实世界收据文档理解上对齐和增强MLLMs
机构 * Zhejiang University(浙江大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出ReceiptBench基准,通过四个层次化子任务提升收据信息提取的结构一致性,并提出两阶段训练框架GRPO,通过强化学习信号提升模型性能,实验证明其在复杂推理任务上的优越性。
AEGIS:一个评估人工智能生成学术图像取证分析的综合基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出AEGIS基准,通过七个学术类别和39个细粒度子类型覆盖,揭示了人工智能生成学术图像取证分析的内在难度,同时评估了多种模型在检测、推理和定位方面的性能,揭示了不同模型家族的互补优势。
Comments Accepted to ACL 2026 Main Conference
自动化自我测试作为质量门:基于证据的LLM应用发布管理
机构 * Lumytics
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 本文提出了一种自动化自我测试框架,通过五个实证基础的维度(任务成功率、研究环境保持、P95延迟、安全通过率和证据覆盖)实现基于证据的发布决策(PROMOTE/HOLD/ROLLBACK),并通过长期案例研究评估了该框架在多代理对话AI系统中的有效性。
Comments 20 pages, 6 figures, 12 tables
LLMs can construct powerful representations and streamline sample-efficient supervised learning
机构 * MIT(麻省理工学院) ; Harvard Medical School(哈佛医学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种基于LLM的代理流程,通过生成全局 rubric 来提升多模态数据的表示能力,并在15个临床任务中显著优于传统方法。
模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准
机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; Peking University(北京大学) ; South China University of Technology(华南理工大学) ; Nanjing University(南京大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。
Comments https://vibe-benchmark.github.io/
DeFacto: 通过图像进行反事实推理以强制证据支持和忠实推理
机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) ; Zhongguancun Academy, Beijing, China(中关村学院) ; School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院) ; College of Materials Science and Engineering, Fuzhou University, Fuzhou, China(福州大学材料科学与工程学院) ; Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) ; Beijing Qianjue Technology Co., Ltd., Beijing, China(北京千 jue 技术有限公司)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出DeFacto框架,通过整合正例、反事实和随机遮蔽三种训练范式,提升多模态语言模型在证据一致性方面的表现,并引入DeFacto-1.5K基准进行系统评估。
关于RL微调VLMs的鲁棒性和链式思维一致性
机构 * Apple(苹果公司) ; OpenAI
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。
Comments ICML 2026
OSM+: 亿级开放街图数据集用于城市级实验
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出OSM+数据集,通过分布式云计算处理5000个核心,释放了一个包含10亿个顶点的全球道路网络图数据集,用于高可访问性和可操作性,展示了其在城市边界检测、交通预测和交通政策控制中的应用,同时提供了数据处理工具以加速地理基础模型的训练。
Comments to be published in ICML2026
OCELOT:用于腿部机器人的步态和接触估计
机构 * Department of Aerospace Engineering, Embry-Riddle Aeronautical University(航空航天工程系,埃默里-瑞德航空航天大学)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出了一种基于误差状态扩展卡尔曼滤波器(ESEKF)的完整腿部里程计管道,通过仅使用本体感觉数据(如固定IMU、关节编码器和力传感器)来实现准确的里程计估计,核心贡献是融合接触检测和不确定性量化模块,用于显式识别并拒绝滑动。
Comments 8 pages