arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-04 至 2026-06-04 共收录 106 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 9 篇

2606.01537 2026-06-04 cs.CV cs.LG 61%

PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder

PaCX-MAE: 生理增强的胸部X光掩码自编码器

Yancheng Liu, Kenichi Maeda, Manan Pancholy

机构 * University of California, Berkeley(加州大学伯克利分校) University of Tokyo(东京大学) University of Michigan(密歇根大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV;multi-modal(comments)

AI总结 提出PaCX-MAE跨模态蒸馏框架,通过双对比预测目标将生理先验注入胸部X光编码器,在保持单模态推理的同时提升生理相关任务性能。

Comments Accepted at the ICML 2026 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04133 2026-06-04 cs.CV 57%

Pinpoint: Grounded Worldwide Image Geolocation via Cross-Source Retrieval and Reranking

Pinpoint: 基于跨源检索与重排序的全球图像地理定位

Nika Chuzhoy, Brian Hu, Amit A. Arora, Jae Ro, Sarthak S. Sahu

机构 * Virtualitics

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种检索-重排序架构Pinpoint,通过对比学习融合Flickr照片和街景图像,结合注意力重排序器利用跨源证据实现全球图像地理定位,在多个基准上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04061 2026-06-04 cs.CV 57%

Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning

模态内邻居从不说谎:基于图模态内推理纠正模态间噪声对应

Yang Liu, Wentao Feng, Shu-Dong Huang, Yalan Ye, Jiancheng Lv

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出IN2R框架,利用模态内数据的几何稳定性,通过图精炼器对动态跨模态记忆中的邻居进行关系推理,合成连续软原型以纠正模态间噪声对应,显著提升跨模态检索性能。

Journal ref International Conference of Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04477 2026-06-04 cs.RO 50%

TransTac: Visuo-Tactile Modality Transition via Ultraviolet-Encoded Transparent Elastomers

TransTac: 通过紫外编码透明弹性体实现视觉-触觉模态转换

Lingyue Yang, Bin Fang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 提出一种透明紫外编码双目视觉触觉传感器TransTac,结合视觉观察与标记触觉重建,通过先验引导的Delaunay立体匹配算法实现鲁棒稀疏三角化,在零样本触觉图像识别上达到83.3%准确率,并显著增强跨模态对齐。

Comments Accepted at IEEE International Conference on Robotics and Automation (ICRA) 2026. 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 9 篇

2512.14099 2026-06-04 cs.CV 79%

ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models

ViewMask-1-to-3: 通过多模态离散扩散模型实现多视图一致图像生成

Ruishu Zhu, Zhihao Huang, Jiacheng Sun, Ping Luo, Hongyuan Zhang, Xuelong Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ViewMask-1-to-3,将多视图生成建模为离散序列预测问题,利用MAGVIT-v2视觉令牌和掩码令牌预测的离散扩散,通过迭代去掩码实现渐进式多视图生成,无需专门架构或3D几何先验,在GSO和3D-FUTURE基准上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23965 2026-06-04 math.NA cs.NA 78%

Multimodal sampling via Schrödinger-Föllmer samplers with temperatures

基于带温度参数的薛定谔-弗尔默采样的多模态采样

Xiaojie Wang, Xiaoyan Zhang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文通过引入温度参数并基于薛定谔-弗尔默扩散的欧拉离散化提出新采样器,在L^2-Wasserstein距离下获得O(h)的改进收敛率,数值实验表明高温对多模态分布采样至关重要且性能优于Langevin采样器。

Journal ref J. Complexity 96 (2026), Paper No. 102052

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00801 2026-06-04 cs.CV cs.MM 73%

Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories

Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑

Zhihui Chen, Qingyuan Lei, Kai He, Yanrui Du, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28762 2026-06-04 cs.CV cs.AI cs.GR cs.LG 62%

On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

上下文空间中的即时排斥以实现扩散变换器的丰富多样性

Omer Dahary, Benaya Koren, Daniel Garibi, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Snap Research Israel(Snap以色列研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对文本到图像扩散模型多样性不足的问题,提出在扩散变换器的上下文空间中通过多模态注意力通道施加即时排斥,在不牺牲视觉保真度和语义一致性的前提下显著提升生成多样性,且计算开销小,适用于现代Turbo和蒸馏模型。

Comments SIGGRAPH 2026. Project page: https://contextual-repulsion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13796 2026-06-04 cs.CL cs.CV 62%

The Mechanistic Emergence of Symbol Grounding in Language Models

语言模型中符号接地机制的涌现

Shuyu Wu, Ziqiao Ma, Xiaoxi Luo, Yidong Huang, Josue Torres-Fonseca, Freda Shi, Joyce Chai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 通过机械因果分析,发现符号接地在语言模型的中层计算中通过注意力头聚合环境信息实现,并在多模态对话和多种架构中复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04457 2026-06-04 cs.CV 57%

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

先构思再绘制:面向图像生成的视觉提示工程

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出视觉提示工程(VPE),通过在单一模型内先生成视觉语义令牌作为中间计划,再生成完整图像,从而避免信息瓶颈,提升图像生成质量与编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 57%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04884 2026-06-04 cs.RO 50%

D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving

D$^3$-MoE:面向风格可控的端到端自动驾驶的双解耦扩散混合专家模型

Renju Feng, Rukang Wang, Ning Xi, Jianguo Yu, Liping Lu, Pan Zhou, Duanfeng Chu

机构 * Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械电子工程学院) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) Hubei Key Laboratory of Distributed System Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(湖北省分布式系统安全重点实验室,华中科技大学网络空间安全学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出D$^3$-MoE框架,通过行为轴(扩散生成与选择解耦)和物理轴(纵向与横向专家解耦)的双重解耦,实现风格可控的端到端自动驾驶,在NAVSIM基准上达到SOTA规划性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.00078 2026-06-04 physics.data-an cs.DS cs.NA math.NA stat.ML 50%

Latent common manifold learning with alternating diffusion: analysis and applications

潜在共同流形学习与交替扩散:分析与应用

Ronen Talmon, Hau-tieng Wu

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于交替扩散的潜在共同流形模型,用于多模态数据融合,分析其理论基础并展示在多个应用中的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 19 篇

2606.05058 2026-06-04 cs.CV cs.AI 89%

UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

UniCAD:面向多模态多任务CAD的统一基准与通用模型

Jingyuan Chen, Sheng Jin, Haopeng Sun, Wentao Liu, Chen Qian

机构 * SenseTime Research and Tetras.AI(秒速科技研究院和Tetras.AI)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对CAD领域缺乏统一多模态基准的问题,提出UniCAD基准和UniCAD-MLLM通用多模态大语言模型,在点云到CAD重建、文本/图像到CAD生成和CAD问答等任务上实现端到端统一处理,并在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21094 2026-06-04 cs.CV 84%

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

T2AV-Compass:迈向文本到音频-视频生成的统一评估

Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jiahao Wang, Jialu Chen, Miao Deng, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出T2AV-Compass基准,通过分类学驱动的500个复杂提示和双层次评估框架(客观信号指标+主观MLLM评判),系统评估文本到音频-视频生成模型,发现现有模型在跨模态对齐和指令遵循方面显著不足。

Comments 41 pages, 13 figures, 12 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05008 2026-06-04 cs.CV cs.AI cs.CL 83%

M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

M$^3$Eval: 通过认知基础视频任务的多模态记忆评估

Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Yuanpei College, Peking University(北京大学元培学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出首个多模态模型记忆评估框架M$^3$Eval,通过认知心理学设计的视频任务系统评估模型在记忆保持、忠实性和鲁棒性上的表现,发现模型在并行视频流处理、干扰模式、时空记忆和符号记忆方面的显著缺陷。

Comments We present an evaluation designed for multi-modal memory in multi-modal models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04829 2026-06-04 cs.RO 82%

M3imic: Learning a Versatile Whole-Body Controller for Multimodal Motion Mimicking

M3imic: 学习用于多模态运动模仿的通用全身控制器

Zuxing Lu, Ziang Zheng, Yao Lyu, Jingyu Liu, Feihong Zhang, Song Lu, Xin Yuan, Changyin Sun, Xingxing Zuo, Shengbo Eben Li

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence(马尔代夫比兹亚德大学人工智能学院机器人系)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract,abstract_cn)

AI总结 提出M3imic框架,通过模态特定编码器将异构运动参考模态(机器人关节角度、人体姿态轨迹、末端执行器位姿)映射到共享潜在空间,并利用大规模强化学习训练单一策略,实现无需模态特定重训练的sim-to-real迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03175 2026-06-04 cs.CV cs.RO 81%

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation

在值得时询问:面向实例目标导航的成本感知开放式交互

Xunyi Zhao, Sihao Lin, Gengze Zhou, Zerui Li, Shijie Li, Wei Tao, Jiajun Liu, Qi Wu

机构 * Adelaide University(阿德莱德大学) Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心,澳大利亚机器学习研究所) Institute for Infocomm Research (I2R), A*STAR(信息与通信研究院(I2R),A*STAR) iMotion CSIRO Data61 Project Website(CSIRO Data61项目网站)

专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 针对实例目标导航中语言歧义问题,提出一种成本敏感的不确定性减少方法,通过信息增益分析确定有效问题类型,并构建基准测试和加权成功率指标,实现零样本MLLM导航器仅在预期收益大于成本时查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00012 2026-06-04 cs.CL cs.AI 81%

DraDDP: A Multimodal Multi-Party Dialogue Discourse Parsing Dataset

DraDDP:多模态多方对话话语解析数据集

Shannan Liu, Peifeng Li, Yaxin Fan, Qiaoming Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有研究局限于文本或双方对话的问题,构建了基于美剧的首个公开英文多模态多方对话话语解析数据集DraDDP,并验证了多模态信息在捕捉对话结构和关系类型中的价值。

Journal ref Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04282 2026-06-04 cs.CV 79%

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

FindIt:面向通用多模态大语言模型的格式感知视觉检测基准

Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根人工智能中心,图宾根大学) Woven by Toyota, Inc.(丰田公司) Toyota Motor Europe(丰田欧洲公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出首个全面评估通用多模态大语言模型在可提示定位能力上的基准,涵盖四种核心任务,并标准化输入输出格式,揭示模型对格式约束的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL 79%

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31039 2026-06-04 cs.CV 70%

GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

GGT-100K:面向泛化真实世界图像恢复的生成式真实标签

Xiangtao Kong, Jixin Zhao, Lingchen Sun, Rongyuan Wu, Lei Zhang

机构 * VISUAL COMPUTING LAB POLYU(PolyU视觉计算实验室) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出利用生成式多模态基础模型从真实低质量图像合成高质量目标作为真实标签,构建包含10万对数据的GGT-100K数据集,显著提升多种图像恢复模型的真实世界泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18577 2026-06-04 cs.AI 70%

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04244 2026-06-04 cs.AI cs.CL cs.CV cs.LG 67%

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

VAMPS: 视觉辅助数学问题求解基准

Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari, Yasamin Medghalchi, Ilker Hacihaliloglu, Mesrob Ohannessian, Lele Wang, Giuseppe Carenini

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出VAMPS基准,通过1,168道双语多选题评估多模态大模型在借助绘图工具进行数学推理时的表现,发现直接解析求解优于工具辅助视觉求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04970 2026-06-04 cs.CV cs.AI 62%

Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

计划、观察、恢复:主动式程序辅助的基准与架构

Kaustav Kundu, Ritvik Shrivastava, Maxim Arap, Nanshu Wang, Xianhui Zhu, Quintin Fettes, Gautam Tiwari, Parth Suresh, Théo Moutakanni, Alejandro Castillejo Munoz, Allen Bolourchi, Pascale Fung, Pinar Donmez, Babak Damavandi, Anuj Kumar, Seungwhan Moon

机构 * Meta Reality Labs(Meta现实实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出EgoProactive数据集和Pro²Bench基准,并设计解耦规划器-交互架构,用于主动式程序辅助中的实时引导和异常恢复。

Comments 53 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01421 2026-06-04 cs.AI cs.CL 62%

SciDER: Scientific Data-centric End-to-end Researcher

SciDER: 以科学数据为中心的端到端研究者

Ke Lin, Owais Aijaz, Yilin Lu, Yiyang Luo, Xuehang Guo, Preslav Nakov

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出SciDER多智能体系统,通过数据驱动方法和动态多模态技能系统,自动化科学研究的全生命周期,并在六个基准测试中取得领先结果。

Comments 10 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10912 2026-06-04 cs.AI cs.CL 62%

Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?

Breaking Bad Molecules: MLLMs 是否准备好进行结构级分子解毒?

Fei Lin, Ziyang Gong, Cong Wang, Tengchao Zhang, Yonglin Tian, Yining Jiang, Ji Dai, Chao Guo, Xiaotong Yu, Xue Yang, Gen Luo, Fei-Yue Wang

机构 * Department of Engineering Science, Macau University of Science and Technology, Macau, China(澳门科学技术大学工程科学系) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Pharmacy, Macau University of Science and Technology, Macau, China(澳门科学技术大学药学院) Faculty of Electrical Engineering and Computer Science, Ningbo University, Ningbo, China(宁波大学电气与计算机科学学院) State Key Laboratory of Biopharmaceutical Preparation and Delivery, Institute of Process Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院生物制药制备与递送国家重点实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ToxiMol 基准任务,利用多模态大语言模型进行分子毒性修复,并构建数据集、提示流程和自动评估框架 ToxiEval,实验表明当前模型虽面临挑战但展现出毒性理解与结构编辑的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04453 2026-06-04 cs.CV cs.LG 57%

Radiomic Feature Selection Using Gradient Loss of Deep Neural Network for Lung Cancer Stage Detection

基于深度神经网络梯度损失的放射组学特征选择用于肺癌分期检测

Hina Shakir, Mohammad Mohatram, Javeed Hussain, Syed Rizwan Ali, Muhammad Irfan Memon

机构 * Department of Software Engineering, Bahria University(巴尔ia大学软件工程系) Global College of Engineering and Technology(全球工程与技术学院) Software Engineering & Business Incubation Center, Bahria University(软件工程与企业孵化中心,巴尔ia大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出GL-RFE框架,利用深度神经网络梯度敏感性分析递归消除低贡献特征,从106个放射组学特征中选出前15个用于肺癌早晚期分类,准确率达90.22%。

Journal ref J. Vis. Exp. (230), e70181, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04381 2026-06-04 cs.LG cs.AI 57%

From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models

从符号到几何:在大语言模型中实现空间推理

Chen Chu, Bita Azarijoo, Li Xiong, Khurram Shafique, Cyrus Shahabi

机构 * University of Southern California(南加州大学) Emory University(埃默里大学) Novateur Research Solutions(Novateur研究解决方案)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出空间语言模型(SLM),通过将位置信息作为一等模态并学习空间表示,在推理过程中实现几何空间推理,显著优于基于符号推理的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04291 2026-06-04 cs.CV 57%

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

3D视觉食谱:数据、学习范式与应用

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

机构 * Brown University(布朗大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) New York University(纽约大学) The University of Sydney(悉尼大学) Stability AI

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种以数据为中心的3D视觉分类法,通过分析点云、网格、体素和3D高斯等几何表示及其获取流程,以及数据集设计、基准构建和监督机制,统一了表示、学习范式与下游任务(重建、生成、视频建模)之间的关系。

Comments Accepted to the CVPR 2026 OpenSUN3D Workshop. Official version available at CVF Open Access. https://openaccess.thecvf.com/content/CVPR2026W/OpenSUN3D/html/Du_A_Cookbook_of_3D_Vision_Data_Learning_Paradigms_and_Application_CVPRW_2026_paper.html

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏