arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 198 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 25 篇

2602.00996 2026-06-23 cs.CL cs.AI 版本更新 62%

DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework

DeALOG: 去中心化多智能体日志中介推理框架

Abhijit Chakraborty, Ashish Raj Shekhar, Shiven Agarwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出去中心化多智能体框架DeALOG,通过共享自然语言日志实现多模态问答,各专业智能体协作检测和验证错误,无需中央控制,提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交 57%

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22319 2026-06-23 cs.RO cs.CV 新提交 57%

EmbodiedUS-FS: Fast Slow Intelligence for Ultrasound Robotics

EmbodiedUS-FS:用于超声机器人的快速慢速智能

Fangzhuo Zhang, Xinyu Wang, Xiao Yang, Jinchang Zhang

机构 * independent researcher(独立研究员) Shanghai World Foreign Language Academy(上海世界外国语中学) University of Wyoming(怀俄明大学) SUNY Binghamton(纽约州立大学宾汉姆顿分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出一种分层快慢思考的具身超声系统,通过慢脑进行意图解析和任务规划,快脑融合多模态反馈优化局部动作,并集成安全防护机制,在动态临床环境中提高任务成功率并减少安全违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 57%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21401 2026-06-23 cs.DC cs.AI 新提交 57%

SwarmX: Agentic Scheduling for Low-Latency Agentic Systems

SwarmX: 面向低延迟智能体系统的智能调度

Yeqi Huang, Yanwei Ye, Guomin Chen, Wenhao Su, Bin Gong, Jialian Li, Zhan Lu, Yangshen Deng, Xuan Sun, Le Xu, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Tencent(腾讯)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出SwarmX系统,通过调度专用神经预测器捕获提示、设备、运行时和目标模型特征,结合路由器与缩放器实现尾延迟感知决策,在近千GPU和百万CPU核的生产部署中,相比现有调度器将尾延迟降低61.5%,吞吐量提升2倍。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20905 2026-06-23 cs.RO cs.AI 新提交 57%

Vesta: A Generalist Embodied Reasoning Model

Vesta: 一种通用具身推理模型

Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学) University of Michigan(密歇根大学) Nanyang Technological University(南洋理工大学) Johns Hopkins University(约翰霍普金斯大学) University of Tübingen(图宾根大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出统一的基础模型Vesta,整合定位、空间推理、导航和长时规划能力,通过大规模空间感知语料库和简单多模态记忆机制,在多个基准上平均优于专用模型20%以上,在真实机器人任务中成功率提升35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20627 2026-06-23 cs.AI cs.LG 新提交 57%

Latent Goal Prediction from Language for Model-Based Planning

基于语言隐式目标预测的模型规划

Samuel Barbeau, Simon Roy, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * École de Technologie Supérieure, Montréal(蒙特利尔高等技术学院) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室) Polytechnique Montréal(蒙特利尔综合理工学院) MILA Institut Universitaire de France (IUF)(法国大学研究院) Université Sorbonne, CNRS, ISIR(索邦大学,法国国家科学研究中心,智能系统与机器人研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 提出LAGO框架,通过在同一隐空间预测语言指令的中间子目标序列和动作条件轨迹,结合软最小轨迹代价规划,实现长程鲁棒规划。

Comments 9 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03070 2026-06-23 cs.CR cs.AI 版本更新 57%

How Your Credentials Are Leaked by LLM Agent Skills: An Empirical Study

你的凭证如何被LLM智能体技能泄露:一项实证研究

Zhihao Chen, Ying Zhang, Yi Liu, Gelei Deng, Yuekang Li, Yanjun Zhang, Jianting Ning, Leo Yu Zhang, Lei Ma, Zhiqiang Li

机构 * Griffith University(格里菲斯大学) Wake Forest University(威克森林大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Zhejiang Sci-Tech University(浙江科技学院) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Independent Researcher(独立研究者)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 首次大规模实证研究LLM智能体技能中的凭证泄露问题,通过分析170,226个技能样本,识别出520个受影响技能和10种泄露模式,发现76.3%的案例需跨模态分析,调试日志占73.5%的漏洞,89.6%的泄露凭证可立即利用。

Comments Accepted to ASE 2026 (The 41st IEEE/ACM International Conference on Automated Software Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21897 2026-06-23 cs.CE 新提交 50%

Simulating Public Transit Fare Policies in NYC: An Efficient, Socioeconomic-Aware Framework

模拟纽约市公共交通票价政策:一个高效、社会经济感知的框架

Parker Wischhover, Hossein Amiri, Kiara Ha, Jooyoung Yoo, Lina Li, Andreas Züfle, Joon-Seok Kim

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一个可扩展的数据驱动仿真框架,集成合成人口、智能体仿真、多模式出行时间估计和票价敏感模式选择模型,评估纽约市多种票价政策对客流量、收入与公平性的影响。

Comments 10 pages, 10 figures, submitted to SIGSPATIAL'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20755 2026-06-23 cs.RO 新提交 50%

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

UNSEEN: 未知环境中基于稀疏估计的不确定性感知导航

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli

机构 * University of Trento(特伦托大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出UNSEEN框架,仅用前视相机通过稀疏地图与位姿不确定性估计,联合优化任务进度与估计精度,在未知环境中实现鲁棒导航,相比现有方法定位误差降低9.8%,估计精度提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20592 2026-06-23 cs.NI cs.LG 新提交 50%

Empowering Embodied AI in 6G Networks: Architecture, Enablers, and Open Challenges

赋能6G网络中的具身人工智能:架构、使能技术与开放挑战

Junaid Sajid, Sheikh Salman Hassan, Wenshuai Liu, Yan Kyaw Tun, Yaru Fu, Nguyen H. Tran, Zhu Han, Cedomir Stefanovic, Tharmalingam Ratnarajah, Muhammad Mahtab Alam

机构 * Thomas Johann Seebeck Department of Electronics(托马斯·约翰·塞贝克电子系) Tallinn University of Technology(塔林理工大学) Institute for Imaging, Data and Communication (IDCoM)(成像、数据与通信研究所) The University of Edinburgh(爱丁堡大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) School of Science and Technology(科学与技术学院) Hong Kong Metropolitan University(香港 metropolitan 大学) Department of Electronic Systems(电子系统系) Aalborg University(奥胡斯大学) School of Computer Science(计算机科学学院) University of Sydney(悉尼大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Houston(休斯顿大学) San Diego State University(圣地亚哥州立大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出面向6G的具身AI原生架构,通过感知-通信-动作闭环统一设计通信、感知、计算与控制,实现任务驱动的物理智能。

Comments This work has been submitted to the IEEE Communication Magazine for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 20 篇

2603.13312 2026-06-23 cs.MM cs.LG 版本更新 91%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.MM

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19120 2026-06-23 cs.LG cs.CV 新提交 89%

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏

Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 提出ViGOS框架,通过解耦感知和推理,在MLLM后训练中避免文本捷径,提升图像依赖行为。

Comments 29 pages, 5 figures, 8 tables; Project page: https://oedosoldier.github.io/ViGOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 85%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 多模态训练与对齐 :multimodal(title);MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22077 2026-06-23 cs.CV 新提交 83%

Morphology-Aware Multimodal Representation Learning for Insect Phylogenetic Reconstruction

形态感知的多模态表示学习用于昆虫系统发育重建

Zixuan Liu, Kaijie Yu, Chun He, Xiaoxu Cai, Xinhai Ye, Haishuai Wang, Gongyin Ye, Jiajun Bu

机构 * Rural Development Academy, Zhejiang University(浙江大学农村发展学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出形态感知多模态对齐框架,结合标本图像与形态描述,通过视觉Transformer微调和对比学习对齐图像-文本,学习连续性状用于贝叶斯系统发育重建,在Rove-Tree-11数据集上提升拓扑一致性。

Comments 7 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21446 2026-06-23 cs.CV 新提交 83%

Synergistic Dual-Branch Adaptation for Multi-modal Generalized Category Discovery

协同双分支自适应多模态广义类别发现

Yuxun Qu, Minyu Zhou, Yongqiang Tang, Chenyang Zhang, Wensheng Zhang

机构 * College of Computer Science, Nankai University(南开大学计算机学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出协同双分支自适应框架,通过跨模态协同适配器和邻域互学习模块,增强多模态广义类别发现中的细粒度关系监督,在六个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 82%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20738 2026-06-23 cs.CV cs.AI 新提交 81%

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion

一种基于视觉和表格Mamba的混合融合多模态医疗数据方法

Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling

机构 * Labcin - Nature Inspired Computing Lab, Federal University of Esp\'irito Santo, Vit\'oria, Brazil PPGI - Graduate Program in Computer Science, Federal University of Esp\'irito Santo, Vit\'oria, Brazil

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于Mamba架构的混合融合方法,通过视觉和表格两种Mamba变体处理图像与临床数据,在癌症分类中实现可解释性,在NDB-UFES数据集上表现优于Transformer。

Comments 15 pages. accepted to 36th Brazilian Conference on Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21892 2026-06-23 cs.LG cs.CV 新提交 79%

AgroSense 2.0: Cross-Modal Transformer Fusion with Geospatial Raster Integration and Interpretable Multi-Task Learning for Precision Crop Recommendation

AgroSense 2.0:基于跨模态Transformer融合、地理空间栅格集成与可解释多任务学习的精准作物推荐

Vishal Pandey, Rishav Tewari, Ruzina Haque Laskar

机构 * Research Engineer London, UK(英国伦敦研究工程师) Independent Researcher Kolkata, IN(印度加尔各答独立研究员) Centre for Development of Telematics(电信发展中心)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出AgroSense 2.0,通过跨模态Transformer融合、地理空间栅格集成和多任务学习,解决精准农业中作物推荐系统的模态鸿沟问题,实现可解释的作物推荐。

Comments 14 Pages, 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 79%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22138 2026-06-23 cs.CL cs.AI cs.LG q-bio.BM 新提交 79%

BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

BioMatrix:迈向覆盖序列、结构和语言模态矩阵的综合性生物基础模型

Qizhi Pei, Zhimeng Zhou, Yi Duan, Yiyang Zhao, Wei Li, Han Guo, Liang He, Chengping Li, Chang-Yu Hsieh, Conghui He, Rui Yan, Lijun Wu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室 OpenDataLab) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出首个原生多模态生物基础模型BioMatrix,通过统一分词方案将分子序列、结构、蛋白质序列、结构和自然语言映射到共享离散标记空间,在单一解码器架构下实现所有模态的统一生成,在80项任务中77项达到最优或竞争力水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20757 2026-06-23 cs.LG 新提交 78%

Evidential Fusion Network for Multimodal Survival Prediction under Missing Modalities

缺失模态下的多模态生存预测证据融合网络

Yucheng Xing, Hailan Mo, Zi Wang, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出EMMS模型,利用Dempster-Shafer理论和高斯随机模糊数融合多模态决策,处理缺失模态下的生存预测,无需生成缺失数据,在四个癌症数据集上达到最优性能并提供校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05963 2026-06-23 cs.CV cs.AI 版本更新 73%

Skeleton-to-Image Encoding: Enabling Skeleton Representation Learning via Vision-Pretrained Models

骨架到图像编码:通过视觉预训练模型实现骨架表示学习

Siyuan Yang, Jun Liu, Hao Cheng, Chong Wang, Shijian Lu, Hedvig Kjellstrom, Weisi Lin, Alex C. Kot

机构 * KTH Royal Institute of Technology(皇家理工学院) Lancaster University(兰卡斯特大学) Hebei University of Technology(河北工业大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) VinUniversity(文大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出S2I编码,将骨架序列转换为图像状数据,首次利用视觉预训练模型进行自监督骨架表示学习,统一异构骨架格式,在多个数据集上验证了有效性。

Comments Submitted to IJCV, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23534 2026-06-23 eess.SP 新提交 71%

Sensor-Stack Limits on Contactless In-Bed Body Position: A 20-Subject Multimodal Radar + Thermal LOSO Characterization

传感器堆栈对非接触式床上身体位置的限制:20名受试者多模态雷达+热成像LOSO表征

Dovy Paukstys

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 通过20名受试者的多模态雷达与热成像数据,研究非接触式床上体位推断的传感器表示限制,发现融合雷达与热成像的Logistic回归在床内/外分类中达到0.871中位平衡准确率,但俯卧检测性能不足(召回率0.50,精确率0.41),指出原始距离-FFT访问是下一步硬件实验方向。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19670 2026-06-23 physics.ins-det physics.data-an 新提交 67%

PiMiX 2.0: AI-enhanced Data Fusion for Radiographic Imaging and Tomography

PiMiX 2.0: 人工智能增强的放射成像与断层扫描数据融合

Zhehui Wang, Shanny Lin, Nicholas Amano, Susan S. Glenn, Ramya Gurunathan, Katie Liu, Nathan E. Peterson, Michelle A. Espy, Adam Thompson, Amy J. Clarke, Ray T. Chen

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)

AI总结 提出AI增强的数据融合框架PiMiX 2.0,集成多实验多模态放射成像与断层扫描,支持自动数据摄取、3D/4D重建及物理感知解释,加速数据处理并提升可重复性。

Comments 9 pages, 4 figures, 1 table. Work presented in the 26th Topical Conference on High Temperature Plasma Diagnostics Conference, Cambridge, MA, USA (June 7 - 11, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01989 2026-06-23 cs.CV cs.AI 版本更新 62%

Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation

静止的注意力保持静止:打破视觉惯性以缓解认知幻觉

Boyang Gong, Yu Zheng, Fanye Kong, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出惯性感知视觉激发(IVE)方法,通过建模视觉注意力的动态响应性,打破多模态大模型中的视觉惯性,从而缓解需要对象间关系推理的认知幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 57%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23668 2026-06-23 cs.LG 新提交 50%

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

关于提示条件语言模型作为通用学习器的局限性

David Mguni, Julian Ma, Jun Wang

机构 * Queen Mary University London(伦敦玛丽女王大学) University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20920 2026-06-23 cs.LG math.DS 新提交 50%

$Ω$: Operator-based Mixture Ensemble for Generative Assimilation

$Ω$: 基于算子的混合集成生成同化

Pouria Behnoudfar, Nan Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对高维非线性系统中非高斯后验分布难以刻画的问题,提出Ω框架,融合条件高斯代理、无监督分数学习和生成采样,无需真实后验样本即可高效重构后验分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04748 2026-06-23 q-bio.GN 版本更新 50%

SeekRBP: Leveraging Sequence-Structure Integration with Reinforcement Learning for Receptor-Binding Protein Identification

SeekRBP: 利用强化学习整合序列-结构信息识别受体结合蛋白

Xiling Luo, Le Ou-Yang, Yang Shen, Jiaojiao Guan, Dehan Cai, Jun Zhang, Guoliang Xing, Yanni Sun, Jiayu Shang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出SeekRBP框架,通过多臂老虎机策略动态采样难负例,融合蛋白质语言与结构嵌入,有效识别序列差异大的受体结合蛋白,在噬菌体宿主预测中表现优异。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏