arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 177 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 38 篇

2605.16386 2026-05-19 cs.CV 79%

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

对多模态大语言模型评分者的审计:临床顺序评分中的中间倾向偏差

Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Computer and Information Science and Engineering(计算机与信息科学与工程系) Department of Clinical and Health Psychology(临床与健康心理学系) Department of Biomedical Engineering(生物医学工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在临床顺序评分中的中间倾向偏差,通过基准测试发现三种前沿LLM在Clock Drawing Test评分中存在系统性压缩倾向,影响临床决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18621 2026-05-19 cs.CV cs.AI 79%

CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark

CrossView Suite: 利用数据集、模型和基准 harnessing MLLMs 的跨视图空间智能

Wei Wang, Yuqian Yuan, Tianwei Lin, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出CrossView Suite,通过开发CrossViewSet、CrossViewBench和CrossViewer三个组件,解决跨视图推理中的数据稀缺、评估不足和对齐机制缺失问题,提升多视图空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18351 2026-05-19 cs.NE 78%

Mapping the Fitness Landscape: A Structure-Guided Approach to Multi-Modal Optimization

映射适应度景观:一种基于结构的多模态优化方法

Meng Xiang, Pei Yan

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 本文提出了一种基于结构的多模态优化方法,通过构建适应度景观来指导多模态优化过程,改进了传统进化算法在多模态搜索中的不足,提高了解的质量和覆盖范围。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18262 2026-05-19 cs.RO 78%

On Improving Multimodal Pedestrian Trajectory Prediction with CVAE: A Study on Benchmark and Robot Data

基于CVAE的多模态行人轨迹预测改进:对基准数据和机器人数据的研究

Yuzhou Liu, Cristina Olaverri-Monreal

机构 * Dept. Intelligent Transport Systems, Johannes Kepler University Linz(智能交通系统系,约翰·凯撒大学林茨)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出基于Social-STGCNN的CVAE概率模型,以改进多模态行人轨迹预测,通过在基准数据集和真实机器人数据集上的评估,展示了方法在不同人群配置下的端点准确性和轨迹多样性改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17962 2026-05-19 cs.CE 78%

FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation

FinDocMRE:一个文档级金融多模态推理评估基准

Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出FinDocMRE基准,用于评估金融多模态模型在文档级推理中的能力,通过构建包含12,207个样本的金融报告数据集,评估多图像处理和文档理解能力,发现现有模型在复杂文档环境中整合视觉基础与逻辑推理存在挑战。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17421 2026-05-19 cs.RO 78%

MUSE: Multimodal Uncertainty Quantification of State Estimation

MUSE:多模态状态估计不确定性量化

Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

机构 * Department of Mechanical Science and Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校塞贝尔计算与数据科学学院) Department of Electrical Engineering, University of South Carolina(南卡罗来纳大学电气工程系)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MUSE,一种基于学习的实时框架,利用Mamba的强效序列建模能力,从多个异步传感器流中估计定位不确定性,提高了状态估计的可靠性和鲁棒性。

Comments Code and dataset: https://github.com/hungdche/MUSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18577 2026-05-19 cs.CV 77%

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

OmniPro: 一个全面的多模态流视频理解基准测试

Ruixiang Zhao, Jie Yang, Zijie Xin, Tianyi Wang, Fengyun Rao, Jing LYU, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 本文提出OmniPro基准测试,旨在评估多模态感知、主动响应和多样视频理解任务,通过2700个经人类验证的样本覆盖9个子任务和3个认知层次,揭示音频在流视频理解中的关键作用及模型在长时间任务中的鲁棒性问题。

Comments Project page: https://ruixiangzhao.github.io/OmniPro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17308 2026-05-19 cs.AI 77%

Reasoning Before Diagnosis: Physician-Inspired Structured Thinking for ECG Classification

在诊断前进行推理:受医生启发的结构化思维用于心电图分类

Yang Wu, Xiaoyan Yuan, Hau-San Wong, Xiping Hu

机构 * City University of Hong Kong(香港城市大学) Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出CardioThink框架,通过结构化推理过程提升心电图分类的临床相关性,并引入SSPO方法以优化诊断结果的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21529 2026-05-19 cs.CR 71%

TMRugPull: A Temporally Sound Multimodal Dataset for Early RugPull Detection

TMRugPull: 一个时间感知的多模态数据集用于早期 RugPull 检测

Fatemeh Shoaei, Mohammad Pishdar, Mozafar Bag-Mohammadi, Mojtaba Karami, Bert Lagaisse

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出一个时间绑定的多模态数据集 TMRugPull,包含1000个项目,用于早期RugPull检测,通过三种模态数据验证数据集的时间有效性,并公开数据集和代码库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18451 2026-05-19 cs.CV cs.GR 70%

Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis

Code-as-Room: 通过代理代码合成从俯视图图像生成3D房间

Yixuan Yang, Zhen Luo, Wanshui Gan, Jinkun Hao, Junru Lu, Jinghao Yan, Zhaoyang Lyu, Xudong Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) University of Warwick(沃里克大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Code-as-Room框架,通过结构化执行 harness 生成3D房间,利用Blender代码表示房间,并引入专门的代码基3D房间合成基准进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16431 2026-05-19 cs.CV 70%

CT-DegradBench: A Physics-Informed Benchmark for CT Degradation Detection and Severity Estimation

CT-DegradBench:一种用于CT退化检测和严重程度估计的物理引导基准

Yousra Nabila Taifour, Marouane Tliba, Zuheng Ming, Marie Luong, Nour Aburaed, Aladine Chetouani, Gorkem Durak, Alessandro Bruno, Faouzi Alaya Cheikh, Habib Zaidi, Ulas Bagci, Azeddine Beghdadi

机构 * Université Sorbonne Paris Nord(索邦巴黎北大学) University of Dubai(迪拜大学) Northwestern University(西北大学) IULM University(IULM大学) Norwegian University of Science and Technology(挪威科学与技术大学) University of Geneva(日内瓦大学)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CT-DegradBench,一个用于评估CT退化检测和严重程度估计的基准,结合语义先验和频域线索,提出SeSpeCT框架,在多模态嵌入空间中构建免训练的语义质量轴,实现退化类型和严重程度的联合预测。

Comments Accepted in CVPR 2026 VISION Workshop (DEXTER track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16892 2026-05-19 cs.CV cs.AI cs.CL 67%

DriveSafe: A Framework for Risk Detection and Safety Suggestions in Driving Scenarios

DriveSafe: 一种用于驾驶场景中风险检测与安全建议的框架

Sainithin Artham, Shankar Gangisetty, Avijit Dasgupta, C. V. Jawahar

机构 * IIIT-Hyderabad(IIIT-海得拉巴)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出DriveSafe框架,通过结构化自然语言描述实现风险感知场景理解,结合多模态上下文生成空间 grounded 的描述,用于下游风险评估和安全建议,实验表明其在DRAMA基准上达到最先进的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16275 2026-05-19 cs.CY cs.AI cs.CL cs.MM 67%

AI Slop or AI-enhancement? Student perceptions of AI-generated media for an English for Academic Purposes course

AI 产出物还是AI增强?英语学术用途课程中学生对AI生成媒体的看法

David James Woo, Deliang Wang, Kai Guo

机构 * Everwrite Limited(Everwrite有限公司) Faculty of Education, The University of Hong Kong(香港大学教育学院) Faculty of Education, The Chinese University of Hong Kong(香港中文大学教育学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 研究探讨了AI生成内容在EAP课程中的教学效果,通过混合方法分析发现学生偏好视觉化内容,视频与学业表现正相关,但高认知负荷与成绩负相关,表明需合理设计内容以提升学习效果。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00392 2026-05-19 cs.RO cs.AI cs.CV 62%

SonarSweep: Fusing Sonar and Vision for Robust 3D Reconstruction via Plane Sweeping

SonarSweep: 通过平面扫描融合声纳与视觉以实现鲁棒的3D重建

Lingpeng Chen, Jiakun Tang, Apple Pui-Yi Chui, Ziyang Hong, Junfeng Wu

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Chinese University of Hong Kong, Hong Kong(香港中文大学) Department of Automation, Harbin Institute of Technology(哈尔滨工业大学自动化系)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SonarSweep,一种端到端的深度学习框架,通过将平面扫描算法应用于声纳与视觉数据的跨模态融合,克服了单一模态方法在 underwater 环境中3D重建的局限性,实现了更精确和稳定的深度图生成。

Comments 8 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18132 2026-05-19 cs.CV cs.AI 62%

Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models

谁生成了这个3D资产?学习生成3D模型的来源归属

Sihan Ma, Siyuan Liang, Dacheng Tao

机构 * College of Computing & Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出了一种方法,用于确定给定3D资产是由哪种生成模型创建的,通过构建首个被动来源归属基准,发现生成3D模型留下稳定的指纹特征,从而建立了可信的3D内容来源的新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17826 2026-05-19 cs.CV cs.AI 62%

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

CounterCount: 一种用于视觉语言模型计数偏差诊断的框架

Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

机构 * KAUST(卡尔斯鲁德大学) University of Edinburgh(爱丁堡大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CounterCount框架,通过对比事实性与反事实性图像来诊断视觉语言模型在计数任务中的偏差问题,揭示模型对物体级先验知识的依赖,并提出统一的注意力调节策略提升反事实计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17187 2026-05-19 cs.CL cs.AI cs.CY 62%

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

PluRule:一种用于社交媒体上多元社区调节的基准测试

Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer

机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16373 2026-05-19 cs.CV cs.AI cs.LG 62%

Cross-Source Supervision for Bone Infection Segmentation in Dual-Modality PET-CT

跨源监督在双模态PET-CT骨感染分割中的应用

Zonglin Yang, Xiaolei Diao, Jishizhan Chen, Xiaozhuang Man, Wei Kong, Gen Wen, Pengfei Cheng, Daqian Shi

机构 * Shanghai Maritime University(上海海洋大学) University College London(伦敦大学学院) Shanghai Sixth People’s Hospital(上海第六人民医院) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) Queen Mary University of London(伦敦女王玛丽大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种双模态端到端分割框架,通过早融合多模态表示整合PET代谢信号和CT骨窗解剖信息,解决标注不一致下的骨感染分割问题,采用患者级3D体积评估和交叉验证提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16357 2026-05-19 eess.SP cs.AI cs.CV 62%

Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization

学习位移感知的Wi-Fi表示以实现弱监督的相对定位

Tzu-Ti Wei, Po-Cheng Chen, Yu-Chee Tseng, Jen-Jee Chen

机构 * College of AI, National Yang Ming Chiao Tung University(人工智能学院,National Yang Ming Chiao Tung大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IP框架,通过交叉模态学习对齐指纹轨迹与位移轨迹,学习位移感知的Wi-Fi表示,实现准确的相对定位,并扩展至少样本绝对定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12413 2026-05-19 cs.CV 57%

Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images

超越定位:从全景图像中对MLLMs的视角条件空间推理进行综合诊断

Yuangong Chen, Wai Keung Wong, Jiaxing Li, Ioannis Patras, Xu Zheng

机构 * The Hong Kong Polytechnic University(香港理工大学) Guangzhou University(广州大学) Queen Mary University of London(伦敦玛丽女王大学) HKUST(Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型(MLLMs)在视角变化下的空间推理能力,提出了PCSR-Bench基准测试,评估了14种代表性MLLMs在不同任务上的表现,揭示了空间推理能力的显著差距,并探讨了通过强化学习进行优化的可能性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23253 2026-05-19 cs.AI 57%

AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture

AgroCoT:用于评估农业中视觉语言模型推理能力的推理链基准

Yibin Wen, Qingmei Li, Zi Ye, Jiarui Zhang, Xiaoya Fan, Zurong Mai, Jing Wu, Shuohong Lou, Yuhang Chen, Henglian Huang, Yang Zhang, Defeng Gu, Lingyuan Zhao, Yutong Lu, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Southwest University(西南大学) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AgroCoT基准,通过整合推理链(CoT)方法,评估视觉语言模型在农业复杂场景中的推理和问题解决能力,发现现有模型在推理能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17356 2026-05-19 cs.CV 57%

UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings

UniPPTBench: 一种统一的演示生成基准,适用于多样化的输入设置

Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UniPPTBench,一个统一的演示生成基准,针对四种代表性的输入设置:模糊提示、长文档、多模态文档和多源生成,同时引入UniPPTEval评估协议,结合跨设置比较的共享指标和针对每个设置核心需求的定制指标,以提供更准确的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17262 2026-05-19 cs.CV 57%

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11149 2026-05-19 cs.CV 57%

A Comprehensive Survey of Action Quality Assessment: Method and Benchmark

动作质量评估的全面综述:方法与基准

Kanglei Zhou, Ruizhi Cai, Liyuan Wang, Hubert P. H. Shum, Xiaohui Liang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了动作质量评估的最新进展,提出模态驱动的分层分类体系,建立统一基准,分析方法演变和研究趋势,探讨当前挑战与未来方向。

Comments Published in Pattern Recognition. Project page and benchmark resources are available online

Journal ref Pattern Recognition, 2026, Article 113933

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16602 2026-05-19 cs.HC cs.AI 57%

Why Modeling Human Haptic Material Perception with AI Is Difficult

为何用AI建模人类触觉材料感知是困难的

Yasemin Vardar

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了用AI建模人类触觉材料感知的挑战,指出数据稀缺、评估平台缺乏和模型局限性是主要瓶颈,强调跨学科合作的重要性。

Comments 5 pages, 1 figure, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18074 2026-05-19 cs.RO 50%

4DLidarOpen: An Open 4D FMCW Lidar Dataset for Motion-Aware Autonomous Driving

4DLidarOpen: 一个用于运动感知自动驾驶的开放4D FMCW激光雷达数据集

Kane Qian, Xin Zhao, Yining Shi, Rujun Yan, Zhengqing Pan, Kaojin Zhu, Mengmeng Yang, Kai Sun, Diange Yang, Kun Jiang

机构 * Tsinghua University(清华大学) Hesai Technology Co., Ltd.(海思科技有限公司)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出4DLidarOpen数据集,用于自动驾驶,该数据集基于4D频率调制连续波(FMCW)激光雷达传感,包含点径向速度测量、多种激光雷达、环绕摄像头和6自由度车辆姿态数据,通过混合标注策略实现大规模训练和人工精修,用于3D目标检测、鸟瞰图分割和流预测及运动预测基准测试。

Comments 15pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17792 2026-05-19 cs.LG physics.geo-ph 50%

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

HydroAgent: 通过模拟器引导的强化学习缩小前沿大语言模型与人类专家在水文模型校准之间的差距

Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong

机构 * Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系) Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系) Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系) Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文研究如何利用前沿大语言模型(LLM)代理替代人类水文模型师进行水文模型校准,提出HydroAgent方法,通过模拟器引导的强化学习(RLSF)进行微调,以提高模型在不同流域中的适应性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16665 2026-05-19 cs.LG physics.geo-ph 50%

In-context learning enables continental-scale subsurface temperature prediction from sparse local observations

上下文学习使稀疏本地观测能够预测大陆尺度的地下温度

Daniel O'Malley, Christopher W. Johnson, Javier E. Santos, Pablo Lara, Sandro Malusà, Bharat Srikishan, John Kath, Arnab Mazumder, Mohamed Mehana, David Coblentz, Nathan DeBardeleben, Earl Lawrence, Hari Viswanathan

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出In-Context Earth模型,利用稀疏钻孔观测预测连续温度场,优于现有方法,且能适应不同地区,具有高准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07098 2026-05-19 cs.LG physics.comp-ph 50%

CarCrashNet: A Large-Scale Dataset and Hierarchical Neural Solver for Data-Driven Structural Crash Simulation

CarCrashNet:一个大规模数据集和分层神经求解器用于数据驱动的结构碰撞仿真

Mohamed Elrefaie, Dule Shu, Matthew Klenk, Faez Ahmed

机构 * MIT(麻省理工学院) Toyota Research Institute(丰田研究院) Future Product Innovation(未来产品创新)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出CarCrashNet数据集和分层神经求解器,用于数据驱动的结构碰撞仿真,包含14000多个碰撞模拟和825辆整车碰撞模拟,通过开源求解器验证并评估了基于机器学习的求解器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02406 2026-05-19 cs.CY 50%

Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics

基于社区指导的评估文化文物AI生成图像

Nari Johnson, Deepthi Sudharsan, Hamna, Samantha Dalal, Theo Holroyd, Anja Thieme, Hoda Heidari, Daniela Massiceti, Jennifer Wortman Vaughan, Cecily Morrison

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文通过三个社区案例研究,探讨如何将社区经验融入AI生成图像的文化适当性评估体系,提出基于多模态LLM的自动化测量方法及挑战。

Comments Published at ACM FAccT 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏