arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-26 至 2026-03-26 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2603.24132 2026-03-26 cs.CL cs.AI cs.LG 80%

MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare

MedAidDialog: 一个多语言多轮医疗对话数据集用于可及性医疗

Shubham Kumar Nigam, Suparnojit Sarkar, Piyush Patel

机构 * University of Birmingham(布里斯托尔大学) Heritage Institute of Technology(遗产理工学院) Madan Mohan Malaviya University of Technology(马丹·莫汉·马尔维亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedAidDialog数据集,用于模拟真实医患对话,通过生成合成对话扩展MDDial数据集,并开发MedAidLM模型以实现多轮对话和诊断推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23539 2026-03-26 cs.AI cs.CL cs.LG nlin.AO 80%

PLDR-LLMs Reason At Self-Organized Criticality

PLDR-LLMs 在自组织临界性中进行推理

Burc Gokden

机构 * Fromthesky Research Labs LLC(Fromthesky研究实验室 LLC)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PLDR-LLMs 在自组织临界状态下展现出推理能力,其推理输出与二级相变特征相似,通过全局统计参数量化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11304 2026-03-26 cs.IR cs.AI cs.CR 79%

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

CryptoAnalystBench: 多工具长文本LLM分析中的失败

Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出CryptoAnalystBench,通过198个加密和DeFi查询评估多工具LLM在复杂输入中的表现,揭示七类高阶错误类型,并提供评估框架和缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21037 2026-03-26 cs.LG 79%

When Brain Foundation Model Meets Cauchy-Schwarz Divergence: A New Framework for Cross-Subject Motor Imagery Decoding

当脑基础模型遇见柯西-施瓦茨散度:一种跨受体运动想象解码的新框架

Jinzhou Wu, Baoping Tang, Qikang Li, Yi Wang, Cheng Li, Shujian Yu

机构 * State Key Laboratory of Mechanical Transmission, College of Mechanical and Vehicle Engineering, Chongqing University(机械传动国家重点实验室,重庆大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种新的多源域适应框架,利用预训练的脑基础模型进行动态源受体选择,并结合柯西-施瓦茨散度实现特征和决策层面对齐,以提高跨受体运动想象解码的准确率。

Comments This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16501 2026-03-26 cs.AI 79%

Learning To Guide Human Decision Makers With Vision-Language Models

通过视觉-语言模型引导人类决策者

Debodeep Banerjee, Stefano Teso, Burcu Sayin, Andrea Passerini

机构 * DI, University of Pisa(比萨大学DI) DISI, University of Trento(特伦托大学DISI) CIMEC, University of Trento(特伦托大学CIMEC) Rajib Pal Bankura Sammilani Medical College(拉吉布·帕尔班克尔医学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出LTG框架,通过视觉-语言模型生成可解释的决策指导,使人类负责最终决策,提升高风险场景下的决策质量与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23848 2026-03-26 cs.CL cs.CY 79%

BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents

BeliefShift:评估LLM代理中时间信念一致性和意见漂移的基准测试

Praveen Kumar Myakala, Manan Agrawal, Rahul Manche

机构 * Independent AI Researcher(独立AI研究员) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 BeliefShift提出一个长期基准测试,评估多会话LLM交互中的信念动态,涵盖时间信念一致性、矛盾检测和证据驱动修正三个赛道,通过2400个标注交互轨迹验证模型在零样本和RAG设置下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24578 2026-03-26 cs.CV eess.IV 78%

Vision-Language Models vs Human: Perceptual Image Quality Assessment

视觉-语言模型与人类:感知图像质量评估

Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan

机构 * School of Engineering, University of Galway(Galway大学工程学院) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文研究视觉语言模型是否能近似人类对图像质量的感知判断,通过对比心理物理数据,发现模型在颜色丰富度上表现优异,但在对比度上表现较差,且模型一致性与人类对齐性存在矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23925 2026-03-26 cs.CV 78%

DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models

DP^2-VL: 通过数据污染保护隐私照片的视觉语言模型隐私威胁模型

Hongyi Miao, Jun Jia, Xincheng Wang, Qianli Ma, Wei Sun, Wangqiu Zhou, Dandan Zhu, Yewen Cao, Zhi Liu, Guangtao Zhai

机构 * Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出DP2-VL框架,通过数据污染保护隐私照片,分析视觉语言模型在身份关联泄露中的脆弱性,并展示其在不同保护比例下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23481 2026-03-26 cs.CL 77%

IDP Accelerator: Agentic Document Intelligence from Extraction to Compliance Validation

IDP加速器:从提取到合规验证的智能文档智能

Md Mofijul Islam, Md Sirajus Salekin, Joe King, Priyashree Roy, Vamsi Thilak Gudi, Spencer Romo, Akhil Nooney, David Kaleko, Boyi Xie, Bob Strahan, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IDP加速器框架,通过DocSplit、可配置提取模块、代理分析模块和规则验证模块实现端到端文档智能,展示在医疗行业达到98%准确率和77%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23972 2026-03-26 cs.CL cs.IR 77%

Grounding Arabic LLMs in the Doha Historical Dictionary: Retrieval-Augmented Understanding of Quran and Hadith

以多哈历史词典为基础 grounding Arabic LLMs:检索增强的古兰经和圣训理解

Somaya Eltanbouly, Samer Rashwani

机构 * College of Islamic Studies, Hamad bin Khalifa University(哈马德·本·哈利法大学伊斯兰学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于多哈历史词典的检索增强生成框架,提升阿拉伯语LLM对历史宗教文本的理解能力,实验表明在Fanar和ALLaM模型上准确率超过85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 77%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21494 2026-03-26 cs.CL cs.MA 77%

Agentic Automation of BT-RADS Scoring: End-to-End Multi-Agent System for Standardized Brain Tumor Follow-up Assessment

脑肿瘤报告与数据系统自动化:端到端多智能体系统用于标准化脑肿瘤随访评估

Mohamed Sobhi Jabal, Jikai Zhang, Dominic LaBella, Jessica L. Houk, Dylan Zhang, Jeffrey D. Rudie, Kirti Magudia, Maciej A. Mazurowski, Evan Calabrese

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种端到端多智能体系统,结合大语言模型和卷积神经网络,用于自动化脑肿瘤BT-RADS评分,提高了与专家标准的一致性和准确性。

Comments 17 pages, 5 figures, 4 tables, 2 supplementary figures, 3 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI 77%

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06615 2026-03-26 cs.SE 75%

Fixturize: Bridging the Fixture Gap in Test Generation

Fixturize:弥合测试生成中的Fixture缺口

Chengyi Wang, Pengyu Xue, Zhen Yang, Xiapu Luo, Yuxuan Zhang, Xiran Lyu, Yifei Pei, Zonghan Jia, Yichen Sun, Linhao Wu, Kunwu Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Fixturize通过主动识别依赖fixture的函数并迭代生成fixture,提升自动化测试套件质量,显著提高测试通过率和覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23884 2026-03-26 cs.GL 75%

POSIM: A Multi-Agent Simulation Framework for Social Media Public Opinion Evolution and Governance

POSIM:一种用于社交媒体公共意见演化与治理的多智能体仿真框架

Yongmao Zhang, Kai Qiao, Zhengyan Wang, Ningning Liang, Dekui Ma, Wenyao Sun, Jian Chen, Bin Yan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 POSIM通过整合大语言模型驱动的智能体与BDI认知架构,模拟社交媒体公共意见的演化与治理,揭示了共情引导可能加剧负面情绪的悖论,为治理策略设计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23698 2026-03-26 cs.SE 75%

Towards Leveraging LLMs to Generate Abstract Penetration Test Cases from Software Architecture

向利用大语言模型生成软件架构的抽象渗透测试用例

Mahdi Jafari, Rahul Sharma, Sami Naim, Christopher Gerking, Ralf Reussner

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型生成抽象渗透测试用例,以支持软件架构层面的安全评估,实验显示生成的用例在实用性和正确性上表现良好。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 75%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11380 2026-03-26 cs.CV 75%

DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding

DriveXQA: 多模态视觉问答用于恶劣驾驶场景理解

Mingzhe Tao, Ruiping Liu, Junwei Zheng, Yufan Chen, Kedi Ying, M. Saquib Sarfraz, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DriveXQA多模态数据集,用于自主驾驶场景中的视觉问答,通过融合多传感器信息提升对异常驾驶场景的理解能力。

Comments Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23521 2026-03-26 cs.CL cs.AI cs.CV 74%

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Chitrakshara:一种用于印度语言的大型多语言多模态数据集

Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 评测与基准 :language model(abstract,comments);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。

Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 73%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14997 2026-03-26 q-fin.RM cs.AI cs.LG 73%

A Comprehensive Survey on Enterprise Financial Risk Analysis from Big Data and LLMs Perspective

面向大数据和大语言模型的企业财务风险分析综述

Huaming Du, Cancan Feng, Yuqian Lei, Chenyang Zhang, Guisong Liu, Gang Kou, Carl Yang, Yu Zhao

机构 * Southwestern University of Finance and Economics(西南财经大学) Chengdu University(成都大学) Universität Hamburg(汉堡大学) The University of Hong Kong(香港大学) Hunan University of Technology and Business(湖南工业大学) Xiangjiang Laboratory(湘江实验室) Emory University(埃默里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从大数据和大语言模型视角综述企业财务风险分析,系统梳理现有方法,总结研究方法与关键发现,指出当前局限并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08720 2026-03-26 cs.CL 70%

How Many Code and Test Cases Are Enough? Evaluating Test Cases Generation from a Binary-Matrix Perspective

生成多少代码和测试用例足够?从二进制矩阵视角评估测试用例生成

Xianzhen Luo, Jinyang Huang, Wenzhen Zheng, Qingfu Zhu, Mingzheng Xu, Yiheng Xu, Yuantao Fan, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从二进制矩阵视角评估测试用例生成,提出TC-Bench基准,通过寻找最优诊断基来确定最小错误代码和测试用例集,揭示现有方法在诊断能力上的不足。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 70%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24073 2026-03-26 cs.CL 70%

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

ConceptKT:一种用于知识追踪中概念层面缺陷预测的基准

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ConceptKT基准,通过标注问题所需概念和错误响应下的缺失概念,评估大语言模型和推理模型在概念层面缺陷预测中的性能。

Comments Accepted by LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23627 2026-03-26 cs.CV cs.AI 70%

Ukrainian Visual Word Sense Disambiguation Benchmark

乌克兰视觉词义消歧基准

Yurii Laba, Yaryna Mohytych, Ivanna Rohulia, Halyna Kyryleyza, Hanna Dydyk-Meush, Oles Dobosevych, Rostyslav Hryniv

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个评估乌克兰视觉词义消歧任务的基准,通过八种多语言大模型测试,发现乌克兰与英语在该任务上存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20581 2026-03-26 cs.CL 70%

JUBAKU: An Adversarial Benchmark for Exposing Culturally Grounded Stereotypes in Japanese LLMs

JUBAKU:一种对抗性基准,用于揭示日语大语言模型中的文化根植刻板印象

Taihei Shiotani, Masahiro Kaneko, Ayana Niwa, Yuki Maruyama, Daisuke Oba, Masanari Ohi, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院) MBZUAI(马克斯·普朗克人工智能研究所) AIST(日本产业技术综合研究所) NII LLMC(日本信息处理学会大语言模型中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JUBAKU基准,通过手工艺构建对话场景揭示日语LLM中的文化刻板印象,评估九种日语LLM显示明显偏见,人类标注者在识别无偏回答上准确率达91%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24393 2026-03-26 cs.RO 67%

3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models

3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Haishan Liu, Changti Wu, Hang Yuan, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团自动化研究院) ZGCI(中钢集团信息研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 67%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24038 2026-03-26 eess.AS cs.SD 67%

ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding

ACAVCaps:实现大规模训练以实现细粒度和多样化的音频理解

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Junbo Zhang, Jian Luan

机构 * MiLM Plus, Xiaomi Inc, Beijing, China(小米MiLM Plus研究院,北京,中国) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出ACAVCaps数据集,通过多专家流程生成细粒度音频描述,提升音频模型在下游任务中的泛化能力。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13528 2026-03-26 cs.RO cs.CV 67%

Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis

通过反事实失败合成学习可操作的操纵恢复

Dayou Li, Jiuzhou Lei, Hao Wang, Lulin Liu, Yunhao Yang, Zihan Wang, Bangya Liu, Minghui Zheng, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Abaka AI(Abaka人工智能) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 本文提出Dream2Fix框架,通过生成反事实失败场景数据提升机器人故障恢复能力,实现高精度的故障诊断与轨迹修正。

详情

展开后加载摘要…

URL PDF HTML 收藏