arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2606.23927 2026-06-24 cs.AI 新提交 81%

RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems

RIFT-Bench:面向智能体AI系统的动态红队测试

Yarin Yerushalmi Levi, Roy Betser, Amit Giloni, Lidor Erez, Itay Gershon, Oren Rachmil, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究院) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人研究有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RIFT-Bench,一种基于图表示的动态红队测试方法,用于统一评估异构智能体AI系统的安全性,通过自动发现系统结构并部署自适应对抗攻击。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-06-24 cs.LG 新提交 81%

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26144 2026-06-24 cs.SE cs.AI cs.CV 版本更新 81%

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

VISTA:面向视觉规格到网页应用编码智能体的端到端基准

JunJia Guo, Yuhang Yao, Jiawei, Zhou, Jingdi Chen

机构 * University of Arizona(亚利桑那大学) Zoom Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。

Comments Project page: https://kaboider.github.io/VIS_APP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 81%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22597 2026-06-24 cs.CV 新提交 78%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04764 2026-06-24 cs.CV 版本更新 78%

Do Foundation Models See Biology? Evaluating Attention Coherence with Spatial Transcriptomics in Glioblastoma

基础模型是否理解生物学?利用空间转录组学评估胶质母细胞瘤中的注意力一致性

Dilakshan Srikanthan, Amoon Jamzad, Paul Wilson, Nooshin Maghsoodi, Robert Policelli, Gabor Fichtinger, John F. Rudan, Parvin Mousavi

机构 * Translational Medicine, School of Medicine, Queen’s University, Kingston, ON, Canada(转化医学、医学院、皇后大学、金斯顿,ON,加拿大) School of Computing, Queen’s University, Kingston, ON, Canada(计算学院、皇后大学、金斯顿,ON,加拿大) Department of Surgery, Queen’s University, Kingston, ON, Canada(外科部门、皇后大学、金斯顿,ON,加拿大)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出基于空间转录组学的框架,客观评估病理基础模型注意力图与生物学的一致性,发现注意力捕捉多基因转录程序而非单个分子事件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09054 2026-06-24 cs.SD cs.MM 版本更新 78%

HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation

HAFM:用于音乐伴奏生成的分层自回归基础模型

Jian Zhu, Jianwei Cui, Yunlong Xue, Shihao Chen, Yubang Zhang, Cheng Luo, Jun Sun

机构 * Zhejiang Lab(浙江实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang International Studies University(浙江国际 Studies 大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。

Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24259 2026-06-24 cs.CL cs.AI 新提交 73%

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估

Noor Islam S. Mohammad, Ulug Bayazit

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。

Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17698 2026-06-24 cs.AI cs.CL 新提交 73%

EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent

EComAgentBench:在分布式隐藏意图的长时任务上基准测试购物代理

Zeyao Du, Tong Li, Yanci Zhang, Haibo Zhang

机构 * Shopee

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出EComAgentBench基准,包含662个基于真实亚马逊产品的任务,要求代理在100次工具调用内从可见查询、工具门控配置文件和脚本化澄清中挖掘隐藏意图,验证候选产品并提交最终选择,通过类型化源标签评分归因失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 70%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24714 2026-06-24 cs.CL cs.SD eess.AS 新提交 70%

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

CN-NewsTTS Bench:面向原始输入中文新闻TTS发音的目标级自动基准

Shijun Luo

机构 * NetEase Cloud Music(网易云音乐)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对中文新闻TTS对密集书面形式(如分数、连字符型号等)发音不准的问题,提出CN-NewsTTS Bench v0.1基准,包含自动评估集和评分器,测试七个商业系统,最佳准确率0.879。

Comments 5 pages, 1 figure, 8 tables. ICASSP-style preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24387 2026-06-24 cs.CL 新提交 70%

AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

AutoSpecNER: 用于车辆规格提取的细粒度命名实体识别数据集

Jordan Lee, Filippos Ventirozos, Abdirahman Abdullahm, Ioanna Nteka, Peter Appleby, Matthew Shardlow

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学系) Autotrader Research Group, Autotrader UK(英国Autotrader研究组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AutoSpecNER数据集,包含659条汽车广告和15类超过1万个实体,基于DeBERTa的模型达到90%微平均F1分数,优于规则方法和大型语言模型。

Comments 13 pages, 2 figures, 7 tables, Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24066 2026-06-24 cs.SD cs.CL eess.AS 新提交 70%

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho, Phuong Tuan Dat, Thi Thu Trang Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。

Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23877 2026-06-24 cs.SE cs.AI 新提交 70%

JupOtter: Cell-Level Bug Detection in Jupyter Notebooks

JupOtter: Jupyter Notebooks中的单元级错误检测

Lukas Ottenhof, Thibaud Lutellier

机构 * University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JupOtter系统,通过保留单元结构的标记化策略和单元级错误预测技术,在三个评估数据集中的两个上超越静态分析器和大型语言模型,实现高F1分数的单元级错误检测。

Comments Accepted at the 42nd International Conference on Software Maintenance and Evolution - ICSME 2026 (Research Papers Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09768 2026-06-24 cs.MA 69%

SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

SAGE: 可扩展的代理基于地面评估用于作物疾病诊断

Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen, Dinakaran Elango, Shivani Chiranjeevi, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Arti Singh, Soumik Sarkar

专题命中 评测与基准 :foundation model(abstract,journal_ref);language model(abstract)

AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。

Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24883 2026-06-24 cs.CV 新提交 67%

BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases

BenchX: 基于人口统计和协议偏差的癌症检测与定位AI模型基准测试

Qi Chen, Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Ibrahim Ethem Hamamci, Sezgin Er, Ashwin Kumar, Yiwen Ye, Yuhan Wang, Yuyin Zhou, Akshay S. Chaudhari, Curtis Langlotz, Kang Wang, Yang Yang, Alan L. Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) German Cancer Research Center(德国癌症研究中心) University Hospital Basel(巴塞尔大学医院) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院AI中心) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Stanford University(斯坦福大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Nanyang Technological University(南洋理工大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, San Francisco(加州大学旧金山分校) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出BenchX基准,通过85,355次CT扫描系统评估12个肿瘤检测AI模型在肿瘤大小、位置、患者亚组和成像协议上的表现,揭示模型在罕见亚组中性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24446 2026-06-24 cs.SE 新提交 67%

Agentic Generation of AST Transformation Rules for Fixing Breaking Updates

用于修复破坏性更新的AST转换规则的智能体生成

Frank Reyes, Benoit Baudry, Martin Monperrus

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出BigBag框架,通过智能体生成可复用的API级AST转换规则,修复依赖更新导致的编译错误,在BUMP基准上实现78.6%的修复率和跨项目33.3%的修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24058 2026-06-24 cs.CV 新提交 67%

VisChronos: Revolutionizing Image Captioning Through Real-Life Events

VisChronos: 通过真实事件革新图像描述生成

Phuc-Tan Nguyen, Hieu Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出VisChronos框架,利用大语言模型和密集描述模型从单张图像识别并描述真实事件,构建EventCap数据集,提升描述生成的上下文相关性和事件聚焦能力。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05896 2026-06-24 cs.CV 版本更新 67%

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

共鸣心智:具备心智理论的闭环社交虚拟人

Jianxu Shangguan, Jing Xu, Hang Ye, Xiaoxuan Ma, Yizhou Wang, Jenq-Neng Hwang, Wentao Zhu

机构 * University of Washington(华盛顿大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Eastern Institute of Technology, Ningbo(宁波工程技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出一个闭环双智能体框架,通过整合感知、社会推理(基于心智理论)和多模态生成,实现具备社交智能的虚拟人,并在信息不对称数据集上取得优于全信息脚本模式的对话质量。

Comments Project page: https://resonantminds.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18582 2026-06-24 cs.NI 版本更新 67%

Wireless Copilot: An AI-Powered Partner for Navigating Next-Generation Wireless Complexity

无线副驾驶:一个AI驱动的合作伙伴,用于驾驭下一代无线复杂性

Haoxiang Luo, Ruichen Zhang, Yinqiu Liu, Gang Sun, Hongfang Yu, Dong In Kim

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出“无线副驾驶”框架,通过集成大语言模型与认知架构,将人类意图转化为精确的网络操作,以管理6G的复杂性,并在低空无线网络中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18684 2026-06-24 cs.CR cs.AI cs.CL cs.LG cs.SY eess.SY 版本更新 67%

FALCON: Transforming Cyber Threat Intelligence into Deployable IDS Rules with Self-Reflection

FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则

Shaswata Mitra, Subash Neupane, Martin Duclos, Sudip Mittal, Aritran Piplai, Md Rayhanur Rahman, Edward Zieglar, Shahram Rahimi

机构 * Meharry Medical College(梅哈里医学院) The University of Texas at El Paso(德克萨斯理工大学) The University of Alabama(阿拉巴马大学) National Security Agency(国家安全局)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FALCON框架,通过新颖的CTI-规则语义评分器实现规则检索、生成和验证,解决签名型入侵检测系统中规则创建的手动瓶颈和验证难题,在Snort和YARA平台上达到0.72平均相关性。

Comments 17 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02800 2026-06-24 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 62%

Cosmos 3: Omnimodal World Models for Physical AI

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA, :, Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang, Michael Huang, Sophia Huang, Yufan Huang, Jacob Huffman, DeLesley Hutchins, Suneel Indupuru, Boris Ivanovic, Arihant Jain, Joel Jang, Ryan Ji, Yanan Jian, Dongfu Jiang, Jingyi Jin, Atharva Joshi, Nikhilesh Joshi, Pranjali Joshi, Andy Ju, Jaehun Jung, Weiwei Kang, Scott Kassekert, Jan Kautz, Ashna Khetan, Julia Kiczka, Slawek Kierat, Gwanghyun Kim, Kuno Kim, Sunny Kim, Kezhi Kong, Xin Kong, Zhifeng Kong, Tomasz Kornuta, Egor Krivov, Hui Kuang, Saurav Kumar, Chia-Wen Kuo, George Kurian, Wojciech Kutak, JF Lafleche, Himangshu Lahkar, Omar Laymoun, Jayjun Lee, Sanggil Lee, Gabriele Leone, Boyi Li, Freya Li, Jiajun Li, Jinfeng Li, Ling Li, Pengcheng Li, Shangru Li, Tingle Li, Xiaolong Li, Xuan Li, Zhaoshuo Li, Zhiqi Li, Hao Liang, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Ming-Yu Liu, Sifei Liu, Zihan Liu, Hai Loc Lu, Xiangyu Lu, Alice Luo, Ruipu Luo, Wenjie Luo, Jiangran Lyu, Martin Ding Ma, Nic Ma, Qianli Ma, Dawid Majchrowski, Louis Marcoux, Miguel Martin, Qing Miao, Ashkan Mirzaei, Shreyas Misra, Kaichun Mo, Durra Mohsin, Hyejin Moon, Pawel Morkisz, Saeid Motiian, Kirill Motkov, Seungjun Nah, Yashraj Narang, Deepak Narayanan, Thabang Ngazimbi, Julian Ouyang, Shubham Pachori, David Page, Yatian Pang, Sehwi Park, Mahesh Patekar, Mostofa Patwary, Marco Pavone, Trung Pham, Wei Ping, Soha Pouya, Shrimai Prabhumoye, Varun Praveen, Delin Qu, Hesam Rabeti, Morteza Ramezanali, Marilyn Reeb, Xuanchi Ren, Kristen Rumley, Wojciech Rymer, Jun Saito, Yeongho Seol, John Shao, Piyush Shekdar, Tianwei Shen, Humphrey Shi, Min Shi, Stella Shi, Kevin Shih, Mohammad Shoeybi, Mateusz Sieniawski, Shuran Song, Alexander Sotelo, Amir Sotoodeh, Sunil Srinivasa, Vignesh Srinivasakumar, Bartosz Stefaniak, Rahul Heinrich Steiger, Shangkun Sun, Jiaxiang Tang, Shitao Tang, Yangyang Tang, Yue Tang, Tolou Tavakkoli, Kayley Ting, Krzysztof Tomala, Wei-Cheng Tseng, Jibin Varghese, Sergei Vasilev, Thomas Volk, Raju Wagwani, Roger Waleffe, Andrew Z. Wang, Boxiang Wang, Haoxiang Wang, Qiao Wang, Shihao Wang, Shijie Wang, Ting-Chun Wang, Yan Wang, Yu Wang, Rohit Watve, David Wehr, Fangyin Wei, Xinshuo Weng, Jay Zhangjie Wu, Kedi Wu, Hongchi Xia, Summer Xiao, Tianjun Xiao, Kevin Xie, Daguang Xu, Jiashu Xu, Mengyao Xu, Ruqing Xu, Xingqian Xu, Yao Xu, Dinghao Yang, Dong Yang, Hans Yang, Xiaodong Yang, Xuning Yang, Yichu Yang, Yurong You, Zhiding Yu, Hao Yuan, Simon Yuen, Xiaohui Zeng, Pengcuo Zeren, Cindy Zha, Haotian Zhang, Jenny Zhang, Jing Zhang, Liangkai Zhang, Paris Zhang, Shun Zhang, Xuanmeng Zhang, Zhizheng Zhang, Ann Zhao, Yilin Zhao, Yuliya Zhautouskaya, Charles Zhou, Fengzhe Zhou, Shilin Zhu, Yuke Zhu, Dima Zhylko, Artur Zolkowski

机构 * NVIDIA

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于统一混合Transformer架构的全模态世界模型Cosmos 3,联合处理语言、图像、视频、音频和动作序列,在理解和生成任务上达到新最优,为具身智能体提供可扩展的通用骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19957 2026-06-24 cs.CV cs.AI cs.LG 版本更新 62%

HiPath: Hierarchical Vision-Language Alignment for Structured Pathology Report Prediction

HiPath: 用于结构化病理报告预测的分层视觉-语言对齐

Ruicheng Yuan, Zhenxuan Zhang, Anbang Wang, Liwei Hu, Xiangqian Hua, Yaya Peng, Jiawei Luo, Guang Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Department of Bioengineering and Imperial-X, Imperial College London(帝国理工学院伦敦校区生物工程系) Department of Pathology, Xiangtan Maternal and Child Health Hospital(湘潭 maternal and child health hospital pathology department) Department of Pathology, The First People’s Hospital of Xiangtan City(湘潭市第一人民医院病理科)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出HiPath框架,通过分层补丁聚合器、对比学习和槽位掩码诊断预测,在冻结UNI2和Qwen3骨干上实现结构化病理报告预测,准确率达68.9%,安全率97.3%。

Comments 10 pages, 1 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11363 2026-06-24 cs.CL cs.AI cs.MA 版本更新 62%

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

CORE-Bench:通过计算可重复性智能体基准提升已发表研究的可信度

Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CORE-Bench基准,包含270个基于90篇论文的任务,评估AI智能体在计算可重复性上的准确性,最佳智能体在最难任务上准确率仅21%,表明自动化科学任务仍有巨大提升空间。

Comments Benchmark harness and code available at http://github.com/siegelz/core-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 57%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24115 2026-06-24 cs.CV cs.AI 新提交 57%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19910 2026-06-24 cs.CL cs.SD eess.AS 新提交 57%

Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal

轻量级发音评估:基于离散语音标记的意外度

Syeda Faiza Ahmed Sara, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Doha, Qatar(卡塔尔计算研究所,多哈,卡塔尔)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出仅使用母语语音资源训练的轻量级发音评估框架,通过离散化语音标记和语言模型计算意外度,结合文本引导对齐特征,在无监督或少量校准下达到接近监督方法的性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21481 2026-06-24 cs.CL 版本更新 57%

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音优先的印度语言国家偏好:面向印度语言TTS的大规模成对评估与偏好分析

Srija Anand, Ashwin Sankar, Ishvinder Sethi, Aaditya Pareek, Kartik Rajput, Gaurav Yadav, Nikhil Narasimhan, Adish Pandya, Deepon Halder, Mohammed Safi Ur Rahman Khan, Praveen S, Shobhit Banga, Mitesh M Khapra

机构 * Indian Institute of Technology, Madras, India(印度理工学院马德拉斯分校) AI4Bharat, India(AI4Bharat) Josh Talks, India(Josh Talks)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本文通过大规模成对评估和分析,探讨印度语言TTS系统在多语言环境下的偏好,结合语言控制与感知注解,评估7种先进系统,揭示人类偏好与模型性能的多维关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交 50%

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏