arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-05 至 2026-06-05 共收录 383 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 96 篇

2603.07294 2026-06-05 cs.CV cs.AI 81%

MAviS: A Multimodal Conversational Assistant For Avian Species

MAviS:一种用于鸟类物种的多模态对话助手

Yevheniia Kryklyvets, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jinxing Zhou, Fahad Shabzan Khan, Rao Anwer, Salman Khan, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出MAviS数据集和MAviS-Chat模型,通过整合图像、音频和文本信息,提升对鸟类物种的细粒度理解与多模态问答能力,并展示了在生态应用中领域适应的多模态大语言模型的重要性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05553 2026-06-05 cs.CL cs.AI 81%

ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?

ArcANE:角色扮演语言代理是否在正确的时间保持角色?

Woojung Song, Nalim Kim, Sangjun Song, Chaewon Heo, Jongwon Lim, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 提出ArcANE基准,通过角色弧将叙事分段,评估角色扮演语言代理在不同阶段是否与角色心理轨迹一致,实验表明基于角色弧的上下文策略最优,尤其在源文本外场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06301 2026-06-05 cs.SE 80%

More than a Judge: An Empirical Study of Agent-Human Interaction in Crowdsourced Testing Assessment

不仅仅是评判者:众包测试评估中智能体与人类交互的实证研究

Yue Wang, Yuan Zhao, Shengcheng Yu, Zhenyu Chen, Qing Gu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 通过受控实验研究基于LLM的多智能体评估系统生成的反馈能否提升众包测试者修改报告、后续任务表现及跨应用迁移能力。

Comments Accepted manuscript to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30819 2026-06-05 cs.CV cs.GR 80%

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

Function2Scene: 基于功能规范的3D室内场景布局

Ruiqi Wang, Qimin Chen, Daniel Ritchie, Angel X. Chang, Manolis Savva, Kai Wang, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) Brown University(布朗大学)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出Function2Scene框架,通过解析自然语言设计简报中的用户角色和活动,从17个功能约束准则生成布局,并利用LLM和VLM的迭代检查-修复循环优化,在30个专业案例中94.3%的成对比较优于基线方法。

Comments project page: https://function2scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06285 2026-06-05 cs.AI 79%

TRACE: A Temporal Conditional Estimation for Multimodal Time Series Foundation Models

TRACE: 面向多模态时间序列基础模型的时间条件估计

Ziwen Kan, Yishuo Chen, Kecheng Li, Andrew Wen, Xiaomeng Wang, Liwei Wang, Jihao Duan, Song Wang, Hongfang Liu, Tianlong Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 提出TRACE条件估计范式,通过利用可用辅助模态推断缺失目标模态,解决多模态时间序列中的时间错位和部分模态缺失问题,在医疗和情感分析基准上优于现有融合方法。

Comments 5 figures and 5 tables in the main paper, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05744 2026-06-05 cs.CL 79%

PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models

PlanBench-V: 面向视觉语言模型的空间规划地图基准

Minxin Chen, He Zhu, Junyou Su, Wen Wang, Yijie Deng, Wenjia Zhang

机构 * Behavioral and Spatial AI Lab(行为与空间人工智能实验室) Tongji University(同济大学) Peking University(北京大学) College of Architecture and Urban Planning(建筑与城市规划学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 为评估视觉语言模型在空间规划地图解读中的能力,构建了专家标注数据集SPMD,并提出基于感知、推理、关联、实施四阶段认知框架的基准PlanBench-V,实验表明当前模型在实施类任务上存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21017 2026-06-05 cs.RO cs.AI 79%

Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics

Open-H-Embodiment: 一个大规模数据集,用于在医疗机器人中启用基础模型

Open-H-Embodiment Consortium, :, Nigel Nelson, Juo-Tung Chen, Jesse Haworth, Xinhao Chen, Lukas Zbinden, Dianye Huang, Alaa Eldin Abdelaal, Alberto Arezzo, Ayberk Acar, Farshid Alambeigi, Carlo Alberto Ammirati, Yunke Ao, Pablo David Aranda Rodriguez, Soofiyan Atar, Mattia Ballo, Noah Barnes, Federica Barontini, Filip Binkiewicz, Peter Black, Sebastian Bodenstedt, Leonardo Borgioli, Nikola Budjak, Benjamin Calmé, Fabio Carrillo, Nicola Cavalcanti, Changwei Chen, Haoxin Chen, Sihang Chen, Qihan Chen, Zhongyu Chen, Ziyang Chen, Shing Shin Cheng, Meiqing Cheng, Min Cheng, Zih-Yun Sarah Chiu, Xiangyu Chu, Camilo Correa-Gallego, Giulio Dagnino, Anton Deguet, Jacob Delgado, Jonathan C. DeLong, Kaizhong Deng, Alexander Dimitrakakis, Qingpeng Ding, Hao Ding, Giovanni Distefano, Daniel Donoho, Anqing Duan, Marco Esposito, Shane Farritor, Jad Fayad, Zahi Fayad, Mario Ferradosa, Filippo Filicori, Chelsea Finn, Philipp Fürnstahl, Jiawei Ge, Stamatia Giannarou, Xavier Giralt Ludevid, Frederic Giraud, Aditya Amit Godbole, Ken Goldberg, Antony Goldenberg, Diego Granero Marana, Xiaoqing Guo, Tamás Haidegger, Evan Hailey, Pascal Hansen, Ziyi Hao, Kush Hari, Kengo Hayashi, Jonathon Hawkins, Shelby Haworth, Ortrun Hellig, S. Duke Herrell, Zhouyang Hong, Andrew Howe, Junlei Hu, Zhaoyang Jacopo Hu, Ria Jain, Mohammad Rafiee Javazm, Howard Ji, Rui Ji, Jianmin Ji, Zhongliang Jiang, Dominic Jones, Jeffrey Jopling, Britton Jordan, Ran Ju, Michael Kam, Luoyao Kang, Fausto Kang, Siddhartha Kapuria, Peter Kazanzides, Sonika Kiehler, Ethan Kilmer, Ji Woong Kim, Przemysław Korzeniowski, Chandra Kuchi, Nithesh Kumar, Alan Kuntz, Federico Lavagno, Yu Chung Lee, Hao-Chih Lee, Hang Li, Zhen Li, Xiao Liang, Xinxin Lin, Jinsong Lin, Chang Liu, Fei Liu, Pei Liu, Yun-hui Liu, Wanli Liuchen, Eszter Lukács, Sareena Mann, Miles Mannas, Brett Marinelli, Sabina Martyniak, Francesco Marzola, Lorenzo Mazza, Xueyan Mei, Maria Clara Morais, Luigi Muratore, Chetan Reddy Narayanaswamy, Michał Naskręt, David Navarro-Alarcon, Cyrus Neary, Chi Kit Ng, Christopher Nguan, David Noonan, Ki Hwan Oh, Tom Christian Olesch, Allison M. Okamura, Justin Opfermann, Matteo Pescio, Doan Xuan Viet Pham, Tito Porras, Hongliang Ren, Ariel Rodriguez Jimenez, Ferdinando Rodriguez y Baena, Septimiu E. Salcudean, Asmitha Sathya, Preethi Satish, Lalithkumar Seenivasan, Jiaqi Shao, Yiqing Shen, Yu Sheng, Lucy XiaoYang Shi, Zoe Soulé, Stefanie Speidel, Mingwu Su, Jianhao Su, Idris Sunmola, Kristóf Takács, Yunxi Tang, Patrick Thornycroft, Yu Tian, Jordan Thompson, Mehmet K. Turkcan, Mathias Unberath, Pietro Valdastri, Carlos Vives, Quan Vuong, Martin Wagner, Farong Wang, Wei Wang, Lidian Wang, Chung-Pang Wang, Guankun Wang, Junyi Wang, Erqi Wang, Ziyi Wang, Tanner Watts, Wolfgang Wein, Yimeng Wu, Zijian Wu, Hongjun Wu, Luohong Wu, Jie Ying Wu, Junlin Wu, Victoria Wu, Kaixuan Wu, Mateusz Wójcikowski, Yunye Xiao, Nan Xiao, Wenxuan Xie, Hao Yang, Tianqi Yang, Yinuo Yang, Menglong Ye, Ryan S. Yeung, Nural Yilmaz, Chim Ho Yin, Michael Yip, Rayan Younis, Chenhao Yu, Sayem Nazmuz Zaman, Milos Zefran, Han Zhang, Yuelin Zhang, Yidong Zhang, Yanyong Zhang, Xuyang Zhang, Yameng Zhang, Joyce Zhang, Ning Zhong, Peng Zhou, Haoying Zhou, Xiuli Zuo, Nassir Navab, Mahdi Azizian, Sean D. Huver, Axel Krieger

机构 * Open-H-Embodiment Consortium University of California, Berkeley(加州大学伯克利分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) University of Cambridge(剑桥大学) University of Tokyo(东京大学) University of Tokyo, Graduate School of Information Science and Technology(东京大学信息科学与技术研究生院) University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出Open-H-Embodiment数据集,通过两个基础模型展示了其在医疗机器人领域的应用,展示了大规模开放数据在推动机器人学习和世界建模方面的关键作用。

Comments Project website: https://open-h.github.io/open-h-embodiment/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22768 2026-06-05 cs.CL 79%

Seeing is Believing? Evaluating Vision-Language Model Susceptibility in Agent-to-Agent Multimodal Persuasion

见多识广?评估面向Agent-to-Agent多模态说服的视觉语言模型易受性

Haoyi Qiu, Yilun Zhou, Pranav Narayanan Venkit, Kung-Hsiang Huang, Jiaxin Zhang, Nanyun Peng, Chien-Sheng Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了在多智能体多模态说服场景中,视觉语言模型对多模态内容的易受性,提出了MMPersuade框架和数据集,通过实验揭示了多模态输入在说服中的优势,以及说服对象的领域和格式依赖性,以及心理策略在不同上下文和模型架构下的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06212 2026-06-05 cs.AI 77%

Evaluating Agentic Configuration Repair for Computer Networks

评估计算机网络中的代理配置修复

Rufat Asadli, Benjamin Hoffman, Ioannis Protogeros, Laurent Vanbever

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich(电子工程,苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过结合形式化网络验证和上下文检索工具,评估了开源和闭源大语言模型在代理架构下的配置修复能力,发现代理架构在修复效果和安全性上分别平均提升12%和17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05658 2026-06-05 cs.IR cs.AI 77%

Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

Agent编排的自适应RAG:结构化与多跳检索的比较研究

Anuj Maharjan, Devinder Kaur, Richard Molyet

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05104 2026-06-05 cs.AI 77%

Knowledge Index of Noah's Ark

诺亚方舟的知识索引

Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang

机构 * M-A-P Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) Waseda University(早稻田大学) The University of Tokyo(东京大学) Massachusetts Institute of Technology(麻省理工学院) University of Arizona(亚利桑那大学) Northwestern University(西北大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对LLM知识基准的代表性、注释质量和排名稳定性问题,提出KINA基准,通过贪婪近似实现学科代表性,并证明奖金锦标赛机制优于固定支付,实验显示顶级模型性能远未饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28579 2026-06-05 cs.AI 77%

MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation

MUSE: 面向可制造、功能性和可装配的文本到CAD生成的基准测试

Xiaoyu Dong, Zhi Li, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Curvature Flow Co., Limited(曲率流有限公司)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MUSE基准,通过三阶段评估协议(代码检查、几何检查、设计意图对齐)和基于规则的语言模型评判,衡量文本到CAD生成模型在功能、制造和装配方面的实际设计质量。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05415 2026-06-05 cs.CL cs.AI cs.LG 75%

Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval

可执行模式合约:从自动摄入到多源检索

Padmaja Jonnalagedda, Yuguang Yao, Xiang Gao, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种自动从多源数据中发现可执行模式并将其作为共享合约的系统,通过模式约束的检索路由和结构化分析提升多源问答性能。

Comments 9 pages, 4 figures, plus supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07709 2026-06-05 cs.AI cs.CL cs.CY cs.LG 75%

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures

IatroBench: AI安全措施中意外伤害的预注册证据

David Gringras

机构 * Harvard T.H. Chan School of Public Health(哈佛大学T.H. 洪学校公共卫生学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过IatroBench评估了AI安全措施在医疗决策中的意外伤害风险,发现不同模型在身份相关性上的隐瞒行为存在显著差异,尤其在高度安全训练的模型中表现更明显。

Comments 30 pages, 3 figures, 11 tables. Pre-registered on OSF (DOI: 10.17605/OSF.IO/G6VMZ). Code and data: https://github.com/davidgringras/iatrobench. v2: Fix bibliography entries (add arXiv IDs, published venues); correct p-value typo in Limitations section; add AI Assistance Statement v3: Correct Figure 1 (decoupling scatter accidentally reverted to earlier draft in v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05661 2026-06-05 cs.AI cs.CL 73%

Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments

持续学习基准:评估现实世界有状态环境中的前沿AI系统

Parth Asawa, Christopher M. Glaze, Gabriel Orlanski, Ramya Ramakrishnan, Benji Xu, Asim Biswal, Vincent Sunn Chen, Frederic Sala, Matei Zaharia, Joseph E. Gonzalez

机构 * UC Berkeley(伯克利大学) Snorkel AI University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个专家验证的持续学习基准CL-Bench,涵盖六个领域,通过增益指标隔离在线学习能力,发现现有系统存在过拟合和知识复用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31278 2026-06-05 cs.AI cs.LG stat.ME 73%

Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation

工业化预测驱动推断:用于可靠生成式AI与智能体系统评估的GLIDE库

Grégoire Martinon, Ibrahim Merad, Mohammed Raki

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出GLIDE开源库,统一多种预测驱动推断方法,提供无偏估计与有效置信区间,显著降低人工标注成本。

Comments 8 pages, Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25240 2026-06-05 cs.CL cs.AI cs.CY 73%

JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

JudgmentBench: 比较评分量规与偏好评估在质量评价中的应用

Russell Yang, Ruishi Chen, Pierce Kelaita, Riya Ranjan, Sibo Ma, Charles Dickens, Matthew Guillod, Megan Ma, Julian Nyarko

机构 * Stanford University(斯坦福大学) Snorkel AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过构建包含30个真实法律任务、1539个评分量规和1530对偏好判断的数据集JudgmentBench,比较了评分量规与成对比较两种评估方法,发现成对比较在恢复预期质量排序上显著优于评分量规(平均斯皮尔曼等级相关系数0.908 vs 0.150),且注释时间减少一半以上。

Comments 37 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05056 2026-06-05 cs.CR cs.CL cs.LG 73%

Grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

Heajun An, Connor Ng, Sandesh Sharma Dulal, Junghwan Kim, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文研究了AI生成的安全解释中语义对齐的问题,通过VEXA测试平台验证了词汇基础与语义风险对齐之间的差距,发现即使解释在词汇上显得合理,其语义解释可能削弱检测器的意图风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05026 2026-06-05 cs.CL cs.LG 73%

Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding

多模态用户界面/用户体验设计理解的基准测试:MLLMs能否捕捉界面如何引导用户行为?

Jaehyun Jeon, Min Soo Kim, Jang Han Yoon, Sumin Shim, Yejin Choi, Hanbin Kim, Dae Hyun Kim, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NC AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出WiserUI-Bench基准测试,用于评估多模态UI/UX设计对用户行为的影响,通过300对真实世界UI图像对和专家解读,发现MLLMs在理解UI/UX设计行为影响方面存在局限。

Comments ACL 2026 Main. Our code and dataset: https://github.com/jeochris/wiserui-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10020 2026-06-05 cs.CL cs.AI cs.CV 73%

The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?

性能提升的幻象:为何对比解码无法减轻多模态大语言模型中的对象幻觉?

Hao Yin, Guangzong Si, Zilei Wang

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了对比解码方法在减轻多模态大语言模型(MLLMs)中对象幻觉方面的有效性,发现其性能提升主要源于两个误导性因素,挑战了对比解码策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06462 2026-06-05 cs.AI 70%

Benchmark Everything Everywhere All at Once

无处不在的基准测试

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) CPII under InnoHK(创新香港 CPII) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Shandong University(山东大学) Huawei Technologies(华为技术)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。

Comments Project page: https://benchmarkagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06390 2026-06-05 cs.CV cs.AI 70%

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes

HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景

Wenbo Li, Xiaoliang Ju, Zipeng Qin, Rongyao Fang, Hongsheng Li

机构 * Ace Robotics(Ace机器人公司) CUHK MMLab(香港大学多模态实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06047 2026-06-05 cs.CL 70%

Automatic Labelling of Speech Translation Errors

语音翻译错误的自动标注

Dominik Macháček, Maike Züfle, Ondrej Klejch

机构 * Charles University(查尔斯大学) University of Edinburgh(爱丁堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对语音翻译缺乏置信度评估方法的问题,提出STEL标注协议,通过文本和多模态系统分析,发现直接语音处理对任务必要且与文本系统互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05985 2026-06-05 cs.CL cs.CY 70%

Beyond Alignment: Value Diversity as a Collective Property in Multicultural Agent Systems

超越对齐:多元文化智能体系统中的价值多样性作为集体属性

Shaoyang Xu, Jingshen Zhang, Long P. Hoang, Jinyuan Li, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多元文化多智能体系统,提出以价值多样性作为系统级评估轴,通过文化条件化智能体在共享价值调查中的响应差异度量,发现多样性几乎与对齐无关,且当前系统远低于人类社会,混合骨干系统缩小但未消除差距,社会互动进一步侵蚀多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05920 2026-06-05 cs.SE cs.CL 70%

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

Asuka-Bench: 针对未明确用户意图与多轮优化的代码智能体基准测试

Xin Wang, Liangtai Sun, Yaoming Zhu, Shuang Zhou, Jiaxing Liu, Fengjiao Chen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Licheng Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Independent researchers(独立研究人员)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Asuka-Bench基准,通过未明确用户意图与多轮优化闭环评估代码智能体,包含50个网页任务和784个评估标准,揭示模型间显著性能差异。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05566 2026-06-05 cs.AI cs.CR 70%

GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

GuardNet: 用于鲁棒提示注入和越狱检测的浅层神经网络集成策略

Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

机构 * Quickium Technology Ltd.(Quickium技术有限公司) Federal University of São Carlos (UFSCar)(萨尔瓦多·卡罗斯联邦大学) Federal Institute of Education, Science and Technology of São Paulo (IFSP)(圣保罗教育、科学和技术联邦研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GuardNet,一种基于浅层神经网络(BiLSTM)集成的护栏系统,通过多样性示例覆盖和阈值校准实现对抗鲁棒性,在低延迟下达到与轻量检测器竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05241 2026-06-05 cs.CR cs.AI 70%

Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation

深度研究代理中的搜索时污染:衡量公开基准评估中的性能膨胀

Yongjie Wang, Xinyue Zhang, Kunhong Yao, Zhiwei Zeng, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里-NTU全球可持续性科技公司实验室(ANGEL)) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究深度研究代理在推理过程中通过网页搜索检索公开基准元数据、问题上下文甚至真实答案导致的搜索时污染(STC),定义三种污染类型并开发检测算法,实验表明STC可导致性能膨胀高达4%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05187 2026-06-05 cs.CY cs.AI 70%

Geographic Bias and Diversity in AI Evaluation

AI评估中的地理偏见与多样性

Zilong Liu, Krzysztof Janowicz, Gengchen Mai, Song Gao, Rui Zhu

机构 * University of Vienna(维也纳大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Bristol(布里斯托大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 通过文献综述,识别AI中从训练数据到生成输出的多种地理偏见,并展示近期研究如何通过评估生成AI在不同认知层次、参数设置和输出模态下的地理多样性来应对这些偏见。

Comments Book chapter accepted by "Geography According to ChatGPT"

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12376 2026-06-05 cs.AI 70%

ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows

ProfiliTable: 通过代理工作流实现基于轮廓的表格数据处理

Wei Liu, Yang Gu, Xi Yan, Zihan Nan, Beicheng Xu, Keyao Ding, Bin Cui, Wentao Zhang

机构 * School of CS & Key Lab of High Confidence Software Technologies (MOE), Peking University(计算机科学学院及高可信软件技术重点实验室(教育部),北京大学) Academy for Advanced Interdisciplinary Studies, Peking University(先进跨学科研究学院,北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of CS & Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(计算机科学学院及北京软件与硬件协同人工智能系统重点实验室,北京大学) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出ProfiliTable,一种基于动态轮廓的代理工作流框架,用于解决表格数据处理中的模糊指令、复杂任务结构和缺乏结构化反馈问题,通过交互探索、知识增强合成和反馈驱动细化,实现闭环优化,实验表明其在复杂多步骤场景中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11974 2026-06-05 cs.CR cs.AI 70%

CTIConnect: A Benchmark for Retrieval-Augmented LLMs over Heterogeneous Cyber Threat Intelligence

CTIConnect:一种用于异构网络威胁情报的检索增强大语言模型基准

Yutong Cheng, Yang Liu, Changze Li, Dawn Song, Peng Gao

机构 * Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系) University of California, Berkeley Department of Computer Science(加州大学伯克利分校计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CTIConnect基准,用于评估检索增强型大语言模型在网络威胁情报任务中的表现,通过整合五个异构数据源构建了1860个专家验证的问答对,揭示了不同任务类别中跨源语义差距的差异以及检索策略和性能瓶颈的变化,展示了领域特定策略在提升性能上的优势。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏