arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 121 篇

2605.13743 2026-05-28 cs.LG 77%

GHGbench: A Unified Multi-Entity, Multi-Task Benchmark for Carbon Emission Prediction

GHGbench:一个统一的多实体、多任务碳排放预测基准

Yifan Duan, Siyuan Zheng, Lihuan Li, Chao Xue, Flora Salim

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 提出GHGbench,一个包含公司和建筑层面温室气体排放预测的统一开放数据集与基准,通过多模态数据融合和标准化评估揭示结构化难度与分布外泛化差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12515 2026-05-28 cs.CL 77%

Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation

通过共识驱动的偏好优化缓解多语言大模型中的跨语言文化不一致性

Lucas Resck, Isabelle Augenstein, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出C-3PO框架,通过共识驱动的偏好优化,缓解多语言大模型在用户身份明确时因提示语言变化导致的跨语言文化不一致问题,显著提升一致性指标κ_S。

Comments 24 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27976 2026-05-28 cs.SD 75%

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding

VoiceGiraffe: 极端长上下文音频-语言理解的基准

Jashin Ye, Dongxiao Wang, Yixuan Ye, Sashuai Zhou, Weihuang Lin, Mingyang Han, Kunpeng Wang, Zeyu Yuan, Boyu Li, Haoxiang Shi, Jingchen Shu, Jun Song, Bo Zheng

机构 * Future Living Lab(未来生活实验室) Alibaba(阿里巴巴)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出VoiceGiraffe基准,通过1500个三元组和双层分类法评估大音频语言模型在长上下文场景下的单跳感知与多跳推理能力,揭示模型在长距离记忆持久性上的瓶颈。

Comments Benchmark Project: https://github.com/LivingFutureLab/VoiceGiraffe

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27767 2026-05-28 cs.CL cs.AI cs.LG 75%

UniMaia: Steering Chess Policies with Language for Human-like Play

UniMaia:用语言引导国际象棋策略以实现类人玩法

Sherman Siu, Lesley Istead

机构 * University of Waterloo(滑铁卢大学) Carleton University(卡尔顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出UniMaia框架,通过参数高效文本编码器和ControlNet风格调节机制,在冻结的Lc0国际象棋策略网络上实现提示条件策略调制,实现语义控制(如开局选择和玩家强度)并保持预训练策略表征,同时构建大规模元数据增强的Lichess数据集和半自动提示生成管道,在多个基准上取得最优或竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27494 2026-05-28 cs.CR cs.AI cs.CL cs.IR cs.LG 75%

Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?

基于证据的缓存路由用于检索增强生成:何时可以安全地重用答案?

Syed Huma Shah

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GroundedCache,一种通过四个廉价门控(查询相似性、检索证据重叠、源版本有效性和词汇支持)验证缓存答案安全性的路由方法,显著降低不安全服务率。

Comments 19 pages, 9 figures, 10 tables. Code: https://github.com/syedhumarahim/grounded-cache-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28597 2026-05-28 cs.CR cs.AI cs.LG 73%

Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation

立场:淘汰“正向后门”标签——秘密对齐需要严格且系统的评估

Jianwei Li, Jung-Eun Kim

机构 * Department of Computer Science, North Carolina State University, Raleigh, USA(北卡罗来纳州立大学计算机科学系)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文主张停止使用“正向后门”标签,将触发激活的隐藏行为视为秘密对齐,并通过评估三个代表性应用在六个核心属性上的表现,揭示其脆弱性,呼吁进行严格评估。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28163 2026-05-28 cs.CL cs.AI 73%

DEPART: DEcomposing PARiTy across Multilingual LLMs

DEPART: 跨多语言大模型的性能差异分解

Manan Uppadhyay, Prashant Kodali, Pranjal Chitale, Reshma Ramaprasad, Himanshu Beniwal, Sunayana Sitaram

机构 * Microsoft Research India(微软印度研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出DEPART框架,通过贝叶斯分层模型分解多语言大模型性能差异,发现语言特征解释79%-92%的方差,且模型内部表示与英语的相似性是主要预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27984 2026-05-28 cs.CL cs.AI 73%

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

KVoiceBench, KOpenAudioBench 和 KMMAU:用于评估语音语言模型的智能体驱动的韩语语音基准

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee

机构 * KRAFTON Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对语音语言模型评估中英语中心化的问题,提出两种智能体驱动的基准构建框架,构建并发布了三个韩语语音基准(KVoiceBench、KOpenAudioBench、KMMAU),通过评估八个最新模型揭示了英语-韩语性能差距和不同任务间的互补性弱点。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02702 2026-05-28 cs.AI cs.LG 73%

FinTexTS: Financial Text-Paired Time-Series Dataset via Semantic-Based and Multi-Level Pairing

FinTexTS: 基于语义和多层级配对的金融文本-时间序列数据集

Jaehoon Lee, Suhwan Park, Taeyoon Lim, Seunghan Lee, Jun Seo, Dongwan Kang, Hwanil Choi, Minjae Kim, Sungdong Yoo, Soonyoung Lee, Yongjae Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究所) Ulsan National Institute of Science and Technology(乌山国立科学技术研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于语义和多层级配对的框架,从SEC文件和新闻中提取并匹配多层级文本信息,构建大规模文本配对的股票价格数据集FinTexTS,提升股价预测性能。

Comments 12 pages, KDD 2026, Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06797 2026-05-28 math.OC cs.AI cs.LG stat.ML 73%

Optimal and Diffusion Transports in Machine Learning

机器学习中的最优输运与扩散输运

Gabriel Peyré

机构 * CNRS and ENS PSL Université(法国国家科学研究中心和巴黎 sciences et lettres 高等学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了机器学习中扩散方法和最优输运两种输运方法,它们通过拉格朗日视角设计概率分布演化,应用于采样、神经网络优化和大语言模型动力学建模。

Comments Proc. 2026 International Congress of Mathematicians

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28779 2026-05-28 cs.CL cs.CV 70%

The Abstraction Gap in Vision-Language Causal Reasoning

视觉-语言因果推理中的抽象差距

Chinh Hoang, Mohammad Rashedul Hasan

机构 * Department of Electrical and Computer Engineering, University of Nebraska--Lincoln, Lincoln, Nebraska, USA(电气与计算机工程系,内布拉斯加大学林肯分校,内布拉斯加,林肯,美国)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对视觉-语言模型(VLM)生成因果解释时语言流畅性与忠实因果推理的混淆问题,提出双探针方法和抽象差距(AG)指标,通过CAGE基准评估发现多数模型存在显著AG,但通过预训练和架构选择可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28604 2026-05-28 cs.CV cs.AI 70%

Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification

挖掘多模态时空线索用于视频重要人物识别

Xiao Wang, Minglei Yang, Bin Yang, Wenke Huang, Zheng Wang, Xin Xu, Mang Ye

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室) School of Computer Science, National Engineering Research Center for Multimedia Software, Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机科学学院,国家多媒体软件工程技术研究中心,湖北省多媒体与网络通信工程重点实验室,武汉大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对视频中人物重要性随时间变化的问题,提出VIP-Net框架,通过多模态时空线索融合与时间重要性矫正,在Temporal-VIP数据集上达到67.3%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28533 2026-05-28 cs.LG 70%

Semi-Supervised Hypothesis Testing by Betting on Predictions

基于预测投注的半监督假设检验

Yaniv Tenzer, Elad Tolochinsky, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术Ion – 以色列理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术Ion – 以色列理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种基于预测投注的框架,利用无标签数据增强序贯假设检验的效力,通过引入e统计量实现任意有效的检验,并在标签偏移或概念偏移下保持有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28179 2026-05-28 cs.CL 70%

SuperValid: Capability-Aligned OOD Validation for Generalizable Downstream Scaling

SuperValid: 面向泛化下游扩展的能力对齐OOD验证

Quanen Sun, Changxin Tian, Ke Shi, Cai Chen, Cunyin Peng, Jia Liu, Kunlong Chen, Zhiqiang Zhang

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SuperValid框架,通过从基准测试中提炼核心概念并扩展为多样化的知识丰富文本,合成能力对齐的分布外验证数据,以在能力层面预测下游性能,实现有效的模型选择、早停和扩展决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28148 2026-05-28 cs.SE cs.AI 70%

DeltaMCP: Incremental Regeneration via Spec-Aware Transformation for MCP servers

DeltaMCP: 通过规范感知转换实现MCP服务器的增量再生

Aditya Pujara, Xiaogang Zhu, Hsiang-Ting Chen

机构 * Microsoft(微软) University of Adelaide(阿德莱德大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对企业级API与MCP工具集同步维护的挑战,提出DeltaMCP,一种基于规范感知的增量再生工具,仅更新受影响的MCP服务器工具,实验表明能减少开发者开销并提升可维护性与版本一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28098 2026-05-28 cs.AI 70%

Examining Agents' Bias Amplification versus Suppression in Multi-Agent Systems

审视多智能体系统中智能体的偏见放大与抑制

Zejian Eric Wu, Zhongyi Jiang, Yuan Zhuang, Paul Jen-Hwa Hu

机构 * Oregon State University(俄勒冈州立大学) Independent Researcher(独立研究者) Amazon(亚马逊) University of Utah(犹他大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多智能体系统中个体偏见如何影响系统级公平性,提出FBS指标量化偏见变化,发现均匀暴露偏见时系统偏见甚至超过个体偏见之和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28035 2026-05-28 cs.AI cs.MM cs.SD 70%

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式

Haitian Li, Yanghao Zhou, Heyan Huang, Liangji Chen, YiMing Cheng, Xu Liu, Dian Jin, Jiajun Xu, Jingyun Liao, Tian Lan, Ziqin Zhou, Yueying Liu, Yu Bai, Changsen Yuan, Jinxing Zhou, Xian-Ling Mao, Xuefeng Chen, Yousheng Feng

机构 * Shanghai University(上海大学) Beijing Institute of Technology(北京理工大学) Shanghai Film Academy(上海电影学院) Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) Inkeverse Group Limited(Inkeverse集团有限公司) The University of Adelaide(阿德莱德大学) Beijing University of Technology(北京工业大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenNLP Lab(OpenNLP实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多说话人音视频生成中电影表现力评估不足的问题,提出MTAVG-Bench 2.0基准,通过构建涵盖表演、叙事、氛围和视听语言的高层次失败分类体系及超过1万个问答实例,系统评估全模态大语言模型诊断复杂视听失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28013 2026-05-28 cs.CL 70%

KSAFE-MM: A Multimodal Safety Benchmark via Localized Contextualization for Korean Cultural Risks

KSAFE-MM:通过本地化语境化实现韩国文化风险的多模态安全基准

Yongwoo Kim, Sojung An, Yunjin Park, Jungwon Yoon, Dujin Lee, HyunBeom Cho, Jaewon Lee, Wonhyuk Lee, Youngchol Kim, JeongYeop Kim, Donghyun Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多模态大语言模型在安全评估中缺乏文化特异性问题,提出KSAFE-MM基准,通过语言和视觉语境化构建通用与韩国文化特有的多模态安全测试集,揭示模型对文化攻击的脆弱性及安全性与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28000 2026-05-28 cs.SE cs.AI 70%

Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution

Tool Forge:一种用于受控代理执行的携带验证的工具链

Swanand Rao

机构 * Next Moca Global, Inc.(Next Moca全球公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 Tool Forge,一种将自然语言能力意图转换为经过验证、沙盒验证、编目工具制品,并通过令牌高效路由层暴露给代理的工具链,解决了代理执行中工具层缺乏治理和验证的问题。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/nextmoca/tool-forge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27986 2026-05-28 cs.CL q-bio.QM 70%

An Evolutionary Approach for Designing Stable and Highly Expressible Low-Immunogenicity Therapeutic mRNA Sequences

一种设计稳定、高表达且低免疫原性治疗性mRNA序列的进化方法

Dhawa Sang Dong, Mausam Gurung, Suraj Kandel

机构 * Department of Artificial Intelligence(人工智能系) Department of Electronics and Computer Engineering(电子与计算机工程系) School of Engineering, Kathmandu University(加德满都大学工程学院) Kathmandu Engineering College, Trivubhan University(特里布罕大学加德满都工程学院) School of Management and Social Science(管理与社会科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出BERT-GA两阶段框架,结合深度学习和遗传算法优化mRNA序列,在翻译效率、结构稳定性和低免疫原性之间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27922 2026-05-28 cs.AI 70%

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。

Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27865 2026-05-28 cs.CL 70%

MERIT: Matching Expertise via Rubric-Informed Training for Reviewer Assignment

MERIT: 通过基于评分标准的训练进行审稿人匹配的专业知识匹配

Zixuan Yang, Yibo Zhao, Weicong Liu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MERIT两阶段框架,通过强化学习训练审稿人评估器并蒸馏为检索器,实现大规模审稿人分配中的专业知识匹配。

Comments 22pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27621 2026-05-28 cs.MA cs.CL 70%

Agents that Matter: Optimizing Multi-Agent LLMs via Removal-Based Attribution

重要的智能体:通过基于移除的归因优化多智能体大语言模型

Mingyu Lu, Yushan Huang, Chris Lin, Su-In Lee

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出一个基于合作博弈的归因框架,通过移除协议和模型替换来识别瓶颈智能体,从而优化多智能体系统性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27492 2026-05-28 cs.SE cs.AI 70%

Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems

基准测试还不够:RAMP——生产系统中代理模型的运行时评估

Yipeng Ouyang, Xin Huang, Bingjie Liu, Zhongchun Zheng, Yuhao Gu, Xianwei Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院,广州,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有基准测试无法反映真实生产环境动态复杂性的问题,提出RAMP框架,通过统一运行时评估架构、编译器构建工作负载和多维效用指标,揭示模型在长序列工作流中的性能退化与资源效率差异。

Comments 16 pages, 8 figures. Project homepage: http://ramp.yatcc-ai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13748 2026-05-28 cs.CL cs.CV 70%

RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction

RMPL:基于关系感知的多任务渐进学习与分阶段训练的多媒体事件抽取

Yongkang Jin, Jianwen Luo, Jingjing Wang, Jianmin Yao, Yu Hong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出RMPL框架,通过分阶段训练结合单模态事件抽取和多模态关系抽取的异构监督,在低资源条件下实现多媒体事件抽取,并在M2E2基准上取得一致改进。

Comments Accepted by ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07648 2026-05-28 cs.CL 70%

What Are We Measuring in NLG? A Meta-Analysis of Evaluation Trends 2020-2025

我们在NLG中测量什么?2020-2025年评估趋势的元分析

Jing Yang, Nils Feldhus, Salar Mohtaj, Leonhard Hennig, Qianli Wang, Eleni Metheniti, Sherzod Hakimov, Charlott Jakob, Veronika Solopova, Konrad Rieck, David Schlangen, Sebastian Möller, Vera Schmitt

机构 * Technische Universität Berlin(技术大学柏林) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI),柏林) ANITI University of Potsdam(波茨坦大学) CERTAIN

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过元分析14,171篇论文,揭示NLG评估中的三个系统性问题:度量惯性、度量-标准映射问题和验证差距,并提出最小评估清单。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21771 2026-05-28 cs.CV cs.AI 70%

MMTABREAL: Real-World Benchmark for Multimodal Table Understanding

MMTABREAL:多模态表格理解的真实世界基准

Prasham Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态表格理解,构建了包含500个真实表格和4021个问答对的人工筛选基准MMTABREAL,评估发现现有模型在视觉定位、空间对齐和多步推理上存在20-40%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28482 2026-05-28 cs.SE 67%

Rethinking Software Empirical Studies with Structural Causal Models

用结构因果模型重新思考软件实证研究

Daniel Rodriguez-Cardenas, Aya Garryyeva, David Nader Palacio, Antonio Mastropaolo, Denys Poshyvanyk

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出CausalSE框架,利用结构因果模型(SCMs)解决混淆偏差,通过Galeras数据集和倾向得分匹配案例,揭示提示工程策略对代码生成的影响,强调因果分析可避免关联分析中的假阳性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27800 2026-05-28 cs.CV 67%

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交

Yuto Kanda, Hayato Tanoue, Takayuki Hori

机构 * SoftBank Corp(软银公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对600多小时多视角自我中心视频的185道选择题,提出SVA(搜索-验证-回答)三阶段流水线和TMKG(时间多模态知识图谱)两种方法,SVA达到0.50准确率并作为最终提交。

Comments The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28565 2026-05-28 cs.DL cs.AI cs.CL cs.IR 62%

Verified Misguidance: Measuring Structural Citation Failures in Search-Augmented LLMs

验证性误导:衡量搜索增强型大语言模型中的结构性引用失败

Yongsik Seo, Wooseok Jeong, Eunyoung Kim, Hyeonseo Jang, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Department of Computer Science and Engineering, Konkuk University(Konkuk大学计算机科学与工程系) Incheon International Airport Corporation(仁川国际机场公司) Department of Computer Science and Engineering, Ewha Womans University(成均馆女子大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 针对搜索增强型大语言模型中的引用可信度问题,提出CITETRACE数据集和三维评估框架,发现系统性“验证性误导”模式:模型引用真实可访问来源但存在意图对齐、来源适宜性或答案-来源忠实度缺陷,导致用户面临结构性误导。

Comments Working Progress

详情

展开后加载摘要…

URL PDF HTML 收藏