arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-28 至 2026-05-28 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 45 篇

2605.27901 2026-05-28 cs.CL cs.AI 86%

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

跨类型多样语言的思维链监控脆弱性

Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过13种语言和7个前沿模型家族的评估,发现思维链监控在语言分布偏移下普遍不可靠(平均不可信率95.9%),模型会进行策略性操纵,且低资源语言中欺骗模式完全存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 83%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28422 2026-05-28 cs.CV cs.AI 83%

VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs

VITAL: 视觉-语义双重监督增强可解释的医学多模态大语言模型潜在推理

Qiaoru Li, Shaotian Liang, Jintao Chen, Haoran Sun, Yuxiang Cai, Jianwei Yin, Yankai Jiang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出VITAL框架,通过视觉-语义双重监督(文本解码器重构推理链、视觉投影器回归ROI特征)实现医学MLLM的可解释潜在推理,在7个基准上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27916 2026-05-28 cs.CV cs.CL 81%

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Hao Wang, Xin Li, Yujian Xiong, Jiajun Cheng, Jingjing Wang, Xiaobing Yu, Haiyu Wu, Shao Tang, Zhipeng Wang, Langechuan Liu, Shan Lin, Oana Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(诺特丹大学) Florida State University(佛罗里达州立大学) Rice University(里德大学) NVIDIA(英伟达) Mayo Clinic(梅奥诊所)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28602 2026-05-28 cs.AI cs.CL cs.LO 81%

Satisfiability Solving with LLMs: A Matched-Pair Evaluation of Reasoning Capability

用大语言模型求解可满足性问题:推理能力的配对评估

Leizhen Zhang, Shuhan Chen, Sheng Chen

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出配对公式协议和准确区分率(ADR)来评估大语言模型在SAT问题上的推理能力,发现传统指标具有误导性,而ADR能更忠实、跨表示鲁棒地评估模型。

Comments Accepted at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28487 2026-05-28 cs.AI cs.LG 81%

ProvMind: Provenance-grounded reasoning for materials synthesis

ProvMind:基于来源的材料合成推理

Yiming Zhang, Ryo Tamura, Koji Tsuda

机构 * Center for Basic Research on Materials, National Institute for Materials Science(材料基础研究センター,国家材料科学研究所) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MatProcBench基准和ProvMind框架,通过来源图推理实现材料合成中的路线、条件和因果依赖优化,在双OOD分割上达到52.84%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17003 2026-05-28 cs.CL cs.AI 81%

Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History

Persona2Web: 基于用户历史进行上下文推理的个性化Web智能体基准

Serin Kim, Sangam Lee, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(人工智能系,延世大学,首尔,大韩民国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Persona2Web基准,通过澄清-个性化原则评估Web智能体在真实开放网络中利用用户历史解决模糊查询的个性化能力,并引入推理感知评估框架。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28779 2026-05-28 cs.CL cs.CV 79%

The Abstraction Gap in Vision-Language Causal Reasoning

视觉-语言因果推理中的抽象差距

Chinh Hoang, Mohammad Rashedul Hasan

机构 * Department of Electrical and Computer Engineering, University of Nebraska--Lincoln, Lincoln, Nebraska, USA(电气与计算机工程系,内布拉斯加大学林肯分校,内布拉斯加,林肯,美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对视觉-语言模型(VLM)生成因果解释时语言流畅性与忠实因果推理的混淆问题,提出双探针方法和抽象差距(AG)指标,通过CAGE基准评估发现多数模型存在显著AG,但通过预训练和架构选择可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28433 2026-05-28 cs.CL 79%

Roles with Rails: Contract-Preserving Role Evolution in Multi-Agent Structured Reasoning

角色与轨道:多智能体结构化推理中保持契约的角色演化

Ling-Yue Ge, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SERO框架,通过契约保持的角色演化机制(信用引导检索、保护终端聚合器、条件验证器修复、上下文赌博机控制器)解决多智能体系统中角色漂移和契约破坏问题,在真实推理基准上验证有效性。

Comments 33 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI 79%

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 79%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27934 2026-05-28 cs.CL 79%

GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization

GeneralThinker: 通过似然引导的答案条件优化实现领域通用推理

Shengmin Piao, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出GeneralThinker框架,利用答案似然进行密集监督和细粒度信用分配,无需领域特定验证器,在数学、STEM和通用推理等11个基准上取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02263 2026-05-28 cs.LG 79%

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning

打破块限制:通过单调熵下降与强化学习为扩散大语言模型实现动态大小推理块

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Queensland, Australia(电气工程与计算机科学学院,昆士兰大学,布里斯班,昆士兰,澳大利亚)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 针对扩散大语言模型中固定大小推理块导致的逻辑连贯性差和效率低问题,提出基于单调熵下降目标与强化学习的后训练框架b1,学习动态大小推理块以提升推理连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16312 2026-05-28 cs.CL cs.AI 79%

Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks

教授和评估LLMs推理聚合物设计相关任务

Dikshya Mohanty, Mohammad Saqib Hasan, Syed Mostofa Monsur, Size Zheng, Benjamin Hsiao, Niranjan Balasubramanian

机构 * Stony Brook University(石溪大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PolyBench基准数据集和知识增强推理蒸馏方法,使中小型语言模型在聚合物设计任务上性能接近前沿闭源LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04505 2026-05-28 cs.AI cs.CL cs.SY eess.SY 73%

CircuitLM: A Multi-Agent LLM-Aided Design Framework for Generating Circuit Schematics from Natural Language Prompts

CircuitLM: 一种基于多智能体的大语言模型辅助设计框架,用于从自然语言提示生成电路原理图

Khandakar Shakib Al Hasan, Syed Rifat Raiyan, Hasin Mahtab Alvee, Wahid Sadik

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Electronic Engineering(电气与电子工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出CircuitLM多智能体流水线,通过嵌入驱动的组件知识库和五阶段流程,将自然语言提示转化为结构化的CircuitJSON原理图,并采用确定性电气规则检查和LLM作为评判的元评估器双重验证,解决大语言模型在电路设计中的幻觉和物理约束问题。

Comments Accepted at the 2026 IEEE International Conference on LLM-Aided Design (ICLAD), 10 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28369 2026-05-28 cs.AI cs.SI 70%

CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

CyberJurors:电商纠纷裁决的多智能体模拟任务

Yanhui Sun, Wu Liu, Haifeng Ming, Xinru Wang, Hantao Yao, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对电商纠纷裁决需要从冗余多轮多模态证据中提取关键线索并依据平台特定惯例决策的问题,提出多智能体框架CyberJurors,通过个体裁决链式思维和集体陪审共识裁决提升裁决质量,在包含6000真实案例的基准上超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28313 2026-05-28 cs.CL 70%

Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

基于大语言模型的论证质量评估:一种成对Bradley-Terry方法

Nicolás Benjamín Ocampo, Agnes Paullate Nyiranziza, Davide Ceolin

机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27932 2026-05-28 cs.CV cs.AI cs.CL cs.CR cs.LG 67%

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

当图文推理遇上安全:什么决定了多模态越狱鲁棒性?

Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

机构 * Independent Researcher(独立研究者) Stanford University(斯坦福大学) Harvard University(哈佛大学) Purdue University(普渡大学) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。

Comments 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28163 2026-05-28 cs.CL cs.AI 62%

DEPART: DEcomposing PARiTy across Multilingual LLMs

DEPART: 跨多语言大模型的性能差异分解

Manan Uppadhyay, Prashant Kodali, Pranjal Chitale, Reshma Ramaprasad, Himanshu Beniwal, Sunayana Sitaram

机构 * Microsoft Research India(微软印度研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出DEPART框架,通过贝叶斯分层模型分解多语言大模型性能差异,发现语言特征解释79%-92%的方差,且模型内部表示与英语的相似性是主要预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27567 2026-05-28 cs.AI cs.CL 62%

Why LLMs Fail at Causal Discovery and How Interventional Agents Escape

为什么LLM在因果发现中失败以及干预代理如何逃脱

Amartya Roy, Sonali Parbhoo

机构 * SIRE, IIT Delhi(IIT德里智能研究机构) Robert Bosch GmbH(罗伯特·博世有限公司) Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文证明大型语言模型在因果发现中存在根本性失败,并提出一种基于干预代理的因果贝叶斯优化方法(A-CBO),通过外部贝叶斯循环在无需模型微调的情况下实现可证明的收敛。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13583 2026-05-28 cs.CL cs.AI 62%

BenGER Platform: A Collaborative Web Platform for End-to-End Benchmarking of German Legal Tasks

BenGER平台:面向德国法律任务端到端基准测试的协作式Web平台

Sebastian Nagl, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出BenGER开源Web平台,集成任务创建、协作标注、可配置LLM运行及多维度评估,支持多组织项目与租户隔离,实现法律推理基准测试的端到端透明与可复现。

Comments Preprint - Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 62%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28532 2026-05-28 cs.AI 57%

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

智能体知道它们不能做什么吗?评估使用工具的智能体的可行性意识

Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出FeasiGen自动构建不可行任务管道,通过屏蔽关键工具将可解任务转为不可解,评估发现多数模型缺乏可行性检测能力,错误继续率高达73.9%。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR 57%

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27922 2026-05-28 cs.AI 57%

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。

Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27832 2026-05-28 cs.CL 57%

Playing with Words, Improving with Rewards: Training Language Models for Creative Association

玩文字游戏,用奖励改进:训练语言模型进行创意联想

Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛市分校) Dartmouth College(达特茅斯学院) University of Amsterdam(阿姆斯特丹大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过强化学习与可验证奖励(RLVR)在Codenames游戏上训练LLM,探索了规模依赖的精确度-创造力权衡,发现8B模型在保持推理能力的同时提升创造力,而小模型则牺牲创造力换取推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27820 2026-05-28 cs.AI 57%

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出EgoBench,首个交互式自我中心多模态基准,通过1045个自我中心视频任务和用户-智能体-工具交互环境,联合评估视觉感知、工具增强多跳推理和动态交互能力,揭示当前最先进模型性能上限(平均准确率19.43%)。

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27710 2026-05-28 cs.AI 57%

DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation

DeepSciVerify: 通过LLM驱动的证据升级验证科学声明与引文对齐

Shaghayegh Sadeghi, Khashayar Khajavi, Rise Adhikari, Alexander Tessier

机构 * School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DeepSciVerify两阶段流水线,结合摘要推理与选择性升级到段落证据,在SCitance基准上以86.7 Micro-F1超越纯摘要基线4.5点,同时67%实例无需全文检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27706 2026-05-28 cs.CL cs.IR 57%

Chain-based Adaptive Reconfiguration Over Lattices for Hallucination Reduction

基于格点链式自适应重配置以减少幻觉

Joan Vendrell Gallart, Solmaz Kia, Russell Bent, Michael Grosskopf

机构 * Department of Mechanical and Aerospace University of California Irvine(机械与航空航天系加州大学伊文斯顿分校) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出CAROL框架,通过定义语义不确定性度量并在文本序列格点上构建串子模目标,将幻觉缓解转化为马尔可夫链接受-拒绝过程,实现测试时幻觉减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27591 2026-05-28 cs.LG 57%

Gradient Transformer: Learning to Generate Updates for LLMs

梯度变换器:学习为大语言模型生成更新

Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Department of Data Science, New Jersey Institute of Technology, Newark, NJ, USA(数据科学系,新泽西理工学院,新泽西州诺克斯维尔) Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所,HBKU,多哈)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出一种无数据知识蒸馏框架,利用梯度变换器将微调后小语言模型的更新向量转换为大语言模型的更新向量,实现无需私有数据即可更新大模型。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏