arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2334 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 578 篇

2606.06622 2026-07-07 cs.CL 版本更新 57%

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

UnpredictaBench:评估大语言模型分布随机性的基准

Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出UnpredictaBench基准,通过KS@N指标评估LLM从目标分布(统计分布、随机程序、自然语言场景)采样的能力,发现模型表现差异大且无模型超过40%准确率,表明分布采样能力仍有显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06337 2026-07-07 cs.AI 版本更新 57%

TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management

TokenMizer: 面向长程LLM上下文管理的图结构会话记忆

Shweta Mishra

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出TokenMizer,一种将LLM会话历史建模为类型化知识图的开源代理系统,通过混合提取、三级检查点和8层压缩流水线,在显著减少token开销的同时保留结构化决策信息。

Comments 9 pages, 6 figures. Code and benchmark: https://github.com/Shweta-Mishra-ai/tokenmizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 57%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 57%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19698 2026-07-07 cs.AI 版本更新 57%

RLIE: Rule Generation with Logistic Regression, Iterative Refinement, and Evaluation for Large Language Models

RLIE:用于大语言模型的基于逻辑回归、迭代细化和评估的规则生成

Yang Yang, Hua XU, Zhangyi Hu, Yutao Yue

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出RLIE框架,将大语言模型与概率建模结合学习加权规则集,经规则生成、逻辑回归、迭代细化和评估四阶段,评估多种推理策略,明确大语言模型在归纳推理中的潜力与局限,实现更可靠的神经符号推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新 57%

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15135 2026-07-07 cs.CL 版本更新 57%

TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking

TrendFact:自动事实核查中热点感知的基准

Xiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Defense Technology(国防科学技术大学) Northeastern University(东北大学) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究自动事实核查范式在资源受限环境下面临风险不对称挑战,引入TrendFact基准及评估热点感知能力的指标,提出FactISR框架提升热点感知能力和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20692 2026-07-07 cs.SE cs.AI cs.FL 版本更新 57%

Neurosymbolic Characterization for Reliable Access Control Policy Analysis

探索大型语言模型用于访问控制策略合成与摘要

Adarsh Vatsa, Bethel Hall, William Eiers

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM在访问控制策略自动生成中的有效性,发现非推理LLM仅45.8%生成等价策略,推理LLM达93.7%,并提出基于语义的请求摘要方法辅助策略分析。

Comments Accepted to ISSRE 2026. Major revision and retitling of arXiv:2510.20692v1. Refocuses the paper on reliable neurosymbolic access-control policy analysis; updates the PolicySummarizer method, multi-cloud evaluation, and user-study results. 13 pages, 6 figures. Corrected arXiv title metadata to match the accepted ISSRE version. No substantive content changes from the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06643 2026-07-07 cs.SE cs.CL 版本更新 57%

Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models

你的基准仍然有用吗?代码语言模型的动态基准测试

Batu Guan, Xiao Wu, Yuanyuan Yuan, Shaohua Li

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究模型评估中如何在模型训练可能已见过基准的情况下保持其有用性,提出动态基准测试框架,通过语义保留突变变换输入构建新基准,评估发现模型性能变差、排名变化及能抵抗数据污染问题。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 57%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03137 2026-07-02 cs.AI 版本更新 57%

Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation

Think-Before-Speak: 从内部评估到多智能体社会模拟中的公开表达

Kaiqi Yang, Tai-Quan Peng, Sanguk Lee, Hui Liu

机构 * Michigan State University(密歇根州立大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出TBS框架,通过分离智能体的内部推理与公开话语生成,模拟从内部评估到公开表达的路径,并在气候政策讨论中验证其机制敏感性。

Comments 8 pages of main content, 14 pages including references and appendices, 3 figures. Accepted to the KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16432 2026-07-02 cs.CV cs.LG 版本更新 57%

IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video

IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准

Rasul Khanbayov, Mohamed Rayan Barhdadi, Erchin Serpedin, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10540 2026-07-02 cs.LG 版本更新 57%

FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

FusionFactory: 融合多LLM日志数据中的大语言模型能力

Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 变现人工智能) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。

Journal ref TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11030 2026-07-01 cs.SE cs.AI cs.MA 版本更新 57%

An Executable Benchmarking Suite for Tool-Using Agents

为工具使用智能体设计的可执行基准测试套件

Zhiqing Zhong, Zhijing Ye, Jiamin Wang, Xiaodong Yu

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文提出一个可执行基准测试套件,通过共享证据准入合同明确工作负载、行动生成驱动器和系统面向声明的证据。该套件连接WebArena Verified和MiniWoB++,并提供统一的工作负载适配器、任务清单、事件模式、回放/冻结政策、声明驱动器和报告管道。

Comments Withdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20491 2026-07-01 cs.SE cs.AI 版本更新 57%

SpecDetect4ML: Detecting Non-Local ML Code Smells with Code Property Graphs

ML代码异味:从规范到检测

Brahim Mahmoudi, Naouel Moha, Quentin Stiévenart, Florent Avellaneda

机构 * École de technologie supérieure Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究ML代码异味问题,提出基于规范的检测工具SpecDetect4ML,通过声明式DSL和可扩展分析引擎,实现项目级的代码异味检测,提升可复现性和可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10409 2026-07-01 cs.AR cs.AI 版本更新 57%

Dataset Construction for Training LLM to Learn Analog Circuit Knowledge

用于训练大语言模型学习模拟电路知识的数据集构建

Zihao Chen, Ji Zhuang, Jinyi Shen, Xiaoyue Ke, Xinyi Yang, Mingjie Zhou, Zhuoyao Du, Xu Yan, Zhouyang Wu, Zhenyu Xu, Jiangli Huang, Li Shang, Xuan Zeng, Fan Yang

机构 * Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文构建文本数据集并定制训练技术,使大语言模型学习模拟电路知识;通过多智能体框架生成结构化四元组,结合SFT与KL散度正则化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 57%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 57%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 57%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04390 2026-06-29 cs.AI 版本更新 57%

SciFig: Towards Automating Editable Figure Generation for Scientific Papers

SciFig:面向科学论文的可编辑图形自动生成

Siyuan Huang, Yifan Zhou, Yutong Gao, Zi Yin, Juyang Bai, Xinxin Liu, Rama Chellappa, Chun Pong Lau, Cheng Peng, Sayan Nag, Shraman Pramanick

机构 * Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Independant Researcher(独立研究者) Tsinghua University(清华大学) University of Central Florida(佛罗里达中央大学) City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出SciFig多智能体框架,从科学文本自动生成可编辑的高质量方法图,通过分解规划、布局、渲染和迭代优化,在435个基准上优于基线,平均10分钟生成可编辑图形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16116 2026-06-29 cs.CR cs.AI 版本更新 57%

DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain

DMind Benchmark:面向Web3领域LLM能力的全面评估

Enhao Huang, Pengyu Sun, Shuxun Wang, Zixin Lin, Alex Chen, Kaichun Hu, Joey Ouyang, Frank Li, Zhiyu Zhang, Haobo Wang, Yiming Li, Zhan Qin, James Yi, Gang Zhao, Ziang Ling, Lowes Yang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13300 2026-06-26 cs.CL 版本更新 57%

OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准

Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25345 2026-06-25 cs.AI astro-ph.IM 版本更新 57%

Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

可能但错误:天体物理工作流中代理失败的案例研究

Shivam Rawat, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-阿森国际信息科技中心,波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了CMBAgent在两种工作流范式和十八个天体物理任务中的表现,发现代理在缺乏上下文时性能提升显著,但常出现静默错误,产生看似合理却不准确的结果,揭示了代理科学工作流中最危险的失败模式是自信生成错误结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02156 2026-06-25 cs.NI cs.AI 版本更新 57%

How Small Can 6G Reason? Scaling Tiny-to-Small Language Models for AI-Native Networks

6G 推理能有多小?面向 AI 原生网络的微小型语言模型缩放

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统研究小型语言模型在 6G 网络语义推理中的缩放行为与部署效率,发现 1.5B-3B 参数的中等模型在确定性稳定性和计算效率间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05143 2026-06-25 cs.AI cs.IR 版本更新 57%

CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG

CausalRAG2: 面向RAG的分层因果知识图谱设计

Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA) Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CausalRAG2框架,通过分层模块间的因果门控机制显式建模因果关系,抑制虚假相关,实现大规模知识图谱上的可扩展推理,并引入HolisQA基准,实验表明其优于现有图基RAG方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 57%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 57%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24295 2026-06-24 cs.CL 版本更新 57%

MERGE: Minimal Expression-Replacement GEneralization Test for Natural Language Inference

MERGE: 自然语言推理的最小表达式替换泛化测试

Mădălina Zgreabăn, Tejaswini Deoskar, Lasha Abzianidze

机构 * Utrecht Institute of Linguistics OTS(乌得勒支语言研究所OTS)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MERGE测试,通过最小表达式替换(MERE)生成高质量变体,评估NLI模型在非对抗性变体上的泛化能力,发现LLM和微调模型泛化较差。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01152 2026-06-23 cs.AI 版本更新 57%

DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent

DeepResearch-9K:一个具有挑战性的深度研究智能体基准数据集

Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 为解决深度研究智能体缺乏大规模挑战性数据集和开源训练框架的问题,构建了DeepResearch-9K数据集,包含9000个多难度问题、搜索轨迹和可验证答案,并开发了开源训练框架DeepResearch-R1,实验表明训练后的智能体在基准测试上达到最优。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏