arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2605.19869 2026-05-20 cs.CV cs.AI 79%

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

通过基于人设的对抗性链式思考视觉语言模型验证实现被动施工现场安全监控

Ananth Sriram, Neel Mokaria, Rajveer Singh

机构 * Department of Computer Science, University of Maryland, College Park, MD, USA(大学马里兰学院计算机科学系,马里兰州科利尔帕克,MD,美国)

专题命中 推理评测 :chain-of-thought(title,abstract);分类 cs.AI

AI总结 本文提出了一种被动的施工现场安全监控方法,通过三阶段架构处理视频数据,结合细调的YOLO11、SAM 3和Qwen3-VL-8B-Instruct模型,利用基于人设的对抗性链式思考协议提高合规性验证和幻觉控制,主要贡献是第三阶段提示设计,提升了12%的精度。

Comments 10 pages, 4 figures. First place, Ironsite.ai Spatial Intelligence Hackathon, University of Maryland, February 2026. Code available at https://github.com/ananthsriram1/ironsite-hackathon-project-safety_assistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19559 2026-05-20 cs.CV cs.AI 79%

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

EgoCoT-Bench: 用于MLLMs的 grounded 和可验证的 operation-centric 思维链推理基准测试

Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EgoCoT-Bench,一个用于评估MLLMs在第一人称视角下细粒度操作中心推理能力的基准测试,包含3172个可验证的问答对,涵盖感知、预见和高层次推理等任务,旨在解决现有基准测试在细粒度推理和证据验证方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19382 2026-05-20 cs.AI 79%

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

PRISM:一个程序化空间-时间推理的基准测试

Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19173 2026-05-20 cs.CL 79%

Prompting language influences diagnostic reasoning and accuracy of large language models

提示语言影响大型语言模型的诊断推理和准确性

Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

机构 * Data Clinic, Nantes University Hospital(数据诊所,南特大学医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究探讨了提示语言对大型语言模型在临床诊断推理和准确性上的影响,通过比较英语和法语性能,发现四种模型在英语环境下表现更优,而o3模型未表现出语言效应,表明提示语言是影响模型临床性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16593 2026-05-20 cs.CL 79%

Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models

重新审视一个令人头疼的问题:一种用于语言模型的语义推理基准

Yang Liu, Hongming Li, Melissa Xiaohui Qin, Qiankun Liu, Chao Huang

机构 * University of Science and Technology Beijing(北京科技大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SemanticQA基准,用于评估语言模型在语义短语处理任务中的表现,通过整合现有多词表达资源并重新组织为统一测试平台,涵盖通用词汇现象及三种细粒度类别,评估不同架构和规模的语言模型在提取、分类、解释及任务组合中的性能,揭示语义推理任务中模型性能的显著差异,为提升语言模型在非平凡语义短语上的理解能力提供见解。

Comments ACL 2026 (Oral), 24 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22258 2026-05-20 cs.CV cs.AI 79%

Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks

超越分类准确度:Neural-MedBench与更深层次推理基准的需求

Miao Jing, Mengting Jia, Junling Lin, Zhongxia Shen, Huan Gao, Mingkun Xu, Shangyang Li

机构 * School of Physics Science and Technology, Beijing University of Posts and Telecommunications(北京邮电大学物理科学与技术学院) Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院) Beijing Chaoyang Hospital, Capital Medical University(北京朝阳医院) Sleep Medical Center, Huzhou Third Municipal Hospital, Affiliated Hospital of Wenzhou Medical University(湖州第三人民医院睡眠医学中心,温州医科大学附属医院) University of Macau(澳门大学) Renyixun Health Technology Co., Ltd(仁颐讯健康科技有限公司) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学交叉学科研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Neural-MedBench,一个专门用于测试多模态神经病学推理能力的基准,揭示现有医疗数据集过于强调分类准确度的问题,并通过系统评估发现模型推理失败而非感知误差主导性能下降,强调需要兼顾广度与深度的评估框架。

Comments 23 pages, 12 figures

Journal ref ICLR'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18352 2026-05-19 cs.CL 79%

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

条件句中的预设与推理:人类与LLM的理论研究

Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

机构 * Department of Cognitive Science, Carleton University(卡尔顿大学认知科学系) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过对比人类判断和LLM预测,研究条件句中预设投影的机制,发现人类结合概率和语用线索进行判断,而LLM存在不一致的对齐模式,表明LLM的表现可能源于表面模式匹配而非语用能力。

Comments To appear in the Proceedings of CoNLL 2026, colocated with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17497 2026-05-19 cs.LG 79%

Self-Supervised On-Policy Distillation for Reasoning Language Models

自监督在线策略蒸馏用于推理语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出自监督在线策略蒸馏(SSOPD)方法,通过对比正确与错误的完成过程信号,提升推理语言模型的表现,实验表明在多个基准测试中优于GRPO和OPSD基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06943 2026-05-19 cs.CV cs.AI 79%

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning

观看、推理与搜索:一个面向开放网络的视频深度研究基准,用于代理视频推理

Chengwen Liu, Xiaomin Yu, Zhuoyue Chang, Zhe Huang, Shuo Zhang, Heng Lian, Jisheng Dang, Rui Xu, Sen Hu, Jianheng Hou, Chengwei Qin, Xiaobin Hu, Kunyi Wang, Zhi Yang, Hao Peng, Hong Peng, Ronghao Chen, Huacan Wang

机构 * LZU(兰州大学) HKUST(GZ)(香港科技大学(广州)) UBC(不列颠哥伦比亚大学) FDU(福建大学) PKU(北京大学) USC(美国南加州大学) NUS(新加坡国立大学) UCAS(中国科学院大学) HKUST(香港科技大学) QuantaAlpha(量子Alpha)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VideoDR基准,用于研究开放网络环境下视频代理推理,通过跨帧视觉锚点提取、交互式网络检索和多跳推理验证,揭示了长检索链中维持初始视频锚点、目标漂移和长时程一致性等关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17308 2026-05-19 cs.AI 79%

Reasoning Before Diagnosis: Physician-Inspired Structured Thinking for ECG Classification

在诊断前进行推理:受医生启发的结构化思维用于心电图分类

Yang Wu, Xiaoyan Yuan, Hau-San Wong, Xiping Hu

机构 * City University of Hong Kong(香港城市大学) Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CardioThink框架,通过结构化推理过程提升心电图分类的临床相关性,并引入SSPO方法以优化诊断结果的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16416 2026-05-19 cs.CV cs.AI 79%

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15764 2026-05-18 cs.CV cs.AI 79%

GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

GRASP:学习多个人非语言互动中的社会推理

Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic, Fiona Ryan, Bolin Lai, Sangmin Lee, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Amazon AGI Korea University(亚马逊AGI韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。

Comments Project page: https://social-reaoning.github.io/grasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14754 2026-05-15 cs.AI 79%

XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

XDomainBench:诊断高维科学知识组合中的推理崩溃

Gong Zhiren, Tiantong Wu, Jiaming Zhang, Fuyao Zhang, Che Wang, Yurong Hao, Yikun Hou, Foo Ping, Yilei Zhao, Fei Huang, Chau Yuen, Wei Yang Bryan Lim

机构 * Alibaba Group, China(阿里巴巴集团,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XDomainBench通过系统压力测试科学推理,揭示LLM在跨学科知识组合中的推理崩溃问题,发现领域组合导致直接难度增加和轨迹模式引发的误差累积是根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14704 2026-05-15 cs.CV cs.AI cs.RO 79%

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

SceneFunRI:为任务驱动的功能物体定位推理不可见区域

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SceneFunRI通过半自动化流程构建了855个实例的基准,要求模型根据任务指令和常识推理推断不可见功能物体的位置,现有模型在推理稳定性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 79%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 79%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL 79%

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05820 2026-05-15 cs.SE cs.AI 79%

From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning

从排序到推理:通过语义推理实现可解释的Web API推荐

Zishuo Xu, Dezhong Yao, Yao Wan

机构 * School of Software Engineering(软件工程学院) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WAR-R1框架,结合语义推理与自适应推荐,通过轻量级大语言模型生成API推荐及自然语言解释,提升推荐准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-05-15 cs.CL 79%

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12918 2026-05-14 cs.CL 79%

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

CommonWhy:用于评估大语言模型实体基础因果常识推理的数据集

Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 CommonWhy数据集通过15000个为什么问题评估大语言模型的因果关系实体推理能力,揭示现有模型在因果推理和事实生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09100 2026-05-13 cs.CL 79%

GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression

GRC:统一推理驱动生成、检索与压缩

Zhongtao Miao, Qiyu Wu, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GRC框架,通过元潜在标记和统一训练方法,将推理驱动生成、文本表示和上下文压缩整合于单次前向传递中,提升部署效率与训练效果。

Comments Fixed typos in Eq. 4 and GPU names; added details on hybrid paged attention implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13898 2026-05-13 cs.HC cs.AI 79%

Social Human Robot Embodied Conversation (SHREC) Dataset: Benchmarking Foundational Models' Social Reasoning

社交人机具身对话(SHREC)数据集:评估基础模型的社会推理能力

Dong Won Lee, Yubin Kim, Denison Guvenoz, Sooyeon Jeong, Parker Malachowsky, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SHREC数据集,包含400个真实人机交互视频和10000多个标注,用于评估基础模型在社会推理中的能力,揭示社会机器人在情绪理解、意图跟踪等方面的社会挑战。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11006 2026-05-13 cs.SE cs.AI 79%

An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

一个经过执行验证的多语言基准用于代码语义推理

Yikun Li, Jinfeng Jiang, Ting Zhang, Chengran Yang, Chenxing Zhong, Yin Yide, Leow Wen Bin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

机构 * Singapore Management University(新加坡管理大学) Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) GovTech Singapore(新加坡政府科技局)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TraceEval,首个经过执行验证的多语言代码语义推理基准,通过验证执行消除标注偏差,评估10个LLM在零样本下的表现,展示了其在代码语义推理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00400 2026-05-13 cs.AI 79%

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California, Irvine(加州大学伊文斯分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10698 2026-05-12 cs.MA cs.AI 79%

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

多智能体推理中的旁观者效应:量化协作互动中的认知惰性

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示多智能体系统中社交压力引发的认知惰性现象,通过评估22500条轨迹发现模型在协作中逻辑主权崩溃,揭示了主权缺口与对齐幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10410 2026-05-12 cs.LG 79%

Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models

均衡残差揭示语言模型在矩阵博弈战略推理中的三种模式

Wenhua Nie, Binhan Luo, Zijie Meng, Jyh-Shing Roger Jang, Ching-Wen Ma

机构 * National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究揭示语言模型在矩阵博弈中存在三种战略推理模式,通过实验发现残差奖励在不同矩阵规模下表现差异,证明残差训练在收益变化时具有转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10327 2026-05-12 quant-ph cs.AI cs.SC 79%

SCALAR: A Neurosymbolic Framework for Automated Conjecture and Reasoning in Quantum Circuit Analysis

SCALAR:用于量子电路分析中自动猜想和推理的神经符号框架

Sean Feeney, Pooja Rao, Andreas Klappenecker, Reuben Tate, Yuri Alexeev, Stefano Mensa, Elica Kyoseva, Stephan Eidenbenz

机构 * 1Department of Computer Science, Texas A\&M University, College Station, USA 2NVIDIA Corporation, Santa Clara, USA Artificial Intelligence Division (CAI-3), Los Alamos National Laboratory, Los Alamos, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SCALAR框架结合量子模拟、符号猜想生成和LLM解释,通过CUDA-Q平台分析量子电路,生成优化QAOA参数与图不变量的关系猜想,并识别图结构特征与优化景观属性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10146 2026-05-12 cs.AI cs.CR 79%

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

在恶意知识编辑下知识密集推理安全风险的基准测试

Qinghua Mao, Xi Lin, Jinze Gu, Jun Wu, Siyuan Li, Yuliang Chen

机构 * School of Computer Science(计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EditRisk-Bench,通过整合恶意场景和多级推理任务,系统评估知识编辑对推理行为的影响,揭示恶意知识编辑导致错误推理的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09929 2026-05-12 cs.LG cs.SE 79%

TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications

TeleResilienceBench: 评估大语言模型在电信领域推理中的韧性

Pranshav Gajjar, Emmanuel Ojo, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University(NextG无线实验室,北卡罗来纳州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出TeleResilienceBench,通过七个电信子领域评估大语言模型在继承不完整推理并纠正错误时的韧性,发现模型在恢复能力上表现有限,且规模扩大并不必然提升韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI 79%

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏