arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-15 至 2026-04-15 共收录 119 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 14 篇

2507.06448 2026-04-15 cs.CL 79%

Perception-Aware Policy Optimization for Multimodal Reasoning

面向多模态推理的感知意识策略优化

Zhenhailong Wang, Xuehang Guo, Sofia Stoica, Haiyang Xu, Hongru Wang, Hyeonjeong Ha, Xiusi Chen, Yangyi Chen, Ming Yan, Fei Huang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PAPO算法,通过引入隐式感知损失提升多模态推理性能,实现4.4%-17.5%的基准提升,尤其在视觉依赖性强的任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11957 2026-04-15 cond-mat.mtrl-sci cs.LG 79%

Agentic LLM Reasoning in a Self-Driving Laboratory for Air-Sensitive Lithium Halide Spinel Conductors

具有自主推理能力的LLM在空气敏感性锂卤化物尖晶石导体自驱动实验室中的应用

Yuxing Fei, Bernardus Rendy, Xiaochen Yang, Junhee Woo, Xu Huang, Chang Li, Shilong Wang, David Milsted, Yan Zeng, Gerbrand Ceder

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出A-Lab GPSS平台,通过整合代理AI框架,实现对空气敏感性材料的自主实验设计,探索锂卤化物尖晶石固态离子导体的广阔化学空间,提升离子导电性和相纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00919 2026-04-15 cs.CL cs.AI 62%

Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving

基于检索增强生成在奥林匹克级物理问题求解中的基础模型评估

Shunfeng Zheng, Yudi Zhang, Meng Fang, Zihan Zhang, Zhitan Wu, Mykola Pechenizkiy, Ling Chen

机构 * AAII, University of Technology Sydney, New South Wales, Australia(AAII,悉尼大学,新南威尔士州,澳大利亚) Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学,埃因霍温,荷兰) University of Liverpool, Liverpool, United Kingdom(利物浦大学,利物浦,英国) University of New South Wales, New South Wales, Australia(新南威尔士大学,新南威尔士州,澳大利亚)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过PhoPile多模态数据集评估检索增强生成在奥林匹克级物理问题求解中的表现,探讨了基础模型结合检索与物理语料对性能提升的影响及存在的挑战。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12717 2026-04-15 cs.AI 57%

Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning

通过现实世界案例学习实现自主代理的可迁移专业技能

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Letian Yang, Xukai Jiang

机构 * National Glycoengineering Research Center, Shandong University(山东大学糖工程研究中心) State Key Laboratory of Microbial Technology, Shandong University(山东省微生物技术重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于案例学习的框架,通过将过往任务经验转化为可重用的知识资产,使自主代理能迁移先前经验以执行更结构化的分析,在六个复杂任务类别基准测试中表现优异,尤其在复杂任务上优势显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12506 2026-04-15 cs.CL cs.SD 57%

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

超越转录:面向感知意识的统一音频架构

Linhao Zhang, Yuhan Song, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

机构 * Basic Model Technology Center, WeChat AI, Tencent Inc.(腾讯基本模型技术中心、微信AI、腾讯公司) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室、计算机学院、北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出统一音频架构(UAS),通过将音频信息划分为转录、语调和非语言事件三个组件,提升音频细粒度感知性能,同时保持推理能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12461 2026-04-15 cs.AI 57%

CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems

CIA:从基于大语言模型的多智能体系统推断通信拓扑

Yongxuan Wu, Xixun Lin, He Zhang, Nan Sun, Kun Wang, Chuan Zhou, Shirui Pan, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了基于大语言模型的多智能体系统通信拓扑在黑盒环境下被推断的隐私风险,提出CIA攻击方法,通过构建对抗性查询和全局偏差解耦技术,验证了攻击的有效性。

Comments ACL 2026, Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12421 2026-04-15 cs.CL 57%

Agentic Insight Generation in VSM Simulations

代理洞察生成在价值流图模拟中的应用

Micha Selak, Dirk Krechel, Adrian Ulges, Sven Spieckermann, Niklas Stoehr, Andreas Loehr

机构 * RheinMain University of Applied Sciences(莱茵美因应用科学大学) SimPlan AG(SimPlan公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种分步代理架构,通过分离协调与数据分析,利用领域专家知识进行渐进数据发现,提升复杂价值流图模拟中提取可操作洞察的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 57%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 50%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11327 2026-04-15 cs.MA 50%

Can Small Agents Collaborate to Beat a Single Large Language Model?

小型智能体能否协同击败单一大型语言模型?

Agata Żywot, Xinyi Chen, Yifei Yuan, Anders Søgaard, Maarten de Rijke

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究通过对比小型多智能体系统与大型单智能体模型,发现多智能体协作在多步骤推理和工具使用任务中表现更优,尤其 orchestrator 的能力主导整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 26 篇

2604.12748 2026-04-15 cs.CL 92%

Generating Effective CoT Traces for Mitigating Causal Hallucination

生成有效的CoT轨迹以缓解因果幻觉

Yiheng Zhao, Jun Yan

机构 * Concordia University(康科迪亚大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究了生成有效CoT轨迹以缓解小模型因果幻觉的问题,设计了生成管道并提出新的量化指标CHR,实验表明生成的CoT轨迹能有效减少幻觉并提升准确性。

Comments 11 pages, 2 figures. Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16154 2026-04-15 cs.CL cs.AI 88%

AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought

AdaMCoT:通过自适应多语言链式思考重新思考跨语言事实推理

Weihua Zheng, Xin Huang, Zhengyuan Liu, Tarun Kumar Vangani, Bowei Zou, Xiyan Tao, Yuhao Wu, Ai Ti Aw, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdaMCOT框架,通过动态路由中间'思考语言'中的推理过程提升多语言事实推理能力,实验表明在低资源语言中表现显著提升。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12201 2026-04-15 cs.IR 87%

AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning

AdversarialCoT:单文档检索污染用于LLM推理

Hongru Song, Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Maarten de Rijke, Yixing Fan, Xueqi Cheng

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 研究针对RAG系统中的知识库污染攻击,提出AdversarialCoT方法,通过单文档污染影响LLM推理,揭示其安全风险并提供改进方案。

Comments 6 pages,accepted by SIGIR 2026 short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00412 2026-04-15 cs.CR cs.AI 85%

Red Teaming Large Reasoning Models

对大型推理模型进行红队测试

Jiawei Chen, Yang Yang, Chao Yu, Yu Tian, Zhi Cao, Xue Yang, Linghao Li, Hang Su, Zhaoxia Yin

机构 * Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University(上海多维信息处理关键实验室,东华大学) Zhongguancun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Dept. of Comp. Sci. and Tech., THBI Lab, Tsinghua University(计算机科学与技术系,清华THBI实验室) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出RT-LRM基准,评估大型推理模型的可信度,揭示其在面对推理风险时的脆弱性,并发布工具箱支持未来研究。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12379 2026-04-15 cs.SE cs.AI cs.LG 81%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 81%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07595 2026-04-15 cs.AI cs.CL 81%

Reasoning Graphs: Self-Improving, Deterministic RAG through Evidence-Centric Feedback

推理图:通过以证据为中心的反馈实现自我改进的确定性RAG

Matthew Penaroza

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出推理图,通过证据中心反馈提升RAG的准确性和确定性,实验显示在50%以上的证据覆盖下,错误率降低47%,在多跳问题中准确率提升11.0个百分点,实现高重用场景下的性能优势。

Comments 15 pages including appendix, 2 figures, 3 algorithms, framework paper with evaluation protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10291 2026-04-15 cs.AI 79%

TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale

时间序列考试代理:大规模创建时间序列推理基准测试

Malgorzata Gwiazda, Yifu Cai, Mononito Goswami, Arjun Choudhry, Artur Dubrawski

机构 * Technical University of Munich(慕尼黑技术大学) Auton Lab, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院自主实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TimeSeriesExamAgent,通过模板灵活性与LLM代理创造力结合,创建涵盖医疗、金融和天气领域的综合性时间序列推理基准测试,验证LLM在时间序列理解上的能力与局限。

Journal ref Proc. Int. Conf. Learn. Representations ICLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05404 2026-04-15 cs.PF cs.SE 79%

Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning

超越准确性:揭示工具集成推理中的低效模式

Qisheng Su, Shiting Huang, Zhen Fang, Ziyan Chen, Zehui Chen, Feng Zhao

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出PTE指标,用于衡量工具集成推理的效率,揭示了低效模式,并发现高PTE成本与推理正确性下降相关。

Comments Accepted at ACL 2026. Code: https://github.com/sqs-ustc/tool-reasoning-framework-PTE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 78%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19737 2026-04-15 econ.TH 78%

Reasoning about Bounded Reasoning

关于有界推理的推理

Shuige Liu, Gabriel Ziegler

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出统一框架区分玩家类型与推理深度,分析了三种基准实例,为经典level-k和认知层次模型提供新的解释基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28325 2026-04-15 cs.CE cs.AI 74%

Building evidence-based knowledge bases from full-text literature for disease-specific biomedical reasoning

从全文文献构建基于证据的知识库以支持疾病特定的生物医学推理

Chang Zong, Sicheng Lv, Si-tu Xue, Huilin Zheng, Jian Wan, Lei Zhang

机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) Institute of Medicinal Biotechnology, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院药物生物技术研究所) Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology(浙江省生物医学智能计算技术重点实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出EvidenceNet,一个基于全文文献构建的疾病特定知识库,通过大语言模型提取实验支持的结构化证据记录,用于生物医学推理任务。

Comments 30 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05795 2026-04-15 cs.CL 70%

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation

衡量重要性!!评估心理健康对话中的治疗原则

Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md Shad Akhtar

机构 * IIIT Delhi(印度德里理工学院) MBZUAI(马尔科姆·比尔人工智能研究所) Wysa

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出CARE框架,通过多阶段方法评估AI生成的治疗回应是否符合临床标准,实验显示其在F-1分数上优于基线模型,展示了结构化推理和上下文建模的重要性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 70%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11970 2026-04-15 cs.CV cs.AI cs.CL cs.LG 67%

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) Punjabi University(旁遮普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12659 2026-04-15 cs.LG cs.CL 62%

Do VLMs Truly "Read" Candlesticks? A Multi-Scale Benchmark for Visual Stock Price Forecasting

视觉语言模型真的能‘解读’K线图吗?一种多尺度的视觉股票价格预测基准

Kaiqi Hu, Linda Xiao, Shiyue Xu, Ziyi Tang, Mingwen Liu

机构 * University of Leeds(利兹大学) Sun Yat-sen University(中山大学) Likelihood Lab(Likelihood实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多尺度K线图基准,评估视觉语言模型对多尺度视觉市场动态的理解能力,发现大多数模型在持续上涨或下跌时表现良好,但在常见市场场景中预测能力较弱。

Comments We evaluate whether VLMs can comprehend multi-scale visual stock price data like human analysts with a proposed benchmark, identifying current VLMs' weak predictive power, significant biases, and limited sensitivity to forecast horizons and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12015 2026-04-15 cs.LG cs.CL 62%

UCS: Estimating Unseen Coverage for Improved In-Context Learning

UCS:用于改进上下文学习的未见覆盖估计

Jiayi Xin, Xiang Li, Evan Qiang, Weiqing He, Tianqi Shang, Weijie J. Su, Qi Long

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 UCS通过基于覆盖的免训练方法改进上下文学习,通过诱导离散潜在聚类和估计候选子集中的未揭示聚类数量,提升模型性能。

Comments ACL 2026 Findings; 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20635 2026-04-15 cs.CL cs.AI 62%

Why Did Apple Fall: Evaluating Curiosity in Large Language Models

苹果为何坠落:评估大语言模型中的好奇心

Haoyu Wang, Sihang Jiang, Yuyan Chen, Xiaojun Meng, Jiansheng Wei, Yitong Wang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文基于人类好奇心评估量表,设计评估框架,发现大语言模型对知识有更强的渴求,但在不确定环境中仍保守,好奇心可提升推理与学习能力。

Comments ACL 2026 findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15552 2026-04-15 cs.CL cs.AI 62%

Think Parallax: Solving Multi-Hop Problems via Multi-View Knowledge-Graph-Based Retrieval-Augmented Generation

Think Parallax: 通过多视图知识图谱基于检索增强生成解决多跳问题

Jinliang Liu, Jiale Bai, Shaoning Zeng

机构 * Yangtze Delta Region Institute (Huzhou), University of Electronic Science and Technology of China(长江三角洲地区研究院(湖州),电子科学与技术大学) School of Information and Software Engineering, University of Electronic Science and Technology of China(信息与软件工程学院,电子科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ParallaxRAG框架,通过多视图知识图谱检索增强生成解决多跳推理问题,改进多跳推理的结构,提升检索和问答性能,减少幻觉并增强生物医学领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 57%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏