arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-15 至 2026-07-15 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 2 篇

2607.12733 2026-07-15 cs.AI cs.LG 新提交 81%

LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos

大语言模型能看到烟雾却看不到火焰:用Elenchos评估溯因推理

Julius Steiglechner, Lucas Mahler, Gabriele Lohmann

机构 * Max-Planck-Institute for Biological Cybernetics(马克斯·普朗克生物控制论研究所) University Hospital Tübingen(图宾根大学医院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型的溯因推理能力,引入Elenchos评估框架,通过给定形式系统及变异对应物,让智能体判断变异并推断规则修改,发现模型存在检测-归因分离问题,相互作用变异下性能降,推理时间收益递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12650 2026-07-15 cs.LG cs.AI cs.CY cs.SE 新提交 81%

Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs

基于证据的可验证智能推理:通过工具验证内核证明消除经验推理中语言模型幻觉的途径

Junyu Ren

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在消除语言模型经验推理中的幻觉,提出基于Lean 4的EG-VAR工具调用架构,通过工具验证公理等生成可验证声明,经实验在数值推理等测试中表现良好,定位为高风险经验声明的技术治理接口,可审计相关条件并转化错误为审计目标。

Comments Accepted at the ICML 2026 TAIGR workshop. System name: EG-VAR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 1 篇

2607.12042 2026-07-15 cs.CV cs.LG 新提交 57%

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 6 篇

2607.12370 2026-07-15 cs.RO 新提交 67%

StratMamba: Strategic and Reactive Stream Partitioning for Path-Efficient LiDAR-Based Obstacle Avoidance

StratMamba:用于基于路径高效的激光雷达避障的策略性和反应性流划分

Hung-Chieh Wu, Xiaopan Zhang, Kasra Sinaei, Ryan Abnavi, Kasun Weerakoon, Christopher Bradley, Seyed Fakoorian, Jiachen Li, Donald Ebeigbe

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AlphaZ, Inc.(阿尔法兹公司) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究针对复杂环境中机器人导航问题,提出StratMamba双流时间建模架构,结合快慢衰减内存架构处理激光雷达数据。经多场景评估及与其他基线对比,其在时间推理效率、导航速度和路径最优性方面表现出色,在现实中性能更稳健。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 6 figures. Video: https://www.youtube.com/watch?v=Z0FfO_AVaSw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11949 2026-07-15 eess.IV cs.AI 新提交 57%

BAT-RM: A Boundary-Aware Transformer with Region-Aware Multi-Directional Mamba for Clinically Deployed Cervical Cancer Radiotherapy Auto-Contouring

BAT-RM:一种用于临床部署的宫颈癌放疗自动轮廓勾画的具有区域感知多向曼巴的边界感知变换器

Istiak Ahmed, Kazi Shahriar Sanjid, Galib Ahmed, Md. Tanzim Hossain, Md. Anwarul Islam, Shahrukh Khan, Md. Ashrif Rahman Arian, Md. Nishan Khan, Md. Misbah Khan, S M Hasibul Hoque, Rahnuma Shahrin Rista, Md. Jobairul Islam, Sheikh Anisul Haque, Md Arifur Rahman, Syed Md. Akram Hussain, Syeda Nashra, Sayeed Shafayet Chowdhury, Md. Mostafa Kamal Sarker, M. Monir Uddin

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对宫颈癌放疗自动轮廓勾画问题,提出BAT-RM混合架构,集成多种技术。该架构在多机构数据实验中性能卓越,提升了初级肿瘤学家的交并比并减少轮廓勾画时间,临床部署后缩短患者等待时间,体现了严格研究流程对患者的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12662 2026-07-15 cs.AI cs.MA cs.SY eess.SY 新提交 57%

Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration

智能物联网络:用于闭环物联网编排的联网人工智能代理

Quanyan Zhu

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 介绍智能物联网络(IoAT)架构框架,它集成多种技术成统一闭环编排框架,由多层通过自主AI代理连接,用半形动态规划框架形式化问题,以智能建筑编排为例,还讨论了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12051 2026-07-15 cs.CL 新提交 57%

Agentic systems for breast cancer treatment recommendations

用于乳腺癌治疗建议的智能体系统

Vinicius Anjos de Almeida, Nícolas Henrique Borges, Leonardo Vicenzi, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira Ribeiro, Lucas Emanuel Silva e Oliveira

机构 * Spesia(斯佩西亚) Faculdade de Medicina, Universidade de São Paulo(圣保罗大学医学院) Laboratory of Artificial Intelligence Applied to Bioinformatics, SEPT, Universidade Federal do Paraná (UFPR)(巴拉那联邦大学人工智能应用于生物信息学实验室,SEPT) Pontifícia Universidade Católica do Paraná (PUCPR)(巴拉那天主大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究评估用于乳腺癌治疗建议的智能体LLM系统,用72个真实临床病例和1147个特定病例量表,比较七种流程,最佳配置全局得分为0.594±0.025,工具使用和智能体自主性影响各异,虽能生成相关建议,但用于无监督临床使用仍不足。

Comments Under peer review. Source code available at: https://github.com/GRUPOMED4U/breast_cancer_agents_paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11913 2026-07-15 cs.NE cs.AI 新提交 57%

Towards Self-Evolving Agents: A Human-Inspired Adaptive Exploration-Exploitation Framework for Genetic Network Programming

迈向自我进化智能体:一种受人类启发的遗传网络编程自适应探索-利用框架

Ali Kohan, Mohamad Roshanzamir, Roohallah Alizadehsani, Seyedali Mirjalili

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究受人类发育模式启发,提出人类启发的遗传网络编程(HGNP)框架,通过新型自适应交叉、变异算子及循环消除机制,动态调节遗传网络编程中探索与利用的平衡,提升了智能体策略性能,且可应用于多种GNP变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12222 2026-07-15 eess.SY cs.SY 新提交 50%

A Hierarchical Semi-Markov Load Model for AI Data Centers Coupling Job Scheduling with Bulk-Synchronous-Parallel Power Dynamics

用于人工智能数据中心的分层半马尔可夫负载模型:将作业调度与批量同步并行功率动态相结合

Chandan Chaudhary, Atri Bera, Cody Newlun, Mohammed Ben-Idris, Joydeep Mitra

专题命中 规划推理 :planning(abstract)

AI总结 研究人工智能数据中心负载模型,提出分层半马尔可夫数据中心(HSM-DC)负载模型,该模型在两个时间尺度上耦合两层,能匹配平均功率、分布及峰均比等,强调电网规划需考虑作业到达和调度过程。

Comments Submitted to 2026 CIGRE Grid of the Future Symposium, October 26-29, 2026 in Richmond, Virginia

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 4 篇

2607.12680 2026-07-15 cs.CV 新提交 85%

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

ReflectVLN:通过反思推理训练视觉语言导航智能体

Jiahang Wang, Yirong Yang, Yanqing Zhu, Minghua Luo, Shichao Xie, Fei Liu, Mu Xu

机构 * Amap, Alibaba Group(高德软件有限公司,阿里巴巴集团) Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(title);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 研究针对现有视觉语言导航方法缺乏闭环机制问题,提出ReflectVLN框架,通过双向交互智能体决策,引入行动思维链训练方案,实验证明该框架在有限数据下提升成功率和路径效率,且具良好训练成本与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12177 2026-07-15 cs.AI cs.CV 新提交 79%

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

地理空间基础模型的新兴范式:从预训练到智能推理

Shelley Cazares

机构 * Google Public Sector(谷歌公共部门)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。

Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12319 2026-07-15 cs.CV 新提交 67%

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery

DM-KG:一种提升街景图像中视觉语言模型空间认知的新方法

Xinyue Xu, Zheng Zhang, Kunyang Ma, Ge Zhu, Lianshuai Cao, Lei Wang, Zixuan Li, Yi Cheng

机构 * Institute of Surveying and Mapping, Information Engineering University(信息工程大学测绘学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 研究针对视觉语言模型在街景图像空间认知方面的不足,提出DM-KG框架,通过提取实体关系、结合全景分割与深度估计计算坐标并编码知识图,有效提升模型空间推理准确性,降低误差,为地理视觉问答提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 50%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 4 篇

2607.12856 2026-07-15 cs.LG 新提交 88%

Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

基于验证器的热能存储控制推理模型强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title);planning(abstract);分类 cs.LG

AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12455 2026-07-15 cs.AI cs.CE 新提交 79%

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化

Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI Research(悖论人工智能研究)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12605 2026-07-15 cs.SE cs.AI 新提交 57%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12422 2026-07-15 cs.AI 新提交 57%

Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

接受前缀并非全部所需:基于PEFT的块扩散草稿生成的负面结果

Abdurrahman Javat, Allan Kazakov

机构 * Bahçeşehir University(巴赫切希尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究基于PEFT - BD的推测性解码方法,虽有避免分词器不匹配等优点,但在Qwen3 - 0.6B实验中未实现实际加速,因草稿生成器计算不高效。结果表明成功推测性解码需草稿生成器执行成本远低于验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 3 篇

2607.12634 2026-07-15 cs.AI 新提交 57%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11890 2026-07-15 cs.CY cs.AI 新提交 57%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12621 2026-07-15 cs.CV cs.IR 新提交 50%

Towards Vision-Free CIR: Attribute-Augmented Scoring and LLM-Based Reranking for Zero-Shot Composed Image Retrieval

迈向无视觉的合成图像检索:基于属性增强评分和基于大语言模型的重排的零样本合成图像检索

Ryotaro Shimada, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

机构 * The University of Tokyo(东京大学) Kioxia Corporation(铠侠株式会社)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究如何让无视觉方法有效处理合成图像检索任务,通过属性增强混合评分和基于大语言模型的重排两项关键技术构建框架,在开放域CIRR数据集实验中优于现有零样本方法,在FashionIQ上凸显语义推理与视觉匹配权衡,消融研究验证技术有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 13 篇

2607.12480 2026-07-15 cs.AI 新提交 83%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 82%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11892 2026-07-15 cs.CL cs.AI 新提交 81%

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交 79%

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 78%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13034 2026-07-15 cs.AI cs.CL cs.SE cs.SY eess.SY 新提交 77%

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行

Junjie Yin, Xinyu Feng

专题命中 推理评测 :reasoning(title,comments);分类 cs.CL、cs.AI

AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。

Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12058 2026-07-15 cs.SE cs.AI cs.CR 新提交 70%

AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration

AutoTrace:通过智能过程间探索从补丁到触发器

Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究针对修复漏洞提交的触发器定位难题,提出AutoTrace智能管道逐层探索代码属性图定位漏洞触发器,并构建SinkTrace - Bench数据集。AutoTrace在基准测试中表现出色,还揭示了前沿语言模型在因果推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12215 2026-07-15 cs.CL cs.LG cs.MA 新提交 62%

Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives

用于在生活叙事中检测大五人格的微调多智能体框架

Rasiq Hussain, Darshil Italiya, Joshua Oltmanns, Mehak Gupta

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究旨在从文本中准确评估人格,提出微调多智能体框架,通过掩码语言建模和心理测量监督让子智能体针对特质采用不同视角,评判大语言模型生成预测,经实验验证该方法可扩展且可解释,突出多智能体推理优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 62%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12739 2026-07-15 cs.CL 新提交 57%

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

认知立场灵活性探测:测量大语言模型中提示条件下的语域转换

Binwen Liu, Yilin Ren

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。

详情

展开后加载摘要…

URL PDF HTML 收藏