arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-27 至 2026-07-27 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2602.13935 2026-07-27 cs.AI cs.LG stat.ML 版本更新 84%

Statistical Early Stopping for Reasoning Models

统计早停法用于推理模型

Yangxinyu Xie, Tao Wang, Soham Mallick, Yan Sun, Georgy Noarov, Mengxin Yu, Tanwi Mallick, Edgar Dobriban

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22002 2026-07-27 cs.AI 新提交 83%

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

学习随推理展开:用于高效强化学习的渐进式展开分配

Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17770 2026-07-27 cs.AI cs.CL 版本更新 81%

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

熵梯度反转:迈向大型推理模型的内部机制

Junyao Yang, Chen Qian, Kun Wang, Linfeng Zhang, Quanshi Zhang, Yong Liu, Dongrui Liu

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30789 2026-07-27 cs.LG cs.AI 版本更新 62%

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

小型模型是GRPO中策略级多样性的自然探索者

Yiran Xu, Yiming Ren, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang, Tianhe Wu, Junjie Wang, Yujiu Yang, Yu Qiao, Ruihang Chu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27618 2026-07-27 cs.AI cs.CY cs.HC cs.LG cs.SI 版本更新 62%

Math Education Digital Shadows for Investigating Learning with GenAI: Mathematics Performance, Anxiety, and Confidence in LLMs

数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现

Naomi Esposito, Anthony Tricarico, Luisa Porzio, Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21946 2026-07-27 cs.LG 新提交 57%

Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge

用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告

Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2606.17981 2026-07-27 cs.SE 版本更新 78%

Planning to Hammer: Difficulty-Aware Decomposition for Automating Rocq Proofs

规划锤击:面向自动化Rocq证明的难度感知分解

Ning Zhang, Nongyu Di, Zenan Li, Yuan Yao, Xiaoxing Ma

专题命中 代码与定理证明 :planning(title,abstract)

AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。

Comments 26 pages, 8 figures; submitted to OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20525 2026-07-27 cs.AI math.CO math.NT 交叉投稿 57%

Autonomous disproofs of the sum-product conjecture over $\mathbb R$ with GPT-5.5 Pro

使用GPT-5.5 Pro对实数上的和积猜想进行自主反证

Yichen Huang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文借助GPT-5.5 Pro构建智能体,通过三阶段提示管道,对实数上的和积猜想进行自主反证,8次试验中7次成功生成正确证明,每次试验平均用132.4k推理令牌,还发布相关内容供重现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2607.21933 2026-07-27 cs.AI 新提交 88%

Semiotic logical hexagon theory for LLM logical reasoning

用于大语言模型逻辑推理的符号逻辑六边形理论

Yunyao Zhang, Xinglang Zhang, Zeliang Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19738 2026-07-27 cs.AI cs.LO cs.PL 版本更新 79%

Integrating Reasoning Systems for Trustworthy AI, Proceedings of the 4th Workshop on Logic and Practice of Programming (LPOP)

用于可信人工智能的推理系统集成,第4届编程逻辑与实践研讨会(LPOP)会议录

Anil Nerode, Yanhong A. Liu

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 第4届编程逻辑与实践研讨会聚焦于可信人工智能的推理系统集成,将与第40届国际逻辑编程会议联合于2024年10月13日在美国达拉斯以混合形式举行,重点是集成不同编程模型与规则和约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21850 2026-07-27 cs.CV cs.AI 新提交 57%

SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes

SCALE:用于先进节点局部布局与布线设计规则违规修复的自监督约束感知布局生成

Chia-Tung Ho, Haoyu Yang, Guanglei Zhou, Yoshi Nishi, Yaguang Li, Walker Turner, Cunxi Yu, Yiran Chen, Brucek Khailany

机构 * NVIDIA(英伟达) Duke University(杜克大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对先进节点局部P&R DRV修复难题,提出SCALE框架,通过自监督布局生成、利用自然语言规则约束和高温采样等方法,生成DRC注释布局违规对微调DRC-VLM,有效提升了最先进代理的修复解决率。

Comments 8 pages, 5 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21461 2026-07-27 cs.AI 版本更新 57%

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:迈向深度研究的递归自我改进智能体

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Jianlyu Chen, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13731 2026-07-27 cs.SC cs.LG 版本更新 57%

Breaking the Data Barrier in Learning Symbolic Computation: A Case Study on Variable Ordering Suggestion for Cylindrical Algebraic Decomposition

突破学习符号计算的数据障碍:变量顺序建议的圆柱代数分解案例研究

Rui-Juan Jing, Yuegang Zhao, Changbo Chen

机构 * School of Mathematical Sciences, Jiangsu University(江苏大学数学科学学院) Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究通过预训练和微调Transformer模型,改进了圆柱代数分解中变量顺序建议的效率,提升了符号计算的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08951 2026-07-27 cs.AI cs.CY 版本更新 57%

Analyzing the Ethical Logic of Eight Large Language Models

分析八个大语言模型的伦理逻辑

W. Russell Neuman, Chad Coleman, Manan Shah

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2607.22016 2026-07-27 cs.CV cs.AI 新提交 89%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 规划推理 :CoT(title,summary_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21906 2026-07-27 physics.soc-ph 新提交 82%

A Knowledge-Grounded Behavioral Reasoning Framework for Training-Free Urban Healthcare OD Prediction

一种用于无训练城市医疗保健 OD 预测的知识驱动行为推理框架

Linzhen Yang, Xueliang Liu, Chengbo Zhang, Meng Meng

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究城市医疗保健 OD 预测问题,提出基于知识驱动行为推理的无训练框架,将异构城市信息组织成知识图谱,通过多智能体推理实现预测。实验表明该框架性能优于传统深度学习基线,凸显城市智能在医疗保健出行建模上从数据拟合到知识驱动推理的潜力。

Comments 16 pages, 9 figures. Submitted to the 4th International Conference on Urban Science and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22166 2026-07-27 cs.RO cs.AI 新提交 79%

Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability

学习时空决策先验以实现部分可观测性下的高效路径规划

Yi Liu, Hongda Zhang, Leyao Zou, Chunlei Meng, Ziqing Zhou, Yuning Chen, Zhuo Zou, Lida Xu, Zhongxue Gan, Chun Ouyang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学) Department of Information Technology, Old Dominion University(信息技术系,老 Dominion 大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究部分可观测性下的路径规划问题,提出ImiPath框架,从示范轨迹提炼时空决策先验,经局部时空观测表示和时空注意力策略网络转换为决策先验并纳入异构规划器,提升路径质量与搜索效率,验证了框架的适应性和实际部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-07-27 cs.CL cs.AI 新提交 79%

Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22182 2026-07-27 cs.CL cs.AI 新提交 73%

From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models

从孤立任务到结构化能力:大语言模型的多层分类法

Shixin Fang, Jiachen Wo, Wenjuan Qin, Sihang Jiang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。

Comments 34 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02024 2026-07-27 cs.AI 版本更新 70%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21857 2026-07-27 cs.SD 新提交 67%

SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

SoundscapeAgent:用于可控合成和可扩展音频-语言监督的智能音景构建

Hao Zhang, Yiwen Zhao, Yixuan Zhang, Yiwen Shao, Steve Yves

机构 * Tencent(腾讯)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出智能音景构建框架SoundscapeAgent,基于大语言模型的智能体将用户意图转化为场景计划,经多步骤实现可控音频合成与可扩展音频-语言数据构建,在生成性能及下游音频推理方面表现出色。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21725 2026-07-27 cs.RO 新提交 67%

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

通过物理智能解决通用机器人中的编排差距

Liane Galanti, Dhruv Shah, Tri Dao

机构 * Princeton University(普林斯顿大学) Together AI(联合人工智能)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03534 2026-07-27 cs.CL cs.IR cs.LG 版本更新 62%

SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation

SURE-RAG:用于选择性检索增强生成的充分性和不确定性感知证据验证

Jingxi Qiu, Zeyu Han, Cheng Huang

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究选择性检索增强生成的证据充分性验证问题,提出SURE-RAG聚合协议,通过共享验证器生成局部关系分布并聚合为特征块,产生三向决策和可审计分数,实验表明其性能优于多种方法,还对比了与GPT-4o在不同任务上的表现。

Comments 8 pages, 2 figures, 8 tables. Submitted to IEEE PRAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21613 2026-07-27 cs.AI cs.CL 新提交 62%

The Hard Decision Layer: Evidence for Committed Inference in Transformers

硬决策层:Transformer中确定推理的证据

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究基于Transformer的语言模型在多选型问答中做预测的位置与方式,识别出硬决策层,经多模型和数据集验证其在无学习路由策略时一致出现且对微调不变,HDL处准确率显著提升,为Transformer推理提供见解与机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 62%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新 62%

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 62%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22400 2026-07-27 cs.NI cs.AI 新提交 57%

A Self-Calibrating Agentic AI Framework for Autonomous Edge Resource Allocation

一种用于自主边缘资源分配的自校准智能体人工智能框架

Fin Gentzen, Marla Grunewald, Iulisloi Zacarias, Mounir Bensalem, Admela Jukan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型驱动系统运行可靠性受挑战的问题,提出自校准智能体人工智能框架,设计自校准机制,应用于边缘计算网络零知识工作负载资源分析,提高预测准确率和速度,为自主人工智能部署奠定基础,且生成基本事实速度更快。

Comments This work has been submitted to the IEEE Transactions on Network and Service Management for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21835 2026-07-27 cs.CR cs.AI 新提交 57%

ToolGuardian: Declarative Security for AI Agent-Tool Interactions

ToolGuardian:人工智能代理与工具交互的声明式安全

Arun Ravindran, Saurabh Deochake

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究人工智能代理与工具交互安全问题,提出ToolGuardian框架,通过预准入审查和任务感知运行时授权保障安全,利用渐进式特征化和基于ASP的声明式策略层,实验表明该框架在审查和授权方面性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21609 2026-07-27 cs.AI 新提交 57%

Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis

用于智能工作流合成的拓扑与执行耦合分层搜索

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国NEC实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏