arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4066 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 880 篇

2607.08778 2026-07-13 cs.LG cs.AI 新提交 62%

iLENS: Interpretable LLM-Guided Mixture-of-Experts for Neuroimaging Survival Analysis

iLENS:用于神经影像生存分析的可解释大语言模型引导的专家混合模型

Farica Zhuang, Seong Woo Han, Zixuan Wen, Shu Yang, Yize Zhao, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对阿尔茨海默病前驱期转化预测问题,提出iLENS框架,基于专家混合模型,利用大语言模型合成信息指导专家路由,具备竞争力的预测性能,能为决策提供透明且基于生物学的原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08400 2026-07-10 cs.CR cs.AI cs.LG 新提交 62%

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

TRACE:一种通过互补嵌入实现的用于大语言模型智能体轨迹的双通道鲁棒归属水印

Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织(CSIRO)的数据61)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体轨迹归属水印易被经销商攻击的问题,提出TRACE方法,通过互补嵌入构建双通道水印,包括基于局部内容的选择通道和基于日志框架的计数通道,实验表明该方法能保证水印鲁棒性,保持智能体成功率且检测分数高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交 62%

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03394 2026-07-07 cs.AI cs.CY cs.LG 新提交 62%

From Mobile Data to Business Insights: An End-to-End Analytics Framework for Large-Scale Urban Mobility Analysis and Decision Support

从移动数据到商业洞察:用于大规模城市交通分析和决策支持的端到端分析框架

Thiago Andrade, Shazia Tabassum, Miguel E. P. Silva, Ricardo Dinis, Joao Gama

机构 * LIAAD INESC-TEC Mobile Network Analytics NOS SGPS

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过调查城市环境中智能手机用户行为模式应对多领域挑战。开发数据平台,采用先进技术,构建模块化架构,应用可视化技术,模型可处理多种交通分析任务,为城市规划和商业决策提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16428 2026-07-07 cs.CL cs.AI cs.HC 新提交 62%

LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

LectūraAgents:面向自适应个性化AI辅助学习与具身教学的多智能体框架

Jaward Sesay, Yue Yu, Siwei Dong, Börje F. Karlsson

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Cornell University(康奈尔大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出LectūraAgents多智能体框架,通过层次化架构和自适应具身教学机制(如手势、高亮等)实现端到端个性化学习,并设计教学动作-语音对齐算法提升连贯性,在多个课程级别上优于现有方法。

Comments LecturaAgents TR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02345 2026-07-03 cs.SE cs.AI cs.CL 新提交 62%

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01179 2026-07-02 cs.LG cs.CL 新提交 62%

QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling

QuasiMoTTo: 准蒙特卡洛测试时扩展

Michael Y. Li, Anthony Zhan, Kanishk Gandhi, Noah D. Goodman, Emily B. Fox

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出QuasiMoTTo方法,利用准蒙特卡洛相关采样替代独立同分布采样,在推理和强化学习中减少冗余,以更少样本达到相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00871 2026-07-02 cs.AI cs.CL 新提交 62%

Self-Evolving Agents with Anytime-Valid Certificates

具有任意时间有效证书的自我进化智能体

Biswa Sengupta

机构 * LLM Suite Team, JPMorgan Chase & Co.(摩根大通LLM Suite团队)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出SEA架构,通过冻结基础模型和任意时间有效门控机制,在固定错误预算内实现可控自我修改,在SWE-bench验证集上提升性能并防止退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26969 2026-06-26 cs.AI cs.CL cs.CV 新提交 62%

Einstein World Models

爱因斯坦世界模型

Munachiso Samuel Nwadike, Zangir Iklassov, Ali Mekky, Zayd M. Kawakibi Zuhri, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP, Japan(日本理化学研究所革新智能综合研究中心) Tohoku University(东北大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出爱因斯坦世界模型(EWM),通过将视觉时间展开嵌入推理轨迹,使LLM能利用视觉化反事实事件增强复杂推理能力。

Comments 12 pages (9 without references), 2 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交 62%

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25532 2026-06-25 cs.AI cs.AR cs.LG cs.MA 新提交 62%

Agentic evolution of physically constrained foundation models

物理约束基础模型的智能体演化

Jiangwei Zhang, Wen Sun, Chong Wang, Shiyao Li, Cheng Che, Chunjing Han, Dan Meng, Jian Yang, Yu Wang, Rui Hou

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出基于演化知识图谱的多智能体发现引擎,自动设计硬件兼容计算系统,在基础模型部署中演化出超越人工的压缩方法,实现大规模模型高效部署。

Comments 29 pages, 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25451 2026-06-25 cs.LG cs.AI 新提交 62%

Learning with a Single Rollout via Monte Carlo Pass@k Critic

通过蒙特卡洛 Pass@k 评判器进行单次 rollout 学习

Fengdi Che, Yang Liu, Lei Yu, Meng Cao, Tong Che, Rupam Mahmood, Dale Schuurmans

机构 * University of Alberta(阿尔伯塔大学) BIGAI(北京通用人工智能研究院) University of Toronto(多伦多大学) McGill University, Mila(麦吉尔大学,米拉) Nvidia Research(英伟达研究院) Amii(阿尔伯塔机器智能研究所) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出单次 rollout 近端策略优化(SR-PPO),利用每个提示的一次 rollout 训练 token 级信用评判器,通过 Pass@k 成功概率提供更选择性学习信号,避免重复采样并改善信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24965 2026-06-25 cs.AI cs.LG 新提交 62%

Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

Project Auto-World: 迈向神经关系推理器的自动化基准测试

Anirban Das, Joanne Boisson, Irtaza Khalid, Sumita Garai, Steven Schockaert

机构 * Cardiff University(卡迪夫大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。

Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24047 2026-06-24 cs.AI cs.LG 新提交 62%

Ensemble Feature Selection and Harris Hawks Optimization for Explainable Mental Health Risk Prediction in Female Sex Workers

集成特征选择与哈里斯鹰优化用于女性性工作者可解释心理健康风险预测

Ahnaf Atef Choudhury, Md. Parvej Hoque Palash, Shahriar Siddique Ayon, Ramkrishna Saha, Abdullah Al Mamun

机构 * Department of Information Sciences and Technology(信息科学与技术系) George Mason University(乔治·马歇尔大学) Department of Computer Science and Engineering(计算机科学与工程系) Jahangirnagar University(贾汗吉尔纳加尔大学) AIUB The University of Texas at Dallas(德克萨斯大学达拉斯分校) Dhaka University of Engineering and Technology(达卡工程与技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出集成ANOVA和互信息的特征选择与哈里斯鹰优化逻辑回归的混合模型,在3005名女性性工作者中实现95.78%准确率,识别创伤后应激、客户暴力和职业因素为抑郁主要贡献因素。

Comments Accepted and presented at the 2026 8th IEEE Symposium on Computers & Informatics (ISCI 2026). To appear in IEEE conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交 62%

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23537 2026-06-23 cs.DB cs.AI cs.LG 新提交 62%

SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

SQLConductor:面向逐步文本到SQL编排的搜索到策略学习

Yizhang Zhu, Zhangyang Peng, Boyan Li, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出SQLConductor框架,通过搜索到策略学习将文本到SQL任务分解为动作序列,用蒙特卡洛树搜索探索工作流并训练策略模型逐步编排,在BIRD-Dev上达73.2%执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23412 2026-06-23 cs.CL cs.AI cs.SE 新提交 62%

UnBias-Plus: Detect, Explain, and Rewrite Bias

UnBias-Plus: 检测、解释和重写偏见

Ahmed Y. Radwan, Ahmed ElKady, Sindhuja Chaduvula, Mohamed Hafez, Amrit Krishnan, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出UnBias-Plus开源工具包,统一多类偏见分类、偏见片段定位、中性重写和决策推理,支持多种接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 62%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21121 2026-06-23 cs.AI cs.CL 新提交 62%

Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models

答案工程:面向大语言模型中协议约束决策的局部轨迹编辑

Victor Lavrenko, Anastasiia Molodnitskaia

机构 * PeaceTech VC Rambam Health Care Campus(拉姆巴姆医疗中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出答案工程方法,通过在自回归生成时对推理轨迹进行局部规则引导编辑,无需重训练或全局搜索,在突发性感觉神经性听力损失临床基准上将平衡准确率从42.0%提升至80.7%。

Comments 31 pages, 6 figures. Code and data: https://github.com/victorlavrenko/answer-engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20650 2026-06-23 cs.CL cs.AI cs.SD eess.AS 新提交 62%

EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis

EmoInstruct-TTS:双路径指令引导的情感语音合成

Minghui Wu, Ganjun Liu, Zikun Fang, Ting Meng, Hongchuan Wu, Bingao Xu, Yonglong Cai, Jiasheng Chen, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(科大讯飞研究院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出EmoInstruct-TTS双路径框架,通过情感嵌入和指令条件情感流模型实现细粒度情感控制,提升语音情感可控性和自然度。

Comments 5 pages, 3 figures, 4 tables. Submitted to Interspeech 2026. Audio demos: https://huanyu-lab.github.io/EMOINSTRUCT-TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20638 2026-06-23 cs.AI cs.LG 新提交 62%

RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents

RIZZ: 将交互路由到近零干扰区域以实现黑盒智能体的持续适应

Sonali Goel, Pranav Vaidhyanathan, Lucas Schorling, Natalia Ares, Maike Osborne

机构 * University of Oxford(牛津大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出RIZZ框架,通过验证器门控记忆、路由和提示编译,实现黑盒语言模型系统在非平稳流数据上的持续适应,有效控制干扰并提升性能。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23257 2026-06-23 cs.LG cs.AI math.OC 新提交 62%

Dynamic multi-agent deep reinforcement learning-based pricing and incentivization approach in multimodal transportation networks

基于动态多智能体深度强化学习的多模式交通网络定价与激励方法

Khadidja Kadem, Mostafa Ameli, Carlos Lima Azevedo, Mahdi Zargayouna, Latifa Oukhellou

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Denmark(丹麦技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出多智能体深度强化学习框架,通过动态定价和激励策略协调公共交通与共享出行服务,平衡效率、公平与收益,实验表明可降低通勤成本20%、排放10%并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16000 2026-06-18 cs.CL cs.LG 新提交 62%

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

GRACE-DS:数据科学中的受保护奖励引导智能体修正环境

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasiya Palienko

机构 * ITMO University(ITMO大学) HSE University(高等经济学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE-DS,一个用于评估LLM驱动的AutoML智能体在部署前性能的隔离环境,通过隐藏的可执行验证器衡量预测性能、泄漏避免、可重复性等指标,实验证明其灵活迭代交互模式优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17127 2026-06-17 q-bio.QM cs.AI cs.LG 新提交 62%

Agentic Discovery of Non-Canonical Antimicrobial Peptides with AMPGAN v3

AMPGAN v3 的非经典抗菌肽智能发现

Jay Jung, Xiaohan Zhang, Shenghan Song, Mahmoud Sayedahmed, Chijian Xiang, Yunong Xu, Ahmed AbdelKhalek, Severin T. Schneebeli, Matthew J. Wargo, Jianing Li, Safwan Wshah

机构 * University of Vermont(弗吉尼亚大学) Larner College of Medicine, University of Vermont(弗吉尼亚大学医学学院) Purdue University(普渡大学) Department of Comparative Pathobiology(比较病理科部门) Department of Horticulture and Landscape Architecture(园艺与景观建筑部门) Department of Industrial and Molecular Pharmaceutics(工业与分子药学部门)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出 AMPGAN v3,一种多目标条件 GAN,扩展生成词汇至 D-氨基酸和末端修饰,通过双判别器提升稳定性,体外验证显示对革兰氏阳性菌有活性,并引入 PepCraft 多智能体框架用于端到端发现。

Comments Presented at the GenBio Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16995 2026-06-16 cs.AI cs.LG 新提交 62%

When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning

存疑则计划:用于反应式强化学习的小型语言模型承诺式推理

Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues

机构 * University of São Paulo(圣保罗大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出PACT混合架构,结合快速反应式强化学习策略与慢速小型语言模型规划器,通过异步生成和验证候选动作计划来提升策略在陌生环境中的表现。

Comments LM4Plan Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16407 2026-06-16 cs.CL cs.LG 新提交 62%

A Mechanistic Understanding of Pronoun Fidelity in LLMs

对大型语言模型中代词忠实性的机制理解

Katharina Trinley, Jesujoba O. Alabi, Dietrich Klakow, Vagrant Gautam

机构 * Saarland University(萨尔大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 通过因果分析发现,代词忠实性由组实体绑定、近因偏差和刻板印象偏差三种因果子空间共同作用,解释了91-99.5%的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14157 2026-06-15 cs.LG cs.AI 新提交 62%

Learning Urban Access Costs from Origin-Destination Flows via Inverse Optimal Transport

通过逆最优传输从起点-终点流中学习城市访问成本

Paula Joy B. Martinez

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出逆最优传输模型从学校间入学流中恢复潜在选择成本,应用于菲律宾283,016条学生流动数据,估计补贴等效距离以优化城市服务分配。

Comments Oral Presentation. 2026 International Conference on Urban AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13904 2026-06-15 cs.CL cs.AI cs.DB 新提交 62%

SANA: What Matters for QA Agents over Massive Data Lakes?

SANA:大规模数据湖上的问答代理关键因素是什么?

Austin Senna Wijaya, Jiaxiang Liu, Haonan Wang, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出SANA诊断框架,通过消融实验分析数据湖探索式问答中搜索、规划、数据分析及行动策略的失败原因,揭示数据分析是主要瓶颈。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12818 2026-06-12 cs.CL cs.AI 新提交 62%

Localizing Anchoring Pathways in Language Models

定位语言模型中的锚定路径

Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提示中无关数字如何影响语言模型数值推理的锚定效应,通过logit差值度量和电路归因定位,发现边级方法优于节点级方法,并揭示锚定路径的共享与迁移特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12780 2026-06-12 cs.LG cs.CL 新提交 62%

ProPlay: Procedural World Models for Self-Evolving LLM Agents

ProPlay: 用于自我进化LLM智能体的程序化世界模型

Yijun Ma, Zehong Wang, Yiyang Li, Ziming Li, Xiaoguang Guo, Weixiang Sun, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出ProPlay程序化世界模型,通过程序级预演和因果过程图,使LLM智能体在部分可观测环境中自我进化,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏