arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-18 至 2026-03-18 共收录 139 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2603.16839 2026-03-18 cs.AI 85%

Learning to Present: Inverse Specification Rewards for Agentic Slide Generation

学习呈现:用于代理幻灯片生成的逆规范奖励

Karthik Ragunath Ananda Kumar, Subrahmanyam Arunachalam

机构 * Tavus Inc.(Tavus公司) University of Texas at Dallas(德克萨斯大学达拉斯分校) Texas A&M University(德克萨斯农工大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出一个兼容OpenEnv的强化学习环境,通过工具使用训练LLM代理生成专业HTML幻灯片,引入多组件奖励系统,包括结构验证、渲染质量评估、LLM审美评分、内容质量指标和逆规范奖励,实验显示细调模型在质量与工具使用合规性上表现优异。

Comments 12 pages, 11 figures, 13 tables, 26 references. Code: https://github.com/pushing-the-frontier/slide-forge-llm Dataset: https://huggingface.co/datasets/KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL 85%

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16335 2026-03-18 cs.LG cs.CL 79%

Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits

通过SAE解码探测向量在35B MoE语言模型中实现行为操控:一个代理轴,而非五个特质

Jia Qing Yap

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究通过训练九个稀疏自编码器识别并操控五个代理行为特质,发现所有向量主要调节单一主导代理轴,仅在工具使用等次要方面产生影响。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15916 2026-03-18 cs.LG cs.AI 73%

Auto Researching, not hyperparameter tuning: Convergence Analysis of 10,000 Experiments

自主研究而非超参数调优:10000次实验的收敛分析

Xiaoyi Li

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析10469次实验,发现架构选择对性能影响显著,超参数调整影响较小,展示了LLM在自主设计ML实验中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16664 2026-03-18 cs.CV cs.AI 70%

Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation

Kestrel: 为降低LVLM幻觉而引入自反思

Jiawei Mao, Hardy Chen, Haoqin Tu, Yuhan Wang, Letian Zhang, Zeyu Zheng, Huaxiu Yao, Zirui Wang, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 Kestrel提出一种无需训练的框架,通过显式视觉 grounding 与证据验证自反思机制减少LVLM幻觉,实验显示在POPE和MME-Hallucination基准上性能提升,同时提供透明的验证轨迹。

Comments 16 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05413 2026-03-18 cs.SD 67%

Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial

从零构建企业级实时语音代理:技术教程

Jielin Qiu, Zixiang Chen, Liangwei Yang, Ming Zhu, Zhiwei Liu, Juntao Tan, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 工具调用 :agent(abstract);function calling(abstract)

AI总结 本文介绍如何从零构建企业级实时语音代理,通过Deepgram、vLLM和ElevenLabs实现端到端流程,展示最佳实践与代码实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15653 2026-03-18 cs.CL cs.AI cs.LG 67%

Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context

递归语言模型与不确定性:自我反思程序搜索在长上下文中的意外效果

Keivan Alizadeh, Parshin Shojaee, Minsik Cho, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SRLM框架,通过引入不确定性感知的自我反思,提升长上下文处理能力,实验显示其在多种任务中优于现有基线,且无需递归机制。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16715 2026-03-18 cs.LG cond-mat.mtrl-sci 57%

Novelty-Driven Target-Space Discovery in Automated Electron and Scanning Probe Microscopy

基于新颖性的目标空间发现:自动化电子显微镜与扫描探针显微镜中的发现方法

Utkarsh Pratiush, Kamyar Barakati, Boris N. Slautin, Catherine C. Bodinger, Christopher D. Lowe, Brandi M. Cossairt, Sergei V. Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville(田纳西大学材料科学与工程系) Department of Chemistry, University of Washington, Seattle(华盛顿大学化学系) Pacific Northwest National Laboratory, Richland(太平洋西北国家实验室)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于新颖性的深度核学习框架,用于在自动化电子显微镜和扫描探针显微镜中主动探索目标空间,通过学习结构-性质关系来发现新的响应区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15298 2026-03-18 cs.SE cs.HC 57%

The Impact of AI-Assisted Development on Software Security: A Study of Gemini and Developer Experience

AI辅助开发对软件安全的影响:对Gemini和开发者经验的研究

Nadine Jost, Benjamin Berens, Manuel Karl, Stefan Albert Horstmann, Martin Johns, Alena Naiakshina

专题命中 工具调用 :tool use(abstract);分类 cs.SE

AI总结 研究探讨AI工具Gemini对代码安全的影响,发现编程经验显著提升安全性,无法完全被AI替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04439 2026-03-18 cs.LG 57%

RETRO SYNFLOW: Discrete Flow Matching for Accurate and Diverse Single-Step Retrosynthesis

RETRO SYNFLOW:用于准确且多样单步逆合成的离散流匹配

Robin Yadav, Qi Yan, Guy Wolf, Avishek Joey Bose, Renjie Liao

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文提出RETRO SYNFLOW框架,通过离散流匹配在目标分子与反应物间建立马尔可夫桥,提升单步逆合成的准确性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 44 篇

2601.09295 2026-03-18 cs.MA 89%

MACRO-LLM: LLM-Empowered Multi-Agent Collaborative Reasoning under Spatiotemporal Partial Observability

MACRO-LLM:基于时空部分可观测性的LLM赋能多智能体协作推理

Handi Chen, Running Zhao, Xiuzhe Wu, Edith C. H. Ngai

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)

AI总结 本文提出MACRO-LLM,通过三个模块解决多智能体在时空部分可观测性下的协作推理问题,验证了其在复杂任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20078 2026-03-18 cs.MA cs.AI cs.LG 88%

Descent-Guided Policy Gradient for Scalable Cooperative Multi-Agent Learning

基于下降引导的策略梯度方法用于可扩展的协作多智能体学习

Shan Yang, Yang Liu

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Descent-Guided Policy Gradient方法,通过利用可微解析模型降低梯度方差,实现协作多智能体学习的可扩展性,验证了在200个智能体任务中收敛性能。

Comments 10 pages, 5 figures, 5 tables; plus 16 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16777 2026-03-18 cs.AI 88%

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 规划决策 :planning(title,abstract);AI agent(title);tool-use(abstract);分类 cs.AI

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15663 2026-03-18 cs.CV cs.AI 88%

OrthoAI v2: From Single-Agent Segmentation to Dual-Agent Treatment Planning for Clear Aligners

OrthoAI v2:从单智能体分割到双智能体治疗计划的清晰矫治器

Lansiaux Edouard, Leman Margaux

机构 * STaR-AI Research Group, Emergency Department, Lille University Hospital(STaR-AI研究组,急诊科,里尔大学医院)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 OrthoAI v2通过双智能体框架提升正畸治疗计划精度,实现牙科地标检测、复合生物力学评分模型和多帧治疗模拟,显著提升规划质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15255 2026-03-18 cs.AI cs.MA 86%

SAGE: Multi-Agent Self-Evolution for LLM Reasoning

SAGE:多智能体自进化用于大语言模型推理

Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院,加拿大)

专题命中 规划决策 :agent(title);multi-agent(title);planning(abstract);分类 cs.AI

AI总结 SAGE通过四智能体协同进化提升LLM推理能力,利用小种子集实现稳定自训练,在数学和代码生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL 86%

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15900 2026-03-18 cs.NI cs.AI 85%

The Internet of Physical AI Agents: Interoperability, Longevity, and the Cost of Getting It Wrong

物理AI代理的互联网:互操作性、持久性与搞错的成本

Roberto Morabito, Mallik Tatipamula

机构 * EURECOM Ericsson Silicon Valley(爱立信硅谷)

专题命中 规划决策 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨物理AI代理的互联网发展,提出设计原则以构建可靠、可进化和可信的代理系统,强调互操作性、信任和进化作为首要需求,避免技术与经济成本。

Comments A related version of this work is currently under review for publication in an IEEE magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14730 2026-03-18 cs.LG 83%

GNNVerifier: Graph-based Verifier for LLM Task Planning

GNNVerifier:基于图的LLM任务规划验证器

Yu Hao, Qiuyu Wang, Cheng Yang, Yawen Li, Zhiqiang Zhang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出基于图的验证器,通过构建任务计划的图结构,利用图神经网络评估计划的合理性,从而纠正LLM生成的计划中的错误。

Comments 17pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06993 2026-03-18 cs.AI cs.CV 83%

IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence

IMAIA:交互式地图AI助手用于旅行规划和地理空间智能

Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang

机构 * Microsoft(微软) Amazon(亚马逊)

专题命中 规划决策 :planning(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23592 2026-03-18 cs.RO cs.AI cs.SE 81%

KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning

KEEP: 一种面向高效具身规划的KV缓存中心化内存管理系统

Zebin Yang, Tong Xie, Baotong Lu, Shaoshan Liu, Bo Yu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究院) Microsoft Research(微软研究院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出KEEP系统,通过静态动态内存构建算法、多跳内存重计算算法和层平衡内存加载,提升具身规划效率,实验表明在ALFRED数据集上速度提升2.68倍,优于CacheBlend方法。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25140 2026-03-18 cs.AI cs.CL 81%

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

ReasoningBank: 通过推理记忆扩展智能体自我进化

Siru Ouyang, Jun Yan, I-Hung Hsu, Yanfei Chen, Ke Jiang, Zifeng Wang, Rujun Han, Long T. Le, Samira Daruki, Xiangru Tang, Vishy Tirumalashetty, George Lee, Mahsan Rofouei, Hangfei Lin, Jiawei Han, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究) Yale University(耶鲁大学) Google Cloud AI(谷歌云人工智能)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。

Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15726 2026-03-18 cs.CL cs.AI cs.IR cs.LG 80%

MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification

MiroThinker-1.7 与 H1:通过验证实现重型研究代理

MiroMind Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, L. Wang, L. Wang, S. Wang, X. Wang, Y. Zhang, Z. Zhang, G. Chen, L. Chen, Z. Cheng, Y. Deng, Z. Huang, D. Ng, J. Ni, Q. Ren, X. Tang, B. L. Wang, H. Wang, N. Wang, C. Wei, Q. Wu, J. Xia, Y. Xiao, H. Xu, X. Xu, C. Xue, Z. Yang, Z. Yang, F. Ye, H. Ye, J. Yu, C. Zhang, W. Zhang, H. Zhao, P. Zhu

机构 * MiroMind Team(MiroMind团队)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出MiroThinker-1.7和H1,通过结构化规划和验证机制提升多步推理能力,在复杂任务中实现高效可靠的研究代理。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15643 2026-03-18 cs.AI 79%

GSI Agent: Domain Knowledge Enhancement for Large Language Models in Green Stormwater Infrastructure

GSI代理:面向绿色雨水基础设施的大语言模型领域知识增强

Shaohuang Wang

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出GSI代理,通过监督微调、检索增强生成和代理推理流程,提升大语言模型在绿色雨水基础设施任务中的领域知识能力,实验表明其在领域任务中的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16110 2026-03-18 cs.AI 79%

VIGIL: Towards Edge-Extended Agentic AI for Enterprise IT Support

VIGIL:迈向企业IT支持的边缘扩展代理AI

Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Vishaal Kapoor, Mariam Dundua, Yiming Li, Derek Ho, Vaibhavi Padala, Jennifer Whitted, Rebecca Steinert

机构 * Amazon Engine, AI Center of Excellence(亚马逊引擎,人工智能卓越中心)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 VIGIL通过在用户设备上部署桌面驻留代理,实现本地诊断、企业知识检索和政策驱动的修复,减少交互轮次,提升诊断速度,支持82%的自助解决,用户反馈显示透明度对信任至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI 79%

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16510 2026-03-18 cs.CG 78%

Minimum Exposure Motion Planning

最小暴露运动规划

Sarita de Berg, Joachim Gudmundsson, Peter Kramer, Christian Rieck, Sampson Wong

专题命中 规划决策 :planning(title,abstract)

AI总结 本文研究了平面中单位正方形机器人协调运动规划问题的多种变体,提出新的Min-Exposure目标函数,并给出了计算暴露最小调度的算法。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16028 2026-03-18 cs.RO 78%

Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning

几何对齐的LLM微调用于序列狭窄开口规划

Al Jaber Mahmud, Xuan Wang

机构 * George Mason University(乔治·马歇尔大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出几何对齐的LLM微调框架,通过多阶段狭窄开口序列规划实现长视距几何推理,采用失败驱动LoRA监督微调与GRPO优化提升路径可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15777 2026-03-18 cs.HC 78%

Lessons from Real-World Deployment of a Cognition-Preserving Writing Tool: Students Actively Engage with Critical Thinking and Planning Affordances

从真实世界部署认知保留写作工具中的经验:学生主动参与批判性思维和规划 affordances

Yinuo Yang, Zheng Zhang, Ningzhi Tang, Xu Wang, Alex Ambrose, Nathaniel Myers, Patrick Clauss, Toby Jia-Jun Li

专题命中 规划决策 :planning(title,abstract)

AI总结 本文研究了AI写作工具VISAR在真实课堂中的应用,发现学生通过认知保留支架获得学习提升,且与写作质量、概念理解及批判性AI素养正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16843 2026-03-18 cs.AI 77%

Internalizing Agency from Reflective Experience

从反思经验中内化代理性

Rui Ge, Yichao Fu, Yuyang Qian, Junda Su, Yiming Zhao, Peng Zhao, Hao Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Nanjing University(南京大学)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出LEAFE框架,通过反思经验内化恢复代理性,提升长周期任务中的问题解决能力,实验显示在Pass@k任务中优于传统方法。

Comments 17 pages, 5 figures; Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14440 2026-03-18 cs.AI cs.CL cs.LG 75%

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

VisTIRA: 通过结构化工具集成缩小图像-文本模态差距以提升视觉数学推理

Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 规划决策 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 VisTIRA通过结构化工具集成框架,解决图像形式数学问题的推理难题,改进视觉数学推理能力,实验表明工具监督和OCR定位能有效缩小模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏