arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2503.16252 2026-03-20 cs.CL 90%

Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning

Fin-R1:通过强化学习构建的金融推理大语言模型

Zhaowei Liu, Xin Guo, Zhi Yang, Fangqi Lou, Lingfeng Zeng, Jinyi Niu, Mengping Li, Qi Qi, Zhiqiang Liu, Yiyang Han, Dongpo Cheng, Ronghao Chen, Huacan Wang, Xingdong Feng, Huixia Judy Wang, Chengchun Shi, Liwen Zhang

机构 * School of Statistics and Data Science, Shanghai University of Finance and Economics, China(上海金融学院统计与数据科学学院,中国) School of Mathematical Sciences, Fudan University, China(复旦大学数学科学学院,中国) School of Economics, Shanghai University of Finance and Economics, China(上海金融学院经济学院,中国) AI Finance Development and Service Center, Shanghai University of Finance and Economics, China(上海金融学院人工智能金融发展与服务中心,中国) QuantaAlpha, China(QuantaAlpha,中国) Department of Statistics, Rice University, USA(里士满大学统计学系,美国) Department of Statistics, London School of Economics and Political Science, UK(伦敦政治经济学院统计学系,英国) Qinghai Provincial Key Laboratory of Big Data in Finance and Artificial Intelligence Application Technology, Qinghai Institute of Technology, China(青海省大数据在金融与人工智能应用技术重点实验室,青海技术学院,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 Fin-R1通过强化学习方法,解决金融领域推理问题,具备高精度和可解释性,适用于合规检查和智能投顾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG 90%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17238 2026-03-20 cs.CL 89%

StreamingThinker: Large Language Models Can Think While Reading

StreamingThinker: 大语言模型在阅读时可以思考

Junlong Tong, Yingqi Fan, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin(宁波空间智能与数字衍生关键实验室,数字孪生研究院) Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,莱茵-慕尼黑大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出StreamingThinker框架,使大语言模型在阅读过程中实现流式思考,通过流式CoT生成、流式约束训练和并行推理提升效率,减少延迟并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08388 2026-03-20 cs.CL 89%

If Probable, Then Acceptable? Understanding Conditional Acceptability Judgments in Large Language Models

如果可能,那么可接受?理解大型语言模型中的条件可接受性判断

Jasmin Orth, Philipp Mondorf, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML),慕尼黑)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在评估条件语句'若A则B'的可接受性时如何结合条件概率与语义相关性,发现模型对这两因素的敏感度因架构和提示策略而异,且比人类更不一致。

Comments EACL 2026 Main, 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 89%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18477 2026-03-20 cs.PL 89%

Leveraging Large Language Models for Generalizing Peephole Optimizations

利用大型语言模型进行通用窥视优化

Chunhao Liao, Hongxu Xu, Xintong Zhou, Zhenyang Xu, Chengnian Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出LPG框架,利用大型语言模型进行窥视优化泛化,通过闭环工作流整合符号常量泛化、结构泛化、约束放松和位宽/精度泛化,提升优化规则的正确性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08794 2026-03-20 cs.AI 85%

LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed

基于LLM的世界模型可以独立做出决策,但需要严谨的评估

Chang Yang, Xinrun Wang, Junzhe Jiang, Qinggang Zhang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从决策视角出发,对基于LLM的世界模型进行综合评估,设计了政策验证、行动提案和政策规划三项任务,评估了GPT-4o和GPT-4o-mini在不同环境中的表现,发现LLM世界模型在长期决策任务中性能下降,且不同功能组合会引入额外的不稳定性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19017 2026-03-20 cs.CL cs.AI 85%

What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?

真正控制大语言模型时间推理的是令牌化还是时间表示?

Gagan Bhatia, Ahmad Muhammad Isa, Maxime Peyrard, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) Université Grenoble Alpes & CNRS(格勒诺布尔阿尔卑斯大学及国家科学研究中心)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究通过MultiTempBench验证了大语言模型时间推理的核心因素,发现令牌化质量是资源依赖型瓶颈,同时时间线性度在高资源语言中是主要预测因素,而碎片化在低资源语言中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI 83%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10978 2026-03-20 cs.AI cs.CY 83%

Agentic LLM Framework for Adaptive Decision Discourse

代理大语言模型框架用于自适应决策 discourse

Antoine Dolant, Praveen Kumar

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种代理大语言模型框架,用于模拟决策 discourse,通过多方观点协作开发可行策略,解决复杂系统中的不确定性挑战,展示了两个案例研究,平衡了社会、经济和环境优先事项,为可扩展和情境感知的推荐奠定基础。

Comments 24 pages, 4 figures, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18815 2026-03-20 cs.AI 79%

ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents

ProRL Agent:多轮LLM代理的RL训练rollout-as-a-service

Hao Zhang, Mingjie Liu, Shaokun Zhang, Songyang Han, Jian Hu, Zhenghui Jin, Yuchi Zhang, Shizhe Diao, Ximing Lu, Binfeng Xu, Zhiding Yu, Jan Kautz, Yi Dong

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出ProRL Agent,通过API服务提供完整的代理rollout生命周期,支持多样化的代理任务,在无根HPC环境中提供标准化可扩展的沙箱环境,通过软件工程、数学、STEM和编程任务的RL训练验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI 79%

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18988 2026-03-20 cs.RO 78%

MERGE: Guided Vision-Language Models for Multi-Actor Event Reasoning and Grounding in Human-Robot Interaction

MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型

Joerg Deigmoeller, Nakul Agarwal, Stephan Hasler, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger

机构 * Honda Research Institute Europe(本田欧洲研究院) Honda Research Institute USA(本田美国研究院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 MERGE 通过引导视觉语言模型实现动态人类机器人交互中多主体事件的推理与 grounding,提升 situational awareness 与效率,基于 GROUND 数据集验证其性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10971 2026-03-20 cs.CR cs.CL 77%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19118 2026-03-20 cs.AI cs.CL cs.LG 75%

How Uncertainty Estimation Scales with Sampling in Reasoning Models

推理模型中不确定性估计随采样规模的变化

Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

机构 * Institute of Computer Science(计算机科学研究所) University of Tartu(塔尔图大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理模型中不确定性估计随采样规模变化的机制,通过平行采样方法分析自一致性与置信度信号的扩展链式推理表现,发现信号组合能显著提升AUROC性能,且领域依赖性明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18620 2026-03-20 cs.CL cs.AI 73%

Learning to Self-Evolve

学习自我进化

Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Mila – Quebec AI Institute(魁北克AI研究院) University of Montreal(蒙特利尔大学) Snowflake(Snowflake公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSE框架,通过强化学习训练大语言模型在测试时自我改进上下文,实验显示其在文本到SQL生成和通用问答任务中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21814 2026-03-20 cs.AI cs.CL 73%

Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem

提示架构决定推理质量:关于汽车洗问题的变量隔离研究

Heejin Jo

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过变量隔离研究,探讨了提示架构层在汽车洗问题推理中的作用,发现STAR框架可将准确率提升至85%,结合用户资料和RAG上下文后达到100%。

Comments 9 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 70%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01113 2026-03-20 cs.CL 70%

LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics

LLMs忠实且迭代地计算答案期间进行Co-T:多步算术中的系统分析

Keito Kudo, Yoichi Aoki, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Ana Brassard, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) MBZUAI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs在Co-T推理中的内部信息流,发现其在生成推理链时逐步计算子答案,而非预先确定最终答案,从而验证了推理链的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03636 2026-03-20 cs.AI cs.CL cs.LG 67%

CausalARC: Abstract Reasoning with Causal World Models

CausalARC:基于因果世界模型的抽象推理

Jacqueline Maasch, John Kalantari, Kia Khezeli

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CausalARC通过因果世界模型进行低数据和分布外推理,结合原则性数据增强提供少量示例反馈,用于评估语言模型在抽象推理、反事实推理、程序合成和因果发现中的表现。

Comments Peer-reviewed workshop paper

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18886 2026-03-20 cs.AI cs.CL 62%

Reasoning over mathematical objects: on-policy reward modeling and test time aggregation

数学对象推理:在线奖励建模与测试时间聚合

Pranjal Aggarwal, Marjan Ghazvininejad, Seungone Kim, Ilia Kulikov, Jack Lanchantin, Xian Li, Tianjian Li, Bo Liu, Graham Neubig, Anaelia Ovalle, Swarnadeep Saha, Sainbayar Sukhbaatar, Sean Welleck, Jason Weston, Chenxi Whitehouse, Adina Williams, Jing Xu, Ping Yu, Weizhe Yuan, Jingyu Zhang, Wenting Zhao

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 62%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03182 2026-03-20 cs.RO cs.AI cs.CL cs.SC 62%

Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning

模拟到规则:一个双VLM框架用于正式视觉规划

Yilun Hao, Yongchao Chen, Chuchu Fan, Yang Zhang

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VLMFP框架,结合SimVLM和GenVLM实现自动生成PDDL问题和领域文件,提升视觉规划的精确性和泛化能力。

Comments 40 pages, 6 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19169 2026-03-20 cs.CV cs.AI 57%

ARIADNE: A Perception-Reasoning Synergy Framework for Trustworthy Coronary Angiography Analysis

ARIADNE:一种用于可靠冠状动脉造影分析的感知-推理协同框架

Zhan Jin, Yu Luo, Yizhou Zhang, Ziyang Cui, Yuqing Wei, Xianchao Liu, Xueying Zeng, Qing Zhang

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 ARIADNE通过结合偏好对齐的感知与基于强化学习的诊断推理,实现拓扑一致的狭窄检测。该框架利用DPO微调Sa2VA模型,结合贝蒂数约束,提升血管结构完整性,减少假阳性,验证了偏好学习在医学影像中的应用。

Comments 28 pages, 5 figures . arXiv:submit/7385738 [cs.AI]

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18627 2026-03-20 cs.AI 57%

Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation

代理流引导与并行展开搜索用于空间感知的文本到图像生成

Ping Chen, Daoxuan Zhang, Xiangming Wang, Yungeng Liu, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16424 2026-03-20 cs.AI cs.MA 57%

Verifiable Semantics for Agent-to-Agent Communication

可验证的语义用于智能体间通信

Philipp Schoenegger, Matt Carlson, Chris Schneider, Chris Daly

机构 * Microsoft AI(微软人工智能) Wabash College(瓦巴什学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出基于刺激-意义模型的认证协议,通过验证共享事件和术语的语义一致性,减少智能体间分歧。核心 guarded 推理降低分歧72-96%,语言模型验证中减少51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09255 2026-03-20 cs.CL 57%

DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning

DSPO:用于代理搜索和推理的稳定高效策略优化

Chenyang Gu, Yewen Pu, Bruce Yang, Xiaofan Li, Huan Gao

机构 * Sapiens AI Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 DSPO通过序列级优化和动态样本过滤提升代理训练稳定性,使7B模型在多个问答基准上超越前作34.1%,在复杂多跳问答中甚至超越14B模型9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18495 2026-03-20 cs.AI 57%

Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning

跨领域演示到代码的神经符号反事实推理

Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(Sungkyunkwan 大学计算机科学与工程系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出NeSyCR框架,通过神经符号反事实推理解决跨领域机器人编程中的过程不匹配问题,提升任务成功率31.14%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16060 2026-03-20 cs.AI 57%

ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning

ARISE: 在分层强化学习中通过内在技能进化实现智能体推理

Yu Li, Rui Miao, Zhengling Qi, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Mathematical Sciences, University of Texas at Dallas(德克萨斯大学达拉斯分校数学科学系) School of Business, George Washington University(乔治华盛顿大学商学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 ARISE提出一种分层强化学习框架,通过共享策略管理高阶技能和生成低阶响应,提升数学推理能力,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15888 2026-03-20 cs.AI cs.CV cs.RO 57%

AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback

AsgardBench -- 评估基于视觉的交互式规划在最小反馈下的表现

Andrea Tupini, Lars Liden, Reuben Tan, Yu Wang, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 AsgardBench旨在评估基于视觉的高阶动作序列生成和交互式规划,重点在于执行过程中基于视觉观察而非导航或低级操作的计划适应。通过限制代理输入为图像、动作历史和轻量级成功/失败信号,该基准测试强调条件分支和计划修复。

Comments 19 figures, 6 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏