arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-05 至 2026-06-05 共收录 383 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 53 篇

2504.10823 2026-06-05 cs.CL cs.AI 84%

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

CLASH:从多个视角评估语言模型在高风险困境中的判断

Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Philosophy(哲学系) University of Michigan Ann Arbor(安娜堡大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出CLASH数据集,用于研究基于价值观的决策过程,发现语言模型在处理矛盾决策、心理不适和价值观变化时存在显著不足。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05704 2026-06-05 cs.AI cs.LG 82%

Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving

基于评论的异构多智能体推理用于可靠的数学问题求解

Muhammad Talha Sharif, Abdul Rehman

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于评论的异构多智能体框架,通过生成器-验证器结构和自适应学习系统,利用中间反馈评估和引导推理过程,在GSM8K基准上实现高达13%的准确率提升,并减少对大模型的依赖。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00555 2026-06-05 cs.AI cs.CL cs.SE 82%

Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agents

企业智能体系统中的本体约束神经推理:一种面向领域 grounded AI 智能体的神经符号架构

Thanh Luong Tuan, Abhijit Sanyal

机构 * Golden Gate University, San Francisco Foundation(金门大学,旧金山基金会) AgenticOS (FAOS)(AgenticOS(FAOS)) Associate Director, Data, Digital & IT Novartis Healthcare Pvt. Ltd.(数据、数字与IT部门,诺华健康有限公司) Novartis Healthcare Pvt. Ltd., Hyderabad, India(诺华健康有限公司,海得拉巴,印度)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种神经符号架构,通过本体约束神经推理解决企业大语言模型在幻觉、领域漂移和无法在推理层面强制执行监管合规性方面的限制,展示了该架构在提升智能体的指标准确性和角色一致性方面的显著效果。

Comments 24 pages, 6 tables, 6 figures, 1 algorithm, 65 references. Replication study: 1,800 runs (600 per model) across 5 regulated industries (3 English, 2 Vietnamese) and 3 LLMs (Claude Sonnet 4, Qwen 2.5 72B, Gemma 4 26B). v3 changes: deep-review trim from 34pp. Code and data: https://github.com/frank-luongt/faos-research/tree/main/RA-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06474 2026-06-05 cs.CL cs.AI cs.LG 82%

Self-Augmenting Retrieval for Diffusion Language Models

扩散语言模型的自增强检索

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05859 2026-06-05 cs.CL 81%

TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization

TARPO:通过动作路由策略优化的逐令牌隐式-显式推理

Liting Zhang, Shiwan Zhao, Xuyang Zhao, Zichen Xu, Jianye Wang, Qicheng Li

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TARPO框架,通过动作路由策略优化在每一步自适应切换离散令牌生成和连续隐式推理,以解决隐式推理中连续表示限制策略探索的问题,实验表明其优于现有显式和隐式推理基线。

Comments 18 pages, 12 figures. Code available at https://github.com/NKU-LITI/TARPO-master

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05464 2026-06-05 cs.AI 81%

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

大语言模型中在扩展搜索空间上的逐步优化类推理

Nicolás Astorga, Nabeel Seedat, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出OPT*任务族,通过可验证奖励训练和搜索引导策略,提升LLM在扩展搜索空间中的逐步优化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05382 2026-06-05 cs.AI 81%

Synthetic Contrastive Reasoning for Multi-Table Q&A

合成对比推理用于多表问答

Ankit Pratap Singh, Xin Su, Phillip Howard

机构 * Iowa State University(爱荷华州立大学) Thoughtworks

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);preference optimization(abstract);分类 cs.AI

AI总结 针对多表问答缺乏推理监督的问题,提出通过异构LLM生成合成对比推理轨迹,并利用对比偏好优化微调模型,在MMQA上提升9.7%-16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26179 2026-06-05 cond-mat.mtrl-sci cs.AI cs.CE 81%

AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations

AutoDFT:用于自主DFT计算的闭环多智能体框架

Penghui Yang, Zhonghan Zhang, Yue Li, Xinrun Wang, Yanchen Deng, Yuhao Lu, Bijun Tang, Zheng Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出AutoDFT闭环多智能体框架,通过将LLM推理嵌入DFT计算全生命周期,实现从规划到执行的自主适应,在VASPBench基准上达到94.1%任务成功率,并可靠预测电子、磁性和能量性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10807 2026-06-05 cs.CR cs.AR cs.LG 81%

LLMs for Secure Hardware Design and Related Problems: Opportunities and Challenges

利用大语言模型进行安全硬件设计及相关问题:机遇与挑战

Johann Knechtel, Ozgur Sinanoglu, Ramesh Karri

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) NYU Tandon School of Engineering(纽约大学塔能工程学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了大语言模型在电子设计自动化和硬件安全领域的应用,分析了其在生成RTL代码、自动生成测试平台以及弥合高层次规格与硅芯片之间语义差距方面的潜力,同时指出了其引入的严重安全漏洞,并总结了当前研究的最新进展和未来研究方向。

Comments Accepted for 2026 IEEE Computer Society Annual Symposium on VLSI (ISVLSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25158 2026-06-05 cs.AI 81%

Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills

Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能

Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) Peking University(北京大学) Zhejiang University(浙江大学) Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。

Comments Work in Progress. May version add more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22067 2026-06-05 cs.AI 81%

Semantic Partial Grounding via LLMs

通过大语言模型实现语义部分 grounding

Giuseppe Canonaco, Alberto Pozanco, Daniel Borrajo

机构 * Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SPG-LLM,利用大语言模型分析领域和问题文件,提前识别可能不相关的对象、动作和谓词,从而减少grounding任务的规模,提升grounding效率并在某些领域实现更优的计划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15851 2026-06-05 cs.CL 81%

DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections

DocHop-QA: 向多跳推理多模态文档集合迈进

Jiwon Park, Seohyun Pyeon, Jinwoo Kim, Rina Carines Cabal, Zhenyuan He, Yihao Ding, Soyeon Caren Han

机构 * Pohang University of Science and Technology(釜山科学技术大学) The University of Sydney(悉尼大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DocHop-QA基准,通过多模态、多文档、多跳科学问答评估多模态证据综合能力,揭示当前模型在长上下文和多证据需求下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06109 2026-06-05 cs.CL cs.AI 81%

Harnessing Structural Context for Entity Alignment Foundation Models

利用结构上下文进行实体对齐基础模型

Xingyu Chen, Yuanning Cui, Zequn Sun, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Nanjing University of Information Science and Technology, Nanjing, China(南京信息科学技术大学) National Institute of Healthcare Data Science, Nanjing University, Nanjing, China(南京大学健康数据科学国家研究院)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出ContextEA框架,通过交叉KG交互编码器和结构校准解码器增强结构上下文的构建与利用,在29个数据集上超越强基线,实现更强的跨KG迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08503 2026-06-05 cs.CV cs.CL cs.LG 81%

Learning Self-Correction in Vision-Language Models via Rollout Augmentation

通过回滚增强学习视觉-语言模型中的自我纠正

Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于回滚增强的强化学习框架Octopus,通过重新组合现有回滚生成密集的自我纠正示例,提高样本效率并稳定RL优化,同时引入响应遮蔽策略以解耦自我纠正与直接推理,从而在7个基准测试中实现开源VLM的SOTA性能。

Comments 18 pages

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05702 2026-06-05 cs.AI cs.CV 79%

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

Seeing Time: 视觉-语言模型中的时间顺序推理与捷径偏差基准测试

Haoyu Zhou, Qing Qing, Caichong Li, Qixin Zhang, Yongcheng Jing, Ziqi Xu, Juncheng Hu, Xikun Zhang, Renqiang Luo

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一个新基准,通过三个专门数据集评估视觉-语言模型在图像内和跨图像的时间顺序推理能力,并揭示模型常利用颜色等表面线索而非真正时间特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06260 2026-06-05 cs.IR cs.AI cs.CL 79%

OneReason Technical Report

OneReason 技术报告

OneRec Team, Biao Yang, Boyang Ding, Chenglong Chu, Dunju Zang, Fei Pan, Han Li, Hao Jiang, Honghui Bao, Huanjie Wang, Jian Liang, Jiangxia Cao, Jiao Ou, Jiaxin Deng, Jinghao Zhang, Kun Gai, Lu Ren, Peiru Du, Pengfei Zheng, Rongzhou Zhang, Ruiming Tang, Shiyao Wang, Siyang Mao, Siyuan Lou, Teng Shi, Wei Yuan, Wenlong Xu, Xingchen Liu, Xingmei Wang, Xinqi Jin, Yan Sun, Yan Wang, Yifei Hu, Yingzhi He, Yufei Ye, Yuhao Wang, Yunhao Zhou, Yuqin Dai, Zhao Liu, Zhipeng Wei, Zhixin Ling, Ziming Li, Zixing Zhang, Ziyuan Liu, An Zhang, Changxin Lao, Chaoyi Ma, Chengru Song, Defu Lian, Fan Yang, Guowang Zhang, Hao Peng, Jiayao Shen, Jie Chen, Jun Xu, Junmin Chen, Kun Zhang, Kuo Cai, Mingxing Wen, Minmao Wang, Minxuan Lv, Qi Zhang, Qiang Luo, Sheng Yu, Shijie Li, Shijie Yi, Shuang Yang, Shugui Liu, Shuni Chen, Tinghai Zhang, Tingting Gao, Xiang Wang, Xiangyu Wu, Xiangyu Zhao, Xiao Lv, Xiaoyou Zhou, Xuming Wang, Yong Du, Zejian Zhang, Zhaojie Liu, Zhiyang Zhang, Zhuang Zhuang, Ziqi Wang, Ziyi Zhao

机构 * OneRec Team(OneRec团队)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 针对生成式推荐模型中推理能力难以激活的问题,提出 OneReason 方法,通过增强感知和认知能力实现有效推理。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05315 2026-06-05 cs.CL cs.AI 79%

LoRi: Low-Rank Distillation for Implicit Reasoning

LoRi: 用于隐式推理的低秩蒸馏

Ryan Solgi, Jiayi Tian, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出低秩蒸馏框架,通过对齐师生模型在共享低秩张量子空间中的隐状态推理轨迹,提升大型语言模型的隐式思维链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05753 2026-06-05 cs.CV 78%

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

余弦误导:辅助损失重塑视觉语言模型,而非其潜变量

XiuYu Zhang, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文通过实验发现,在视觉语言模型的潜视觉推理中,余弦相似度等对齐损失与准确性负相关,并引入PRISM诊断工具揭示潜变量被绕过,辅助损失主要通过共享参数重塑语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05259 2026-06-05 cs.CV 75%

VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

VideoKR:迈向知识和推理密集型视频理解

Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 提出VideoKR,首个大规模训练语料库,通过人工参与的技能导向生成管道构建315K视频推理示例,增强知识和推理密集型视频理解,并在专家标注基准上验证其有效性。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21430 2026-06-05 cs.RO 75%

EVE: A Generator-Verifier System for Generative Policies

EVE: 一种生成策略的生成-验证系统

Yusuf Ali, Gryphon Patlin, Karthik Kothuri, Jeremiah Coholich, Muhammad Zubair Irshad, Wuwei Liang, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院) Toyota Research Institute(丰田研究院) Symbotic Inc.(Symbotic公司)

专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);foundation model(abstract)

AI总结 本文提出EVE系统,通过生成-验证框架在测试时提升预训练生成策略的性能,利用零样本视觉语言模型验证者进行动作优化,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17310 2026-06-05 cs.AI cs.CL 73%

InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning

InfoDensity: 为高效推理奖励信息密集的轨迹

Chengwei Wei, Jung-jae Kim, Longyin Zhang, Shengkai Chen, Nancy F. Chen

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究机构(I 2 R),A*STAR,新加坡) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfoDensity框架,通过捕捉推理轨迹的信息密度特性,改进强化学习训练中的推理质量与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21667 2026-06-05 cs.LG cs.AI 73%

Escaping the Verifier: Learning to Reason via Demonstrations

摆脱验证者:通过示范学习推理

Locke Cai, Max Ryabinin, Ivan Provilkov

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RARO方法,通过逆强化学习从专家示范中学习强大的推理能力,无需任务特定的验证者,从而在多个评估任务中实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06044 2026-06-05 cs.CL 70%

IA-RAG: Interval-Algebra-Driven Temporal Reasoning for Dynamic Knowledge Retrieval

IA-RAG:基于区间代数的动态知识检索时间推理

Xiaoman Wang, Yaoze Zhang, Wenzhuo Fan, Hongwei Zhang, Ding Wang, Guohang Yan, Song Mao, Botian Shi, Yunshi Lan, Pinlong Cai

机构 * East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Shanghai for Science and Technology(上海科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出IA-RAG框架,通过区间代数建模时间约束,实现层次化时间检索与推理,在复杂时间问答任务上表现优异。

Comments 22 pages, 10 figures, 13 tables. Code available at https://github.com/xiaoAugenstern/LogicalRAG_TemporalQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05836 2026-06-05 cs.CL 70%

ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL

ProSPy: 面向企业级Text-to-SQL的剖析驱动的SQL-Python智能体框架

Zhaorui Yang, Huawei Zheng, Sen Yang, Yuhui Zhang, Haoxuan Li, Zhizhen Yu, Xuan Yi, Chen Hou, Defeng Xie, Chao Hu, Minfeng Zhu, Dazhen Deng, Haozhe Feng, Danqing Huang, Yingcai Wu, Peng Chen, Wei Chen

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) School of Software Technology(软件技术学院) Tencent TEG(腾讯科技集团) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ProSPy框架,通过自动剖析、模式剪枝、中间视图获取和Python分析四阶段,结合SQL高效性与Python灵活性,解决企业级数据库Text-to-SQL中的模式异构、元数据不完整和复杂分析问题。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05639 2026-06-05 cs.LG 70%

Q-GNN: Query-Conditioned Graph Neural Networks with Type Awareness for Knowledge Graph Completion

Q-GNN: 具有类型感知的查询条件图神经网络用于知识图谱补全

Dongxiao He, Ruqiong Zhang, Zhizhi Yu, Ling Ding, Di Jin, Guangquan Xu, Zhiyong Feng

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Q-GNN,通过融合查询实体的结构上下文和语义类型信息,增强图神经网络在知识图谱补全中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05445 2026-06-05 cs.AI 70%

Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

Brick-Composer: 使用多模态大语言模型进行多样化积木组装

Jiateng Liu, Bingxuan Li, Zhenhailong Wang, Rushi Wang, Kaiwen Hong, Cheng Qian, Jiayu Liu, Denghui Zhang, Katherine Driggs-Campbell, Manling Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Brick-Composer框架,通过人类设计火花、世界反馈和合成经验三种信号训练多模态大语言模型,解决积木组装中的积木选择和姿态估计问题,将步骤级组装成功率从低于1%提升至约15%。

Comments 10 Pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03890 2026-06-05 cs.CV 67%

4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping

4DPC$^2$hat: 面向动态点云理解的失败感知自举学习

Xindan Zhang, Weilong Yan, Yufei Shi, Xuerui Qiu, Tao He, Ying Li, Ming Li, Hehe Fan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出首个针对动态点云理解的多模态大语言模型4DPC$^2$hat,通过构建大规模跨模态数据集4DPC$^2$hat-200K和引入Mamba增强的时间推理模块及失败感知自举学习策略,显著提升了动作理解与时间推理能力。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17249 2026-06-05 cs.RO 67%

SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

SEDualVLN:一种空间增强的双系统用于视觉语言导航

Jingzhi Huang, Junkai Huang, Wenxuan Song, Haoyang Yang, Hailong Huang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出SEDualVLN,一种空间增强的双系统框架,用于解决视觉语言导航中的长距离导航和动态推理问题,通过两个系统协同工作实现高效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10254 2026-06-05 cs.CV 67%

Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis

Facial-R1: 通过推理与识别对齐实现面部情绪分析

Jiulong Wu, Yucheng Shen, Lingyong Yan, Haixin Sun, Deguo Xia, Jizhou Huang, Min Cao

专题命中 推理与问题求解 :language model(abstract,abstract_cn)

AI总结 本文提出Facial-R1框架,通过三阶段对齐方法解决面部情绪分析中推理与识别不一致及推理幻觉的问题,并引入FEA-20K基准数据集,验证了其在多个标准基准上的最佳性能。

Comments Withdrawn by the authors due to pending intellectual property considerations. The authors have determined that the current version contains material that should not have been publicly disseminated at this stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06475 2026-06-05 cs.LG cs.AI 62%

RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

RREDCoT: 推理模型的片段级奖励再分配

Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria(林茨ELLIS单元和LIT人工智能实验室,机器学习研究所,林茨约瑟夫·冯·拉格纳大学,奥地利) Cognizant AI Lab, San Francisco, USA(认知人工智能实验室,美国旧金山) NXAI GmbH, Linz, Austria(NXAI公司,奥地利林茨)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对推理语言模型强化学习微调中的延迟奖励问题,提出RREDCoT方法,利用模型自身近似最优奖励再分配,无需额外生成,降低方差并提升信用分配效率。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏