arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 154 篇

2507.15518 2026-05-12 cs.AI cs.MA 70%

HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics

HAMLET:一种分层自适应的多智能体框架用于实时具身戏剧

Shufan Jiang, Sizhou Chen, Chios Chen, Chi Zhang, Xiao-Lei Zhang, Xuelong Li

机构 * East China University of Science and Technology(东华大学) The University of Sydney(悉尼大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) Datawhale Org(Datawhale组织) Independent Researcher(独立研究员)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HAMLET通过分层自适应多智能体框架实现戏剧创作与实时表演,提升戏剧表现力和物理交互性,采用自适应推理模块和具身互动增强沉浸感。

Comments Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09906 2026-05-12 cs.AI cs.SD 70%

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

先分后融:通过模态特定的推理链减轻音频视觉大语言模型中的跨模态干扰

Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing(天津认知计算实验室) Tianjin University(天津大学) Huiyan Technology Company, Ltd.(慧颜科技有限公司) Chinese Academy of Sciences(中国科学院) Tencent(腾讯)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SFFL框架,通过模态特定的推理链减少跨模态干扰,提升音频视觉问答的准确性和鲁棒性,实验显示在通用AVQA基准和跨模态幻觉基准上分别提升5.16%和11.17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09487 2026-05-12 cs.LG 70%

Kintsugi: Learning Policies by Repairing Executable Knowledge Bases

Kintsugi: 通过修复可执行知识库学习策略

Teng Cao, Yu Deng, Hikaru Shindo, Quentin Delfosse, Lanxi Wen, Suli Wang, Jannis Blüml, Christopher Tauchmann, Kristian Kersting

机构 * Artificial Intelligence and Machine Learning Lab, Technical University of Darmstadt, Germany(德累斯顿技术大学人工智能与机器学习实验室) Hessian Center for Artificial Intelligence (hessian.AI), Germany(黑森人工智能中心) Department of Computer Science, Technical University of Darmstadt, Germany(德累斯顿技术大学计算机科学系) Department of Computer Science, Technical University of Munich (TUM), Germany(慕尼黑技术大学计算机科学系) German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt, Germany(德累斯顿技术大学认知科学中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 Kintsugi提出一种白盒策略学习框架,通过验证器门控构建可执行知识库,以可组合的类型条目表示任务级策略知识,并通过局部类型编辑提升知识库,实现可检查、可编辑和可部署的策略改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 70%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 70%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 70%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23273 2026-05-12 cs.CL 70%

UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection

UPA:基于树状搜索与选择的无监督提示代理

Siran Peng, Weisong Zhao, Tianyu Fu, Chenxu Zhao, Tianshuo Zhang, Haoyuan Zhang, Xiangyu Zhu, Minghui Wu, Zhen Lei

机构 * MAIS, CASIA(中国科学院自动化研究所) SAI, UCAS(中国科学技术大学人工智能学院) Mininglamp Technology(Mininglamp技术公司) IIE, CAS(中国科学院信息研究所) SCSE, FIE, M.U.S.T(慕斯科技大学信息工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出UPA,一种无需真实奖励信号的无监督提示代理,通过树状结构搜索和基于Bradley-Terry-Luce模型的两阶段框架实现高效提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09209 2026-05-12 math.OC cs.AI 70%

Select-then-differentiate: Solving Bilevel Optimization with Manifold Lower-level Solution Sets

选择后再求导:解决具有流形下层解集的双层优化问题

Saeed Masiha, Zebang Shen, Negar Kiyavash, Niao He

机构 * EPFL School of Management of Technology(EPFL管理学院) ETH Department of Computer Science(ETH计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了下层问题具有非孤立流形极小解时的乐观双层优化,提出HG-MS方法结合显式乐观选择和高效的伪逆超梯度计算,证明其在流形内在维度内收敛,并在实际应用中取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09131 2026-05-12 cs.AI cs.MA 70%

MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments

MCP-Cosmos:用于MCP环境复杂任务执行的世界模型增强型智能体

Giridhar Ganapavarapu, Dhaval Patel

机构 * IBM

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP-Cosmos融合世界模型与MCP框架,通过引入生成世界模型提升智能体在复杂任务中的执行能力,实验显示其在工具成功率和参数准确性等方面有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09012 2026-05-12 cs.AI 70%

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

Re²Math:研究级数学中的定理检索基准测试

Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang

机构 * Fudan University(复旦大学) Fudan University Shanghai Innovation Institute(复旦大学上海创新研究院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Re²Math基准测试旨在评估从部分数学证明中检索工具的能力,通过构建包含层级上下文和可选泄漏控制锚点提示的实例,评估系统在检索文献支持的数学工具时的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08774 2026-05-12 cs.RO cs.LG 70%

ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation

ProcVLM:基于学习的程序导向进度奖励用于机器人操作

Youhe Feng, Hansen Shi, Haoyang Li, Xinlei Guo, Yang Wang, Chengyang Zhang, Jinkai Zhang, Xiaohan Zhang, Jie Tang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Zhipu AI(智谱AI) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 推理与问题求解 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 ProcVLM通过程序结构和阶段内视觉变化学习密集的进度奖励,提升机器人操作的程序推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08580 2026-05-12 cs.MA cs.AI 70%

Slipstream: Trajectory-Grounded Compaction Validation for Long-Horizon Agents

Slipstream: 长时间跨度智能体的轨迹引导压缩验证

Zhuofu Chen, Rui Pan, Yinwei Dai, Ravi Netravali

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Slipstream通过异步压缩验证提升长时间跨度智能体的任务准确性,减少端到端延迟,适用于代码编写和网页浏览任务。

Comments 9 pages (16 pages counting references, appendix), 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG 70%

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08477 2026-05-12 cs.CL 70%

Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling

智能体是否需要分步规划?重新审视数据导向工具调用中的规划范围

Naoki Otani, Nikita Bhutani, Hannah Kim, Dan Zhang, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了数据导向任务中规划范围的影响,发现全范围规划结合延迟重规划在准确性和效率上优于单步规划。

Comments CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08441 2026-05-12 q-bio.QM cs.CE cs.LG 70%

SpectraLLM: Uncovering the Ability of LLMs for Molecular Structure Elucidation from Multi-Spectral Data

SpectraLLM:从多光谱数据中揭示LLMs对分子结构解析的能力

Yunyue Su, Jiahui Chen, Zao Jiang, Zhenyi Zhong, Liang Wang, Qiang Liu, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院) The Hong Kong Polytechnic University(香港理工大学) Tianjin University Peiyangyuan Campus(天津大学-pieceyang Campus)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SpectraLLM通过多光谱数据端到端预测分子结构,优于传统方法,具有鲁棒性和跨模态推理能力。

Comments 42 pages, 6 figures, 30 tables; Accepted to ICLR 2026

Journal ref Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08399 2026-05-12 cs.AI 70%

CoCoDA: Co-evolving Compositional DAG for Tool-Augmented Agents

CoCoDA:用于工具增强代理的共进化组合DAG

Ziyang Yu, Qiyue Li, Liang Zhao

机构 * Emory University(埃默里大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 CoCoDA通过共进化规划器和工具库,利用组合代码DAG结构提升工具库检索效率和规划效果,实现在数学推理和代码任务中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08315 2026-05-12 cs.LG 70%

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

反思引导的策略优化:轨迹 grounded 的修订与显著性偏差

Rahaf Abu Hara, Vaibbhav Murarri, Claudio Zito

机构 * Laboratory of AI and Robotics Research (LAIRR)(人工智能与机器人研究实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出R2PO框架,通过轨迹级证据改进策略搜索,解决传统方法仅依赖标量奖励的不足,通过分离全局搜索与行为修订,提升策略优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10074 2026-05-12 cs.CR cs.SE 67%

Agentic Fuzzing: Opportunities and Challenges

代理模糊测试:机遇与挑战

Junyoung Park, Insu Yun

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09502 2026-05-12 cs.CL cs.AI cs.LG 67%

Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

链式推理中的隐藏错误意识:信号是诊断性的,而非因果性的

Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang, Yi Nian, Yue Zhao

机构 * University of Southern California, Los Angeles, CA, USA(南加州大学,洛杉矶,加利福尼亚州,美国)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示链式推理中模型内在检测自身推理错误但外在表现自信的现象,通过隐藏状态线性探针显示其正确性预测能力,但无法通过干预修复错误,表明信号为诊断而非因果。

Comments 10 pages, 5 figures, 10 tables.Mechanistic Interpretability @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV 67%

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09265 2026-05-12 cs.CE 67%

Agentic AI for Particle-Based Simulation: Automating SPH Workflows for Debris Flow Modeling

基于代理的AI用于粒子模拟:自动化SPH工作流用于碎屑流建模

Danrong Zhang, Ruijia Wang, Chenying Liu, Yumeng Zhao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出首个用于无网格模拟的代理AI工作流,通过整合工具编排、多模态输入和人机交互,实现了碎片流建模的端到端模拟,展示了多模态输入在提升用户体验和减少失败模式方面的优势。

Comments 24 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09185 2026-05-12 cs.CE 67%

AutoRedTrader: Autonomous Red Teaming of Trading Agents through Synthetic Misinformation Injection

AutoRedTrader: 通过合成虚假信息注入实现交易代理的自主红队测试

Zhiwei Liu, Yangyang Yu, Yupeng Cao, Yuechen Jiang, Haohang Li, Zhuoran Lu, Yuyan Wang, Yixiang Zheng, Xiaorui Guo, Calvin Yixiang Cheng, Sophia Ananiadou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出AutoRedTrader框架,通过行为偏差操控、微小文本扰动和重写策略生成金融领域虚假信息,评估其对交易代理的影响及历史市场证据的稳定性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08695 2026-05-12 cs.CV 67%

EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics

EditSleuth:用于图像编辑取证的 grounded 推理链数据集

Van-Loc Nguyen, AprilPyone MaungMaung, Minh-Triet Tran, Isao Echizen

机构 * University of Science, Vietnam National University Ho Chi Minh City(越南胡志明市国家大学科学大学) National Institute of Informatics(国立信息研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出EditSleuth数据集,包含257,725个图像编辑三元组,用于图像编辑取证的 grounded 推理。数据集包含编辑图像、源图像、二元编辑掩码、12类编辑分类标签、难度评分和六步推理链,通过确定性方法生成,并验证了难度评分与编辑类型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04910 2026-05-12 cs.SE 67%

Reducing the Costs of Proof Synthesis on Rust Systems by Scaling Up a Seed Training Set

通过扩大种子训练集来降低Rust系统证明合成的成本

Nongyu Di, Tianyu Chen, Shan Lu, Shuai Lu, Yeyun Gong, Peng Cheng, Jacob R. Lorch, Yuan Yao, Xiaoxing Ma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出VeruSyn数据合成管道,通过自合成和教程合成扩大Verus验证工具的数据集,生成690万Rust程序及其形式化规格证明,提升代码生成模型的性价比和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18270 2026-05-12 cs.SE 67%

Can Old Tests Do New Tricks for Resolving SWE Issues?

旧测试能否为解决软件工程问题带来新用途?

Yang Chen, Toufique Ahmed, Reyhaneh Jabbarvand, Martin Hirzel

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出TestPrune,通过重用回归测试自动最小化测试套件,提升问题复现和修复效率,实验证明在多个基准测试中显著提高复现和修复率。

Comments Accepted to the main technical track of the Symposium on the Foundations of Software Engineering (FSE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04783 2026-05-12 cs.AI cs.CL 62%

Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction

打破情境惯性:基于单轮锚点的强化学习用于稳定多轮交互

Xingwu Chen, Zhanqiu Zhang, Yiwen Guo, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出RLSTA方法,通过单轮锚点提供奖励信号,帮助模型打破情境惯性,提升多轮交互稳定性,实验显示其在不同领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09900 2026-05-12 cs.AI cs.CL cs.CV 62%

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

为视觉语言模型解开 Gordian 结:图式结理作为一项难题基准

Hao Liu, Jicheng Liu

机构 * Department of Psychology(心理学系) New York University(纽约大学) Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 KnotBench 基准,通过 858,318 张图像与 Regina 签名验证,评估 VLMs 在结图识别、预测和跨模态接地任务中的能力,发现模型在结操作模拟上存在显著不足。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02450 2026-05-12 cs.RO cs.AI cs.LG 62%

CHARMS: A Cognitive Hierarchical Agent for Reasoning and Motion Stylization in Autonomous Driving

CHARMS:用于自动驾驶中的推理与运动风格化的认知层次代理

Jingyi Wang, Duanfeng Chu, Zejian Deng, Liping Lu, Jinxiang Wang, Chen Sun

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械与电子工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究所) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 CHARMS通过强化学习预训练和监督微调pipeline,实现人类般的决策行为和交互真实性,同时利用泊松认知层次理论生成多样化驾驶场景。

Journal ref ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02972 2026-05-12 cs.CL cs.AI 62%

LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation

LINGOLY-TOO:通过模板化正交混淆分离推理与知识

Jude Khouja, Lingyi Yang, Karolina Korgul, Simeon Hellsten, Vlad A. Neacsu, Harry Mayne, Ryan Othniel Kearns, Andrew M. Bean, Adam Mahdi

机构 * University of Oxford(牛津大学) University of Nottingham(诺丁汉大学) University of Glasgow(格拉斯哥大学) United Kingdom Linguistics Olympiad(英国语言学奥林匹克) Asia-Pacific Linguistics Olympiad(亚太语言学奥林匹克)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 LINGOLY-TOO通过模板化正交混淆技术,设计了1203个问题和6995个子问题,旨在减少对知识和记忆的依赖,评估模型真正的推理能力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01301 2026-05-12 cs.AI cs.CL 62%

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

克服多步复杂性以实现多模态理论思维推理:一种可扩展的贝叶斯规划器

Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

机构 * Dartmouth College(达特茅斯学院) Honda Research Institute USA(本田美国研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种可扩展的贝叶斯理论思维规划器,通过分步贝叶斯更新分解理论思维推理,利用弱到强控制使小语言模型专精于理论思维似然估计,并将其推理行为转移给大语言模型,从而在多模态理论思维基准测试中实现4.6%的准确率提升。

Comments Accepted as a Spotlight at the 2025 Forty-Second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏