arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 59 篇

2512.12177 2026-05-13 cs.AI 93%

Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation

Floorplan2Guide: 基于LLM的BLV室内导航floorplan解析

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出利用基础模型将floor plan转化为可导航的知识图谱,并生成可读的导航指令,通过LLM提取空间信息,提升BLV用户室内导航的精度与安全性。

Comments Accepted for publication in the proceedings of the IEEE International Conference on Big Data (IEEE BigData 2025)

Journal ref IEEE International Conference on Big Data (IEEE BigData 2025), pp. 7477-7485

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12421 2026-05-13 cs.AI 92%

Formalize, Don't Optimize: The Heuristic Trap in LLM-Generated Combinatorial Solvers

形式化,而非优化:LLM生成组合求解器中的启发式陷阱

Haoyu Wang, Yuliang Song, Tao Li, Zhiwei Deng, Yaqing Wang, Deepak Ramachandran, Eldan Cohen, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) Oracle AI(Oracle人工智能)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM生成组合求解器时形式化与优化的矛盾,通过CP-SynC-XL基准测试,发现Python+OR-Tools在正确性上最优,而MiniZinc+OR-Tools虽使用相同后端但覆盖度较低,启发式优化导致部分问题速度下降和正确性降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09461 2026-05-13 cs.AI 92%

VulTriage: Triple-Path Context Augmentation for LLM-Based Vulnerability Detection

VulTriage:基于LLM的漏洞检测三路径上下文增强

Wenxin Tang, Xiang Zhang, Junliang Liu, Jingyu Xiao, Xi Xiao, Jinlong Yang, Yuehe Ma, Zhenyu Liu, Zhengheng Li, Zicheng Wang, Wang Luo, Qing Li, Lei Wang, Peng Xiangli

机构 * Tsinghua University(清华大学) Henan University(河南大学) Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Northwestern Polytechnical University(西北工业大学) BNU-HKBU United International College(北京理工大学-香港大学联合国际学院) Southeast University(东南大学) Jilin University(吉林大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangzhou Intelligence Communications Technology Co., Ltd.(广州智能通信技术有限公司) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出VulTriage框架,通过三路径上下文增强提升LLM在漏洞检测中的性能,实验表明其在关键指标上优于现有方法,且在低资源和类别不平衡场景下具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09678 2026-05-13 cs.AI cs.LG cs.SE 92%

EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

EsoLang-Bench: 通过奇特编程语言评估大语言模型的真实推理能力

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 EsoLang-Bench通过五种奇特编程语言评估大语言模型在分布外编程语言上的推理能力,发现前沿模型在处理陌生语言时存在显著能力差距。

Comments 45 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11225 2026-05-13 cs.AI cs.LG cs.MA 92%

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

PIVOT:通过轨迹细化弥合LLM代理中的规划与执行

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PIVOT通过自监督框架迭代优化轨迹,解决LLM代理规划与执行不一致问题,实验证明其在约束满足和计算效率上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07001 2026-05-13 cs.SE cs.CL 92%

SmellBench: Evaluating LLM Agents on Architectural Code Smell Repair

SmellBench:评估LLM代理在建筑代码异味修复上的表现

Ion George Dinu, Marian Cristian Mihăescu, Traian Rebedea

机构 * University of Craiova(克劳索瓦大学) NVIDIA(NVIDIA公司) University Politehnica of Bucharest(布加勒斯特理工大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SmellBench框架,用于评估LLM代理在修复建筑代码异味方面的性能,通过专家验证发现最佳代理修复率为47.7%,但修复 aggressiveness 与代码库质量呈负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02600 2026-05-13 cs.RO cs.AI 92%

CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation

CoRAL:富含接触的自适应LLM基于控制用于机械臂操作

Berk Çiçek, Mert K. Er, Ozgur S. Oguz

机构 * LiRA Lab, Department of Computer Engineering Bilkent University(LiRA实验室,计算机工程系,比尔肯特大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoRAL通过解耦高层推理与低层控制,利用LLM设计成本函数,结合神经符号适应循环和记忆单元,实现接触密集任务的自适应控制,提升成功率50%以上。

Comments 22 pages, 9 figures, 3 tables. Accepted to Robotics: Science and Systems (RSS) 2026. Updated to camera-ready version with appendix and text/formatting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11188 2026-05-13 cs.CR cs.AI cs.ET 92%

Adversarial SQL Injection Generation with LLM-Based Architectures

基于LLM架构的对抗性SQL注入生成

Ali Karakoc, H. Birkan Yilmaz

机构 * Department of Computer Engineering, NETLAB(计算机工程系,NETLAB)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RADAGAS和RefleXQLi两种LLM-based系统,评估其在10个WAF和MySQL验证器上的对抗性SQL注入生成性能,发现RADAGAS-GPT4o在绕过WAFs方面表现优异。

Comments 32 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11514 2026-05-13 cs.CR 90%

FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems

FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞

Fanxiao Li, Jiaying Wu, Tingchao Fu, Natasha Jaques, Wei Zhou, Min-Yen Kan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12106 2026-05-13 cs.AI 90%

Large Language Models as Amortized Pareto-Front Generators for Constrained Bi-Objective Convex Optimization

大语言模型作为约束双目标凸优化的 amortized 帕累托前沿生成器

Peipei Xu, SiYuan Ma, Yaohua Liu, Yu Wu, Guanliang Liu, Yang Zhang, Yong Liu

机构 * University of Shanghai for Science and Technology(上海科技大学) Nanyang Technological University(南洋理工大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Georgia Institute of Technology(佐治亚理工学院) The University of Michigan(密歇根大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出DIPS框架,利用大语言模型生成约束双目标凸优化的帕累托前沿,通过紧凑离散化方案和三阶段课程优化,实现高效连续优化。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11986 2026-05-13 cs.AI 90%

On the Limitations of Large Language Models for Conceptual Database Modeling

大型语言模型在概念数据库建模中的局限性

Arthur F. Siqueira, Carlos D. S. Nogueira, Eduarda Farias, Claudio E. C. Campelo, Júlia Menezes

机构 * Systems and Computing Department(系统与计算系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本文研究了大型语言模型在生成实体关系图方面的能力,发现其在复杂场景中可靠性下降,存在不一致和模糊性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11636 2026-05-13 cs.AI 90%

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes:具有演变干扰的对抗自博弈用于LLM推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researchers(独立研究者) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 Seirênes通过对抗自博弈框架将LLM推理中的上下文干扰转化为训练信号,提升推理鲁棒性,在多个数学推理基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 90%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR 89%

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12446 2026-05-13 cs.LG cs.CL 88%

ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

ORCE:面向大型语言模型中明确自信度的顺序感知对齐

Chen Li, Xiaoling Hu, Songzhu Zheng, Jiawei Zhou, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Morgan Stanley(摩根大通)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种解耦且顺序感知的明确自信度校准框架,通过分离自信度估计与答案生成过程,提升校准和失败预测性能,同时保持答案准确性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13988 2026-05-13 cs.AI cs.LG 88%

Faithful or Just Plausible? Evaluating the Faithfulness of Closed-Source LLMs in Medical Reasoning

忠实还是只是合理?评估闭源LLM在医学推理中的忠实性

Halimat Afolabi, Zainab Afolabi, Elizabeth Friel, Jude Roberts, Antonio Ji-Xu, Lloyd Chen, Egheosa Ogbomo, Emiliomo Imevbore, Phil Eneje, Wissal El Ouahidi, Aaron Sohal, Alisa Kennan, Shreya Srivastava, Anirudh Vairavan, Laura Napitu, Katie McClure

机构 * Stratified Precision Harvard Medical School(哈佛医学院) Imperial College London(帝国理工学院伦敦分校) National Health Service(国家健康服务系统) Ipsen France(Ipsen法国) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统性黑盒评估,揭示闭源LLM在医学推理中的忠实性问题,发现链式推理步骤未必驱动预测,模型易受外部提示影响,强调忠实性比准确性更重要。

Journal ref Proceedings of Machine Learning Research, Vol. 297, pp. 1562-1591, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG 88%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12129 2026-05-13 cs.SE cs.AI cs.OS 88%

It's Not the Size: Harness Design Determines Operational Stability in Small Language Models

大小并非关键:Harness设计决定小型语言模型的操作稳定性

Yong-eun Cho

机构 * KailosLab(凯洛斯实验室)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 本文通过实验分析Harness工程水平对小型语言模型操作性能的影响,采用三种Harness条件在24项任务中比较TSR和VTSR,发现Pipeline Harness在Gemma4 E2B上取得高成功率,且发现最小外壳条件下的TSR低于模型-only条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL 88%

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04476 2026-05-13 cs.CV 88%

Vision-aligned Latent Reasoning for Multi-modal Large Language Model

多模态大语言模型中的视觉对齐潜在推理

Byungwoo Jeon, Yoonwoo Jeong, Hyunseok Lee, Minsu Cho, Jinwoo Shin

机构 * Byungwoo Jeon Yoonwoo Jeong Hyunseok Lee Minsu Cho Jinwoo Shin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出视觉对齐潜在推理框架,通过动态生成视觉对齐的潜在标记,提升多模态大语言模型在长上下文理解和精确视觉感知任务中的表现。

Comments Published as conference proceeding for ICML 2026. Last two authors advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11905 2026-05-13 cs.AI 87%

Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving

重新思考监督粒度:基于LLM的定理证明的段级学习

Shuo Xu, Jiakun Zhang, Junyu Lai, Chun Cao, Jingwei Xu

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出段级监督策略,通过提取局部连贯的证明段落训练策略模型,提升定理证明的成功率,并在推理阶段减少计算成本。

Comments 22 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12370 2026-05-13 cs.CL cs.IR 86%

Context Convergence Improves Answering Inferential Questions

上下文收敛提升推断性问题的回答

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了上下文结构和质量对LLM处理推断性问题的影响,发现高收敛性句子构建的上下文能显著提升回答准确率,且按收敛性排序略有提升,表明LLM倾向于优先使用信息丰富的早期提示。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 86%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11011 2026-05-13 cs.LG cs.AI 85%

LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

LoopUS: 将预训练大语言模型转换为循环潜在细化模型

Taekhyun Park, Yongjae Lee, Dohee Kim, Hyerim Bae

机构 * Department of Data Science(数据科学系) Department of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Changwon National University(昌原国立大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 LoopUS通过循环架构提升LLM推理性能,无需重新训练,采用四个核心组件稳定模型并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05513 2026-05-13 cs.IR 85%

LEAPS: An LLM-Empowered Adaptive Plugin in Taobao AI Search

LEAPS: 阿里巴巴淘宝AI搜索中的大语言模型赋能自适应插件

Lei Wang, Jinhang Wu, Zhibin Wang, Biye Li

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LEAPS通过'拓宽与精炼'范式优化搜索流程,提升购物对话体验,同时保持传统检索性能并支持低成本集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17062 2026-05-13 cs.CL cs.AI 84%

Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation

探究基于推理的语言模型在缓解社会偏见中的思维行为

Guoqing Luo, Iffat Maab, Lili Mou, Junichi Yamagishi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于推理的语言模型在缓解社会偏见中的思维机制,发现两种导致偏见累积的失败模式,并提出轻量级提示方法减少偏见同时保持准确性。

Comments Due to issues found with the annotations in Section 4.3, we have decided to withdraw this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11666 2026-05-13 cs.LG cs.AI 82%

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

进化任务发现:通过技能组合与复杂性缩放推进推理前沿

Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 本文提出EvoTD框架,通过结构化进化算子在算法技能与复杂性属性的双轴流形上进行数据合成,提升模型推理能力,并在不同架构和规模上实现稳定泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26752 2026-05-13 cs.CV 82%

GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

GLM-5V-Turbo:迈向多模态代理的原生基础模型

V Team, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue Wang, Yuanchang Yue, Yu Wang, Yanling Wang, Yan Wang, Xijun Liu, Wenmeng Yu, Weihan Wang, Wei Li, Shuaiqi Duan, Sheng Yang, Ruiliang Lv, Mingdao Liu, Lihang Pan, Ke Ning, Junhui Ji, Jinjiang Wang, Jing Chen, Jiazheng Xu, Jiale Zhu, Jiale Cheng, Ji Qi, Guobing Gan, Guo Wang, Cong Yao, Zijun Dou, Zihao Zhou, Zihan Wang, Zhiqi Ge, Zhijie Li, Zhenyu Hou, Zhao Xue, Zehui Wang, Zehan Qi, Zehai He, Yutao Zhang, Yusen Liu, Yukuo Cen, Yuchen Li, Yuan Wang, Yu Yang, Yongbin Liu, Yijian Lu, Yifan Xu, Yanzi Wang, Yanxiao Zhao, Yanfeng Wang, Yadong Xue, Yabo Xu, Xinyu Zhang, Xinyu Liu, Xiao Liu, Wenyi Zhao, Wenkai Li, Tianyu Tong, Tianshu Zhang, Shudan Zhang, Shengdong Yan, Qinkai Zheng, Mingde Xu, Licheng Bao, lat Long long, Jiaxing Xu, Jiaxin Fan, Jiawen Qian, Jiali Chen, Jiahui Lin, Jiadai Sun, Haozhi Zheng, Haoran Wang, Haochen Li, Hanyu Lai, Han Xu, Fan Yang, Dan Zhang, Da Yin, Chuangxin Zhao, Chengcheng Wu, Boyan Shi, Bowen Lv, Bowei Jia, Bo Li, Bin Chen, Baoxu Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Z.ai & Tsinghua University(Z.ai与清华大学)

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)

AI总结 GLM-5V-Turbo旨在提升多模态代理的感知与执行能力,通过整合多模态感知作为推理、规划和工具使用的核心组件,实现跨异构上下文的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11167 2026-05-13 cs.CL cs.AI cs.LG 82%

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

双通道模型:并行语言模型之间双向隐藏状态耦合

Cedric Flamant, Udaya Ghai, Kanna Shimizu

机构 * AWS Agentic AI(AWS智能AI)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双通道模型,通过可训练的神经接口在两个预训练语言模型的中间隐藏状态之间建立双向耦合,实现任务驱动与工具执行的协同,提升多任务性能。

Comments 9 pages main text, 5 figures, 24 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI 81%

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏