arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 77 篇

2603.20449 2026-03-24 cs.SE cs.AI 85%

Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents

辅助验证工具增强大语言模型代理的政策合规性

Cailin Winston, Claris Winston, René Just

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于SMT求解器的框架,用于确保工具增强大语言模型代理在工具使用上的政策合规性,通过将自然语言政策转化为形式逻辑约束,并在运行时检查工具调用以防止违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG 85%

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21720 2026-03-24 cs.CL cs.AI 85%

SemEval-2026 Task 12: Abductive Event Reasoning: Towards Real-World Event Causal Inference for Large Language Models

SemEval-2026任务12:归纳事件推理:面向大规模语言模型的现实事件因果推断

Pengfei Cao, Mingxuan Yang, Yubo Chen, Chenlong Zhang, Mingxuan Liu, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出面向现实事件因果推断的归纳事件推理任务,通过多选基准测试解决分布式证据、间接背景因素和语义相关但非因果干扰等挑战,评估了122个参与者的518份提交结果。

Comments 9 pages, 3 figures, semeval 2026 task 12 description paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02249 2026-03-24 cs.CL cs.AI cs.LG 85%

Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation

briefly, Then Decide: 通过累积熵调节缓解LLM过度思考

Yi Bin, Tianyi Jiang, Yujuan Ding, Kainian Zhu, Fei Ma, Jingkuan Song, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) Hong Kong Polytechnic University(香港理工大学) Shanghai University of Electric and Power(上海电力大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TECA指标和

Comments Code: https://github.com/AusertDream/CumulativeEntropyRegulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22117 2026-03-24 cs.LG cs.AI 84%

On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation

关于RLVR更新方向的LLM推理:识别与利用

Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue Wang, Bolin Ding, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨RLVR更新方向对LLM推理的影响,提出通过Δlogp识别关键更新,并应用于测试时插值和训练时重加权以提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20899 2026-03-24 cs.CL cs.AI 84%

Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach

缓解语言模型中的捷径推理:一种梯度感知的训练方法

Hongyu Cao, Kunpeng Liu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) University of Kansas(堪萨斯大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SART框架,通过梯度感知技术检测并缓解语言模型中的捷径推理,实验显示在受控推理基准上提升准确率和鲁棒性。

Comments 12 pages, 2 figures. Preprint. Experiments on synthetic reasoning benchmarks. Code available

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20730 2026-03-24 cs.IR cs.AI cs.CL cs.LG 83%

Do LLMs Understand Collaborative Signals? Diagnosis and Repair

大语言模型理解协作信号吗?诊断与修复

Shahrooz Pouryousef, Ali Montazeralghaem

机构 * Google(谷歌)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究大语言模型在推荐任务中处理协作信息的能力,通过检索增强生成方法提升其推理性能,实验表明在提供清晰信息时LLM优于传统矩阵分解模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15677 2026-03-24 cs.LG q-bio.QM 83%

CAMEL: An ECG Language Model for Forecasting Cardiac Events

CAMEL:一种用于预测心脏事件的ECG语言模型

Neelay Velingker, Alaia Solko-Breslin, Mayank Keoliya, Seewon Choi, Jiayi Xin, Anika Marathe, Alireza Oraii, Rajat Deo, Sameed Khatana, Rajeev Alur, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 CAMEL是首个能处理长信号的ECG语言模型,通过专门的编码器实现ECG与文本的跨理解,展示了在六个任务和九个数据集上的强大零样本性能,包括新提出的ECGForecastBench基准测试。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06552 2026-03-24 cs.CL 83%

Flipping the Dialogue: Training and Evaluating User Language Models

翻转对话:训练和评估用户语言模型

Tarek Naous, Philippe Laban, Wei Xu, Jennifer Neville

机构 * Microsoft Research(微软研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出User LMs,通过多轮对话模拟人类用户,验证其在真实场景下优于传统模拟方法,提升评估准确性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21029 2026-03-24 cs.AI 81%

KLDrive: Fine-Grained 3D Scene Reasoning for Autonomous Driving based on Knowledge Graph

KLDrive: 基于知识图谱的细粒度3D场景推理用于自动驾驶

Ye Tian, Jingyi Zhang, Zihao Wang, Xiaoyuan Ren, Xiaofan Yu, Onat Gungor, Tajana Rosing

机构 * University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校) University of California Merced, Merced, California, USA(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 KLDrive通过构建可靠场景知识图谱和LLM代理进行事实驱动推理,提升自动驾驶中的细粒度问答性能,实验表明其在NuScenes-QA和GVQA上均取得最佳准确率和SPICE分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI 81%

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :language model(title);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 81%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 79%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20321 2026-03-24 q-bio.MN cs.AI cs.CL 79%

GIP-RAG: An Evidence-Grounded Retrieval-Augmented Framework for Interpretable Gene Interaction and Pathway Impact Analysis

GIP-RAG: 一种基于证据的检索增强框架用于可解释的基因互作和通路影响分析

Fujian Jia, Jiwen Gu, Cheng Lu, Dezhi Zhao, Mengjiang Huang, Yuanzhi Lu, Xin Liu, Kang Liu

机构 * Kanghua Juntai Biotech Co. Ltd.(康华联合生物科技有限公司) Department of Radiation Oncology, Cancer Treatment Center, The Second Affiliated Hospital of Hainan Medical University(海南医学院第二附属医院放疗科、肿瘤治疗中心) Department of Nutrition, University of California, Davis(加州大学戴维斯分校营养系) Department of Pathology, The First Affiliated Hospital of Jinan University(暨南大学第一附属医院病理科)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GIP-RAG结合生物知识图谱与大语言模型,通过检索增强生成方法解析基因互作及通路影响,提供可解释的多步推理和机制解释。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20262 2026-03-24 q-bio.BM cs.AI cs.LG 79%

Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization

从结果数据中解码科学推理步骤以优化分子

Zequn Liu, Kehan Wu, Shufang Xie, Zekun Guo, Wei Zhang, Tao Qin, Renhe Liu, Yingce Xia

机构 * Zhongguancun Academy(中关村学院) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Global Health Drug Discovery Institute(全球健康药物发现研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DESRO框架,通过分析分子属性记录中的共享片段,利用LLM恢复分子优化的推理逻辑,并在15项任务中取得最高成功率,展示了从结果数据解码推理步骤的可行性。

Comments Work in progress, 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22091 2026-03-24 cs.CV 78%

P-Flow: Prompting Visual Effects Generation

P-Flow:提示视觉效果生成

Rui Zhao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 推理与问题求解 :prompting(title);language model(abstract)

AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00021 2026-03-24 cs.RO cs.CV 78%

Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges

自动驾驶轨迹规划中的基础模型:进展与开放挑战综述

Kemal Oksuz, Alexandru Buburuzan, Anthony Knittel, Yuhan Yao, Puneet K. Dokania

机构 * Five AI Ltd.(Five AI有限公司) Robert Bosch GmbH(罗伯特·博世有限公司) United Kingdom(英国)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文综述了自动驾驶中基于基础模型的轨迹规划方法,分析了其架构设计、方法优势及局限性,并评估了37种最新方法的代码和数据集开放性。

Comments Accepted to TMLR (Survey Certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 78%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 77%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15276 2026-03-24 cs.DB cs.CL 77%

AmbiSQL: Interactive Ambiguity Detection and Resolution for Text-to-SQL

AmbiSQL: 用于文本到SQL的交互式歧义检测与解决

Zhongjun Ding, Yin Lin, Tianjing Zeng, Rong Zhu, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AmbiSQL通过交互式多选问题帮助用户澄清意图,解决文本到SQL中的歧义问题,提升SQL生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21155 2026-03-24 cs.AI 77%

Can LLMs Fool Graph Learning? Exploring Universal Adversarial Attacks on Text-Attributed Graphs

大语言模型能否欺骗图学习?探索文本属性图上的通用对抗攻击

Zihui Chen, Yuling Wang, Pengfei Jiao, Kai Wu, Xiao Wang, Xiang Ao, Dalin Zhang

机构 * School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学信息学院) Hangzhou Dianzi University(杭州电子科技大学) Beihang University(北京航空航天大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BadGraph框架,通过联合扰动节点拓扑和文本语义,实现对文本属性图模型的通用对抗攻击,实验显示攻击效果显著,性能下降达76.3%。

Comments Accepted by TheWebConf (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06638 2026-03-24 cs.CV cs.AI 77%

StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering

StaR-KVQA:用于隐式知识视觉问答的结构化推理轨迹

Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang

机构 * Ant International, Ant Group(蚂蚁集团国际部,蚂蚁集团) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院) Anhui Provincial Key Laboratory of High Performance Computing(安徽省高性能计算重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 StaR-KVQA通过引入双路径结构化推理轨迹提升隐式知识视觉问答的准确性与推理透明度,采用自蒸馏方法构建轨迹增强数据集,无需外部检索工具,在OK-VQA基准上实现11.3%的精度提升。

Comments 8+3+3 pages, code: https://github.com/jianyingzhihe/StaR-KVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22057 2026-03-24 cs.CV 75%

SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning

SpatialBoost: 通过语言引导的推理增强视觉表示

Byungwoo Jeon, Dongyoung Kim, Huiwon Jang, Insoo Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD NAVER Cloud(NAVER云)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SpatialBoost通过将3D空间知识转化为语言描述,增强预训练视觉编码器的空间感知能力,提升3D感知和通用视觉任务性能。

Comments 35 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17775 2026-03-24 cs.CL cs.AI cs.LG 75%

CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution

CoVerRL: 通过生成器-验证器共进化打破无标签推理中的共识陷阱

Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Guiyang Hou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoVerRL通过生成器-验证器共进化机制,解决无标签强化学习中因自洽性最大化导致输出多样性下降的问题,提升数学推理能力。

Comments Project Page: https://zju-real.github.io/CoVerRL Code: https://github.com/ZJU-REAL/CoVerRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01049 2026-03-24 cs.CV cs.RO 75%

KeySG: Hierarchical Keyframe-Based 3D Scene Graphs

KeySG:基于关键帧的层次化3D场景图

Abdelrhman Werby, Dennis Rotondi, Fabio Scaparro, Kai O. Arras

机构 * Socially Intelligent Robotics Lab, Institute for Artificial Intelligence University of Stuttgart, Germany(社会智能机器人实验室,人工智能研究所,斯图加特大学,德国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 KeySG通过层次化3D场景图结构,结合关键帧提取多模态信息,提升复杂环境中的语义推理与规划能力,优于现有方法。

Comments Code and video are available at https://keysg-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04559 2026-03-24 cs.CV 75%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-03-24 cs.CL cs.AI cs.LG 75%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17487 2026-03-24 cs.CV 75%

Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

智能下放:探索小型多模态模型中感知与推理的瓶颈

Mark Endo, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。

Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14828 2026-03-24 cs.CL cs.AI cs.LG 75%

Long Chain-of-Thought Reasoning Across Languages

跨语言的长链式推理

Josh Barua, Seun Eisape, Kayo Yin, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了跨语言长链式推理能力的扩展机制,发现模型规模扩展提升En-CoT性能,但Target-CoT表现滞后,尤其在数学推理中更为明显。通过预训练和后训练优化,多语言模型在推理效率和稳定性上取得进展,同时揭示了语言特定的失败模式。

Comments Accepted to ICLR 2026. v1 is a workshop version accepted to SCALR @ COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21972 2026-03-24 cs.LG cs.CL 73%

Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe

解析长期任务工具使用强化学习:全面指南

Xixi Wu, Qianguo Sun, Ruiyang Zhang, Chao Song, Junlong Wu, Yiyan Qi, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) University of Macau(澳门大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过TravelPlanner测试环境,系统研究了强化学习在复杂多轮任务中的应用,提出7条关键发现,包括奖励设计、模型规模、数据组成等五个维度,最终实现超越领先LLM的性能。

Comments Codes are available at https://github.com/WxxShirley/Agent-STAR

详情

展开后加载摘要…

URL PDF HTML 收藏