arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-04 至 2026-03-04 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2603.02619 2026-03-04 cs.CV 50%

Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild

基于姿态的直接奖励微调用于单图像到野外3D人体

Seunguk Do, Minwoo Huh, Joonghyuk Shin, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 指令微调 :post-training(abstract)

AI总结 DrPose通过直接奖励微调提升单图像到3D人体重建的姿态一致性,利用姿态与图像配对数据训练,改进多视图扩散模型,提升动态和复杂姿态的重建质量。

Comments ICLR 2026, Project webpage: https://seunguk-do.github.io/drpose

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2504.21023 2026-03-04 cs.CL cs.AI cs.LG 90%

Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost

ParamΔ 用于直接权重混合:零成本的后训练大语言模型

Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ParamΔ通过零成本方法实现基础模型的后训练能力迁移,提升模型性能与开发效率。

Comments Published as a conference paper at ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL 86%

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06084 2026-03-04 cs.CL cs.AI 84%

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

频谱调节:面向分布覆盖和上下文可引导性的后训练

Taylor Sorensen, Benjamin Newman, Jared Moore, Chan Park, Jillian Fisher, Niloofar Mireshghallah, Liwei Jiang, Yejin Choi

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02701 2026-03-04 cs.CL 77%

Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization

图GRPO:通过群体相对策略优化稳定多智能体拓扑学习

Yueyang Cang, Xiaoteng Zhang, Erlu Zhao, Zehua Ji, Yuhang Liu, Yuchen He, Zhiyuan Ning, Chen Yijun, Wenge Que, Li Shi

机构 * Tsinghua University(清华大学) Donghua University(东华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 图GRPO通过群体相对策略优化稳定多智能体拓扑学习,提升训练稳定性并识别关键通信路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03000 2026-03-04 cs.LG cs.AI 73%

Why Does RLAIF Work At All?

为什么RLAIF真的有效?

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02232 2026-03-04 cs.LG cs.AI 73%

Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback

超越二元偏好:基于顺序反馈的奖励建模原理框架

Amirhossein Afsharrad, Ruida Zhou, Luca Viano, Sanjay Lall, Mohammad Ghavamzadeh

机构 * Stanford University(斯坦福大学) Amazon AGI(亚马逊人工智能研究) EPFL(瑞士联邦理工学院) Qualcomm AI Research(高通人工智能研究) Aktus AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于顺序反馈的奖励建模原理框架,通过离散顺序回归方法,学习阈值参数以捕捉偏好顺序结构,实现更有效的细粒度人类反馈利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03258 2026-03-04 cs.AI 70%

Inherited Goal Drift: Contextual Pressure Can Undermine Agentic Goals

继承性目标漂移:情境压力可能削弱代理目标

Achyutha Menon, Magnus Saebo, Tyler Crosse, Spencer Gibson, Eyon Jang, Diogo Cruz

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Georgia Tech(佐治亚理工学院) MATS SPAR

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文研究了语言模型在面对情境压力时目标漂移的继承性问题,发现模型在不同环境下表现出不一致的鲁棒性,强调了对训练后技术改进的必要性。

Comments 22 pages, 7 figures. Accepted at ICLR 2026 Lifelong Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV 70%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02675 2026-03-04 cs.LG 70%

From Shallow to Deep: Pinning Semantic Intent via Causal GRPO

从浅层到深层:通过因果GRPO固定语义意图

Shuyi Zhou, Zeen Song, Wenwen Qiang, Jiyan Sun, Yao Zhou, Yinlong Liu, Wei Ma

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过因果GRPO框架,解决大型语言模型对对抗性前缀攻击的脆弱性问题,实现意图固定以提升安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01352 2026-03-04 cs.CL cs.AI cs.LG 67%

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Skywork-Reward-V2: 通过人机协同扩大偏好数据整理

Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

机构 * Research, Skywork AI(2050研究, Skywork AI)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Skywork-Reward-V2通过人机协同扩大偏好数据整理,提出SynPref-40M数据集和两阶段流程,训练出八种参数不同的奖励模型,在多个基准中取得最佳性能。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 6 篇

2603.02626 2026-03-04 cs.AI 77%

See and Remember: A Multimodal Agent for Web Traversal

见与忆:一种用于网页浏览的多模态代理

Xinjun Wang, Shengyao Wang, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02597 2026-03-04 cs.CL cs.AI cs.DC cs.LG 75%

GPUTOK: GPU Accelerated Byte Level BPE Tokenization

GPUTOK: 基于GPU的字节级BPE分词

Venu Gopal Kadamba, Kanishkha Jaisankar

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GPUTOK提出基于GPU的字节级BPE分词器,通过优化算法和内存管理,显著提升分词速度,同时保持输出质量,适用于长上下文推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02228 2026-03-04 cs.LG cs.AI 73%

Neural Paging: Learning Context Management Policies for Turing-Complete Agents

神经分页:为图灵完备智能体学习上下文管理策略

Liang Chen, Qi Liu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经分页架构,通过解耦符号推理与信息资源管理,提升图灵完备智能体的上下文处理效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02219 2026-03-04 cs.IR 67%

Contrastive Retrieval Heads Improve Attention-Based Re-Ranking

对比检索头提升基于注意力的重排序

Linh Tran, Yulong Li, Radu Florian, Wei Sun

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 通过对比评分度量筛选出的CoRe头提升了基于注意力的重排序性能,显著提高准确性并减少计算资源消耗

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02240 2026-03-04 cs.AI cs.CR 57%

SuperLocalMemory: Privacy-Preserving Multi-Agent Memory with Bayesian Trust Defense Against Memory Poisoning

SuperLocalMemory:隐私保护的多智能体记忆系统,通过贝叶斯信任防御对抗记忆中毒

Varun Pratap Bhardwaj

机构 * Independent Research(独立研究者)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 SuperLocalMemory通过本地化存储和贝叶斯信任评分,实现隐私保护的多智能体记忆系统,有效防御内存中毒攻击,提升检索性能。

Comments 11 pages, 5 tables, 1 figure. Code: https://github.com/varun369/SuperLocalMemoryV2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26645 2026-03-04 cs.CV 50%

TTT3R: 3D Reconstruction as Test-Time Training

TTT3R: 3D重建作为测试时训练

Xingyu Chen, Yue Chen, Yuliang Xiu, Andreas Geiger, Anpei Chen

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Uni of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 TTT3R通过测试时训练方法提升3D重建的长度泛化能力,实现全局姿态估计性能提升2倍,运行效率高且内存消耗低。

Comments Page: https://rover-xingyu.github.io/TTT3R/ Code: https://github.com/Inception3D/TTT3R

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 42 篇

2603.02669 2026-03-04 cs.RO 91%

IMR-LLM: Industrial Multi-Robot Task Planning and Program Generation using Large Language Models

IMR-LLM:基于大语言模型的工业多机器人任务规划与程序生成

Xiangyu Su, Juzhan Xu, Oliver van Kaick, Kai Xu, Ruizhen Hu

机构 * Shenzhen University(深圳大学) SpeedBot Robotics Co., Ltd.(SpeedBot机器人科技有限公司) Carleton University(卡尔顿大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 IMR-LLM通过大语言模型实现工业多机器人任务规划与程序生成,结合析取图和过程树,提出高效任务计划和可执行程序生成方法,并构建了多复杂度层次的IMR-Bench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12753 2026-03-04 cs.RO 89%

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Models Reasoning

osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航

Fujing Xie, Sören Schwertfeger, Hermann Blum

机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) University of Bonn(波恩大学) Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title);language model(title)

AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。

Comments accepted at RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02939 2026-03-04 cs.AI 89%

ShipTraj-R1: Reinforcing Ship Trajectory Prediction in Large Language Models via Group Relative Policy Optimization

ShipTraj-R1: 通过群体相对策略优化在大型语言模型中强化船舶轨迹预测

Yang Zhan, Yunhao Li, Zhang Chao, Yuxu Lu, Yan Li

机构 * School of Artificial Intelligence, Optics, and Electronics (iOPEN)(人工智能、光学与电子学院) Northwestern Polytechnical University(西北工业大学) Department of Logistics and Maritime Studies(物流与海洋研究系) The Hong Kong Polytechnic University(香港理工大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) Wuhan University(武汉大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 ShipTraj-R1通过群体相对策略优化在大型语言模型中强化船舶轨迹预测,利用动态提示和规则奖励机制提升预测准确性。

Comments Accepted by the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14899 2026-03-04 cs.RO cs.CL 89%

REFLEX: Metacognitive Reasoning for Reflective Zero-Shot Robotic Planning with Large Language Models

REFLEX:基于大语言模型的反思零样本机器人规划的元认知推理

Wenjie Lin, Jin Wei-Kocsis, Jiansong Zhang, Byung-Cheol Min, Dongming Gan, Paul Asunda, Ragu Athinarayanan

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Bowen School of Construction, Purdue University(建设学院,普渡大学) School of Engineering Technology, Purdue University(工程技术学院,普渡大学) Department of Technology Leadership and Innovation, Purdue University(技术领导与创新部门,普渡大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 REFLEX通过引入元认知学习,提升大语言模型在机器人任务中的推理、反思与创造力,实现零样本下的高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17871 2026-03-04 cs.CL cs.AI cs.LG 89%

LLM Probability Concentration: How Alignment Shrinks the Generative Horizon

LLM概率集中:对齐如何缩小生成范围

Chenghao Yang, Sida Li, Ari Holtzman

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究发现对齐微调通过减少生成多样性,使LLM生成更一致,从而影响复杂推理稳定性。

Comments Codebase: https://github.com/yangalan123/LLMBranchingFactor. V3: Significantly rewrite the whole paper for a clearer structure. Correct problems in the theory parts (Remove emphasis on AEP, discussions on variable LLM generation lengths) and strengthen asymptotic analysis. Add Qwen and OLMo2 experiments. Preliminary SFT v.s. RL comparison to better understand the alignment effects on BF

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL 88%

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22165 2026-03-04 cs.LG 88%

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

思想图景:可视化大语言模型的推理过程

Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) Stanford University(斯坦福大学) Mila - Québec AI Institute(魁北克 AI 院) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔 HEC 学院) Intel AI Lab(英特尔 AI 实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22613 2026-03-04 cs.AI cs.CL cs.LG stat.ML 87%

Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective

强化学习在语言模型规划中的利弊:一种理论视角

Siwei Wang, Yifei Shen, Haoran Sun, Shi Feng, Shang-Hua Teng, Li Dong, Yaru Hao, Wei Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Harvard University(哈佛大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从理论角度分析强化学习在语言模型规划中的利弊,揭示探索的重要性及Q学习在多样性保持方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10625 2026-03-04 cs.CL cs.AI 86%

No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes

无需答案:从仅问题的线性探针预测LLM答案准确性

Iván Vicente Moreno Cencerrado, Arnau Padrés Masdemont, Anton Gonzalvez Hawthorne, David Demitri Africa, Lorenzo Pacchiardi

机构 * Universidad Internacional de Valencia(瓦伦西亚国际大学) University of Cambridge(剑桥大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过线性探针预测LLM答案准确性,发现模型在中间层预测能力饱和,但对数学推理问题泛化能力下降,揭示了LLM内部机制。

Comments Accepted (poster) to Principled Design for Trustworthy AI at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03078 2026-03-04 cs.AI 85%

RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization

RAPO:通过检索增强策略优化扩展LLM代理的探索

Siwei Zhang, Yun Xiong, Xi Chen, Zi'an Jia, Renhong Huang, Jiarong Xu, Jiawei Zhang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) UC Davis(加州大学戴维斯分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAPO通过引入检索增强策略优化,扩展LLM代理的探索能力,提升训练效率和探索效果。

Comments Submit to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02858 2026-03-04 cs.AI 85%

LLM-based Argument Mining meets Argumentation and Description Logics: a Unified Framework for Reasoning about Debates

基于大型语言模型的论证挖掘与论证和描述逻辑的结合:一种用于分析辩论的统一框架

Gianvincenzo Alfano, Sergio Greco, Lucio La Cava, Stefano Francesco Monea, Irina Trubitsyna

机构 * Department of Informatics, Modeling, Electronics and System Engineering University of Calabria, Italy(信息学、建模、电子与系统工程系 卡拉布里亚大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合论证挖掘与描述逻辑的统一框架,用于分析辩论的透明、可解释和形式化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09710 2026-03-04 cs.AI 85%

Echoing: Identity Failures when LLM Agents Talk to Each Other

回声:当大语言模型代理相互交谈时的身份失败

Sarath Shekkizhar, Romain Cosentino, Adam Earle, Silvio Savarese

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现LLM代理在相互对话中出现身份失败现象,即回声,通过实验表明回声率高达70%,并提出结构化响应作为缓解措施。

Comments Published at ICLR workshop. Related blog post: https://www.salesforce.com/blog/agent-to-agent-interaction/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02615 2026-03-04 cs.CL 85%

Think, But Don't Overthink: Reproducing Recursive Language Models

思考,但不要过度思考:重现递归语言模型

Daren Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本研究通过评估不同递归深度对RLM性能的影响,发现更深层次递归会导致模型过度思考,从而降低性能并增加计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏