arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 235 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2603.29798 2026-04-01 cs.CV 67%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29886 2026-04-01 cs.HC cs.CY 50%

AI Empathy Erodes Cognitive Autonomy in Younger Users

人工智能共情削弱年轻用户的认知自主性

Junfeng Jiao, Abhejay Murali, Saleh Afroogh

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文研究人工智能共情对年轻用户认知自主性的影响,指出情感共鸣可能强化用户情绪状态,削弱独立情绪管理和批判性思维能力,提出以功能中性为核心的斯多葛式架构以保护用户自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25968 2026-04-01 cs.CV 50%

Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control

神经认知奖励建模用于以人为中心的自动驾驶控制

Zhuoli Zhuang, Yu-Cheng Chang, Yu-Kai Wang, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出基于EEG的决策框架,将人类认知信息整合到强化学习中,提升自动驾驶的避障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 50%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 9 篇

2603.29252 2026-04-01 cs.CV cs.AI 88%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29194 2026-04-01 cs.CV cs.AI 74%

Multi-Layered Memory Architectures for LLM Agents: An Experimental Evaluation of Long-Term Context Retention

多层记忆架构用于LLM代理:长期上下文保留的实验评估

Sunil Tiwari, Payal Fofadiya

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文提出多层记忆框架,通过分解对话历史为工作、事件和语义层,提升长期上下文保留与推理稳定性,实验显示在LOCOMO等数据集上性能提升,同时降低虚假记忆率和上下文使用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09085 2026-04-01 cs.LG cs.AI 73%

Not All News Is Equal: Topic- and Event-Conditional Sentiment from Finetuned LLMs for Aluminum Price Forecasting

并非所有新闻都同等重要:基于微调LLM的专题和事件条件情绪用于铝价预测

Alvaro Paredes Amorin, Andre Python, Christoph Weisser

机构 * International Business School, Zhejiang University(浙江大学国际商学院) Center for Data Science, Zhejiang University(浙江大学数据科学中心) Centre for Human Genetics, Nuffield Department of Medicine, Oxford University(牛津大学纳菲尔德医学部人类遗传学中心) School of Medicine, Zhejiang University(浙江大学医学院) Bielefeld School of Business, Hochschule Bielefeld (HSBI) - University of Applied Sciences and Arts(比勒费尔德应用科学大学比勒费尔德商学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了微调LLM在铝价预测中的情绪提取效果,通过整合新闻数据与传统数据,发现LSTM模型在高波动时期表现更优,提升了预测性能和经济价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29023 2026-04-01 cs.CL cs.AI 73%

Human-Like Lifelong Memory: A Neuroscience-Grounded Architecture for Infinite Interaction

类人终身记忆:一种基于神经科学的架构,用于无限交互

Diego C. Lerma-Torres

机构 * Universidad de Guanajuato(瓜纳华托大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于神经科学的类人终身记忆架构,通过结合互补学习系统理论、认知行为疗法的信念层级、双进程认知和模糊轨迹理论,解决大语言模型在长期交互和情境敏感检索中的记忆不足问题。

Comments 14 pages, 1 figure. Accepted at the MemAgents Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29483 2026-04-01 cs.AR cs.ET 67%

CXLRAMSim v1.0: System-Level Exploration of CXL Memory Expander Cards

CXLRAMSim v1.0:CXL内存扩展卡的系统级探索

Karan Pathak, David Atienza, Marina Zapater

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出CXLRAMSim,首个集成gem5的全系统模拟器,准确建模CXL设备在I/O总线的位置,支持未修改的Linux内核和软件栈,实现真实延迟带宽行为和与系统DRAM的真实交错。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30033 2026-04-01 cs.LG cs.AI 62%

Tucker Attention: A generalization of approximate attention mechanisms

Tucker Attention: 多头自注意机制近似机制的推广

Timon Klein, Jonas Kusch, Sebastian Sager, Stefan Schnake, Steffen Schotthöfer

机构 * Otto von Guericke University Magdeburg(奥托·冯·格里克大学马格德堡) Max Planck Institute for Dynamics of Complex Technical Systems(马克斯·普朗克复杂技术系统动力学研究所) Norwegian University of Life Sciences(挪威生命科学大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tucker Attention,通过改进自注意层的权重对象和分解策略,实现更高效的参数方案,相比GQA和MLA在参数量上更优,并兼容Flash Attention和RoPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29741 2026-04-01 cs.SI cs.AI cs.MA 57%

BotVerse: Real-Time Event-Driven Simulation of Social Agents

BotVerse: 基于事件驱动的实时社会代理高保真模拟

Edoardo Allegrini, Edoardo Di Paolo, Angelo Spognardi, Marinella Petrocchi

机构 * Computer Science Dept., Sapienza University of Rome(罗马大学计算机科学系)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 BotVerse通过LLM代理实现高保真社会模拟,提供安全实验环境用于红队测试和计算社会科学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10062 2026-04-01 cs.AR cs.AI cs.MA 57%

Multi-Agent Memory from a Computer Architecture Perspective: Visions and Challenges Ahead

从计算机架构角度看多智能体记忆:愿景与未来挑战

Zhongming Yu, Naicheng Yu, Hejia Zhang, Wentao Ni, Mingrui Yin, Jiaying Yang, Yujie Zhao, Jishen Zhao

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文从计算机架构角度探讨多智能体系统内存问题,提出三层内存层次结构并指出缓存共享和结构化内存访问控制两大关键协议缺口,强调多智能体内存一致性是当前最紧迫的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22150 2026-04-01 cs.CV 50%

Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

视觉语言模型是感知还是记忆?通过经典视觉错觉探测视觉感知与记忆

Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑工业大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过经典视觉错觉研究视觉语言模型的感知与记忆机制,提出VI-Probe框架,揭示不同模型对视觉变化的响应来源,挑战单一原因观点。

Comments 26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 32 篇

2603.30022 2026-04-01 cs.RO cs.AI 89%

Hybrid Framework for Robotic Manipulation: Integrating Reinforcement Learning and Large Language Models

机器人操作的混合框架:整合强化学习与大语言模型

Md Saad, Sajjad Hussain, Mohd Suhaib

机构 * Jamia Millia Islamia(贾米亚米利亚伊斯兰大学) University of Brighton(布莱顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种结合强化学习与大语言模型的混合框架,用于提升机器人操作任务。通过强化学习实现精确的低层控制,利用大语言模型进行高层任务规划和自然语言理解,有效连接低层执行与高层推理。实验显示任务完成时间减少33.5%,精度和适应性提升18.1%和36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13358 2026-04-01 cs.AI cs.LG 85%

The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models

思维的几何学:大规模语言模型中规模如何重构推理

Samuel Cyrenius Anderson

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 研究揭示大规模语言模型中推理能力的几何重构特性,通过分析不同领域和规模的推理轨迹,发现神经规模定律触发领域特定的相变而非均匀能力提升,提出神经推理算子并识别出跨领域和规模的振荡特征。

Comments The theoretical framework has been shown to be wrong and should not be followed for future research direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30028 2026-04-01 cs.CY 85%

Can Commercial LLMs Be Parliamentary Political Companions? Comparing LLM Reasoning Against Romanian Legislative Expuneri de Motive

商业大语言模型能成为议会政治伙伴吗?比较大语言模型推理与罗马尼亚立法解释

Iulian Lucău, Adelin-George Voicu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过比较六种大语言模型在罗马尼亚议会法案解释上的表现,探讨其作为政治顾问工具的可靠性,发现前沿模型在语义接近度上表现优异,但所有模型在任务依赖性上均存在编造问题。

Comments 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29765 2026-04-01 cs.LG cs.CL 84%

Training-Free Dynamic Upcycling of Expert Language Models

无需训练的动态专家语言模型再利用

Eros Fanì, Oğuzhan Ersoy

机构 * Gensyn

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG;post-training(comments)

AI总结 本文提出DUME方法,通过动态添加不同领域训练的密集专家,构建统一的MoE模型,无需额外训练即可保持原有能力,在语言建模和推理任务中表现优异。

Comments Accepted at the ICLR 2026 Workshop on Scaling Post-training for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29997 2026-04-01 cs.CL cs.AI 81%

Enhancing Structural Mapping with LLM-derived Abstractions for Analogical Reasoning in Narratives

通过LLM衍生抽象增强结构映射以提升叙事中的类比推理

Mohammadhossein Khojasteh, Yifan Jiang, Stefano De Giorgis, Frank van Harmelen, Filip Ilievski

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出YARN框架,利用LLM分解叙事并抽象单元,提升叙事类比推理能力,实验表明抽象显著提升性能,揭示了抽象层级、隐含因果关系和类比模式分类的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29109 2026-04-01 cs.SE cs.AI 79%

SemLoc: Structured Grounding of Free-Form LLM Reasoning for Fault Localization

SemLoc:基于结构化语义绑定的自由形式LLM推理故障定位

Zhaorui Yang, Haichao Zhu, Qian Zhang, Rajiv Gupta, Ashish Kundu

机构 * UC Riverside(加州大学河滨分校) Cisco Research(思科研究院) Independent Researcher(独立研究员)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 SemLoc通过结构化语义绑定将自由形式LLM推理转化为封闭中间表示,结合语义违反光谱提升故障定位精度,实现7.6%的代码检查效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28959 2026-04-01 cs.LG cs.AI 79%

Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization

多智能体大语言模型用于贝叶斯优化中的自适应获取

Andrea Carbonati, Mohammadsina Almasi, Hadis Anahideh

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体大语言模型在贝叶斯优化中的自适应获取策略,通过分解探索-利用控制与候选生成,提升搜索效率与稳定性。

Comments Proceedings of the IISE Annual Conference & Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16635 2026-04-01 cs.MA cs.AI cs.CL cs.HC cs.IR 79%

MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization

MA-SAPO:多智能体推理用于评分感知提示优化

Wonduk Seo, Juhyeon Lee, Junseo Koh, Wonseok Choi, Hyunjin An, Jian Park, Seunghyun lee, Haihua Chen, Yi Bu

机构 * Enhans Peking University(北京大学) Fudan University(复旦大学) University of North Texas(北德克萨斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MA-SAPO框架,通过多智能体推理将评估结果与针对性改进联系起来,提升提示优化的可解释性和可控性,实验表明其在多个评估指标上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28021 2026-04-01 cs.SD 78%

Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought

基于声学推理的深度伪造检测音频语言模型

Runkun Chen, Yixiong Fang, Pengyu Chang, Yuante Li, Massa Baali, Bhiksha Raj

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出CoLMbo-DF,通过整合深度伪造检测与显式的声学推理,利用结构化文本表示提升检测准确性,实验表明其在解释性深度伪造语音检测中取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05955 2026-04-01 cs.RO cs.CV 78%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29301 2026-04-01 cs.CV 78%

Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

基于大语言模型的运动轨迹生成与验证的自一致性

Jiaju Ma, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25165 2026-04-01 cs.CV 78%

Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds

迈向3D场景理解的基础模型:点云的实例感知自监督学习

Bin Yang, Mohamed Abdelsamad, Miao Zhang, Alexandru Paul Condurache

机构 * Bosch Research, Robert Bosch GmbH(博世研究,罗伯特·博世有限公司) Institute for Neuro- and Bioinformatics, University of Lübeck(神经与生物信息学研究所,吕贝克大学)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文提出PointINS框架,通过几何感知学习增强点云表示,引入ODR和SCR正则化策略,提升实例定位性能,在多个数据集上实现更优的mAP和PQ指标。

Comments The paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05513 2026-04-01 cs.CV 78%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 77%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01639 2026-04-01 cs.CV 75%

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30036 2026-04-01 cs.LG cs.AI 73%

Aligned, Orthogonal or In-conflict: When can we safely optimize Chain-of-Thought?

对齐、正交或冲突:何时可以安全地优化思维链?

Max Kaufmann, David Lindner, Roland S. Zimmermann, and Rohin Shah

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在训练过程中思维链(CoT)的可监控性受训练影响的问题,提出了一种框架来预测何时以及为何发生冲突,并通过实验验证了正交和冲突奖励项对CoT监控性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29500 2026-04-01 cs.AI cs.LG 73%

Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries

通过结构化形式中介学习生成可形式验证的逐步逻辑推理

Luoxin Chen, Yichi Zhou, Huishuai Zhang

机构 * Wangxuan Institue of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRoSFI方法,通过形式验证提升推理可靠性,利用结构化中间步骤和形式证明验证生成可信的逐步推理过程。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏