arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-13 至 2026-03-13 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2603.11617 2026-03-13 cs.CV 50%

Noise-aware few-shot learning through bi-directional multi-view prompt alignment

通过双向多视图提示对齐实现噪声感知的少样本学习

Lu Niu, Cheng Xue

机构 * Southeast University(东南大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 指令微调 :language model(abstract)

AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 9 篇

2603.12246 2026-03-13 cs.AI cs.CL cs.LG 89%

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

检验推理LLM作为裁判在不可验证LLM后续训练中的表现

Yixin Liu, Yue Yu, DiJia Su, Sid Wang, Xuewei Wang, Song Jiang, Bo Liu, Arman Cohan, Yuandong Tian, Zhengxing Chen

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11661 2026-03-13 cs.SD 87%

Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models

Resonate:通过来自大音频语言模型的在线反馈强化文本到音频生成

Xiquan Li, Junxi Liu, Wenxi Chen, Haina Zhu, Ziyang Ma, Xie Chen

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);pretraining(abstract);preference optimization(abstract)

AI总结 Resonate通过整合在线GRPO和大音频语言模型奖励,提升文本到音频生成的音频质量和语义对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11901 2026-03-13 cs.LG 83%

FlexRec: Adapting LLM-based Recommenders for Flexible Needs via Reinforcement Learning

FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求

Yijun Pan, Weikang Qiu, Qiyao Ma, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12163 2026-03-13 cs.LG cs.AI math.ST stat.ML stat.TH 81%

A Quantitative Characterization of Forgetting in Post-Training

后训练中遗忘的定量刻画

Krishnakumar Balasubramanian, Shiva Prasad Kasiviswanathan

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计系) Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了后训练中遗忘的定量刻画,通过理论分析揭示了不同KL目标对遗忘形式的影响,并探讨了回放与这些目标的交互作用,最终提出了保留旧质量与控制漂移的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11089 2026-03-13 cs.SD cs.MM eess.AS 78%

V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation

V2A-DPO:面向视频到音频生成的多偏好优化

Nolan Chan, Timmy Gang, Yongqian Wang, Yuzhe Liang, Dingdong Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 V2A-DPO通过多偏好优化提升视频到音频生成的质量,结合AudioScore评分系统和课程学习策略,在VGGSound数据集上实现了优于DDPO和预训练基线的性能。

Comments Accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11126 2026-03-13 cs.MA cs.CL 77%

Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion

通过多智能体系统和组合融合增强大语言模型的价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出VAS-CFA框架,通过多智能体和组合融合提升大语言模型的价值对齐,实验证明其在标准度量上优于现有方法。

Comments 5 pages, 3 figures, accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12228 2026-03-13 cs.LG cs.AI 73%

Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights

神经丛林:多样化的任务专家在预训练权重周围密集分布

Yulu Gan, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种简单并行的后训练方法,通过随机扰动和多数投票发现预训练权重周围密集分布的任务专家,提升大规模模型性能。

Comments codes are provided at https://github.com/sunrainyg/RandOpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11494 2026-03-13 cs.DB 67%

PRMB: Benchmarking Reward Models in Long-Horizon CBT-based Counseling Dialogue

PRMB:基于长期horizon认知行为疗法对话的奖励模型基准测试

Yougen Zhou, Qin Chen, Ningning Zhou, Jie Zhou, Liang He

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 PRMB提出了一种用于评估奖励模型在多会话CBT咨询中长期效果的基准,揭示了现有方法的不足并展示了生成奖励模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24873 2026-03-13 cs.AI cs.CL 62%

Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem

让它流动:在摇滚与铁中进行代理创造,构建ROME模型于一个开放的代理学习生态系统中

Weixun Wang, XiaoXiao Xu, Wanhe An, Fangwen Dai, Wei Gao, Yancheng He, Ju Huang, Qiang Ji, Hanqi Jin, Xiaoyang Li, Yang Li, Zhongwen Li, Shirong Lin, Jiashun Liu, Zenan Liu, Tao Luo, Dilxat Muhtar, Yuanbin Qu, Jiaqiang Shi, Qinghui Sun, Yingshui Tan, Hao Tang, Runze Wang, Yi Wang, Zhaoguo Wang, Yanan Wu, Shaopan Xiong, Binchen Xu, Xander Xu, Yuchi Xu, Qipeng Zhang, Xixia Zhang, Haizhou Zhao, Jie Zhao, Shuaibing Zhao, Baihui Zheng, Jianhui Zheng, Suhang Zheng, Yanni Zhu, Mengze Cai, Kerui Cao, Xitong Chen, Yue Dai, Lifan Du, Tao Feng, Tao He, Jin Hu, Yijie Hu, Ziyu Jiang, Cheng Li, Xiang Li, Jing Liang, Xin Lin, Chonghuan Liu, ZhenDong Liu, Zhiqiang Lv, Haodong Mi, Yanhu Mo, Junjia Ni, Shixin Pei, Jingyu Shen, XiaoShuai Song, Cecilia Wang, Chaofan Wang, Kangyu Wang, Pei Wang, Tao Wang, Wei Wang, Ke Xiao, Mingyu Xu, Tiange Xu, Nan Ya, Siran Yang, Jianan Ye, Yaxing Zang, Duo Zhang, Junbo Zhang, Boren Zheng, Wanxi Deng, Ling Pan, Lin Qu, Wenbo Su, Jiamang Wang, Wei Wang, Hu Wei, Minggang Wu, Cheng Yu, Bing Zhao, Zhicheng Zheng, Bo Zheng

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理学习生态系统(ALE)的开源代理ROME,通过数据合成协议和交互感知策略优化算法,在多个基准测试中展现出优异性能,验证了ALE的有效性。

Comments 36 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 10 篇

2603.11228 2026-03-13 cs.CL cs.AI cs.LG 90%

Markovian Generation Chains in Large Language Models

大语言模型中的马尔可夫生成链

Mingmeng Geng, Amr Mohamed, Guokan Shang, Michalis Vazirgiannis, Thierry Poibeau

机构 * ENS-PSL & CNRS-Lattice(ENS-PSL与CNRS-Lattice) MBZUAI & Ecole Polytechnique(MBZUAI与巴黎高等理工学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大语言模型中迭代推理过程的演变,通过马尔可夫链建模发现句子多样性受温度参数和初始输入影响,揭示了迭代推理的动力学及其对多智能体系统的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11619 2026-03-13 cs.CR cs.AI 85%

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

驯服OpenClaw:自主LLM代理威胁的分析与缓解

Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li

机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11798 2026-03-13 cs.AI 77%

DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering

DocSage:一个多文档多实体问答的信息结构代理

Teng Lin, Yizhang Zhu, Zhengxuan Zhang, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DocSage通过动态模式发现、结构化信息提取和模式感知推理,解决多文档多实体问答中的跨文档证据链构建和实体关系推断问题,实现超过27%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12191 2026-03-13 cs.CL 70%

Long-Context Encoder Models for Polish Language Understanding

长上下文编码器模型用于波兰语言理解

Sławomir Dadas, Rafał Poświata, Marek Kozłowski, Małgorzata Grębowiec, Michał Perełkiewicz, Paweł Klimiuk, Przemysław Boruta

机构 * National Information Processing Institute(国家信息处理研究所) PKO Bank Polski(波兰PKO银行)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种能够处理长文档的波兰语言模型,通过两阶段训练和知识蒸馏压缩模型,在25个任务中展现优异的长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11564 2026-03-13 cs.CL 70%

Where Matters More Than What: Decoding-aligned KV Cache Compression via Position-aware Pseudo Queries

关键-值(KV)缓存中更重要的是什么:通过位置感知的伪查询实现解码对齐的KV缓存压缩

Zhenxu Tian, Yi Su, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DapQ,通过位置感知的伪查询实现解码对齐的KV缓存压缩,有效减少内存占用并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11495 2026-03-13 cs.CL 70%

Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs

尝试、检查并重试:一种提升LLMs长上下文工具调用性能的分而治之框架

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du, Dacheng Tao

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Tool-DC框架,通过'尝试-检查-重试'范式提升LLMs在长上下文工具调用任务中的性能,实验表明其在多个基准测试中均优于基线方法。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00744 2026-03-13 cs.DB cs.CL cs.IR 70%

CARROT: A Learned Cost-Constrained Retrieval Optimization System for RAG

CARROT:一种用于RAG的学得式成本约束检索优化系统

Ziting Wang, Haitao Yuan, Wei Dong, Gao Cong, Feifei Li

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CARROT通过MCTS和配置代理优化RAG检索,提升检索效率与准确性,实验显示性能提升达30%。

Comments Accepted to ICDE 2026. Updated title (previously "CORAG: A Cost-Constrained Retrieval Optimization System for Retrieval-Augmented Generation")

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19113 2026-03-13 cs.NI 67%

Agent Discovery in Internet of Agents: Challenges and Solutions

在智能体互联网中的智能体发现:挑战与解决方案

Shaolong Guo, Yuntao Wang, Zhou Su, Yanghe Pan, Qinnan Hu, Tom H. Luan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种两阶段能力发现框架,通过自主能力声明和任务驱动的发现机制,提升智能体互联网中智能体能力发现的性能与可扩展性。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Network, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09982 2026-03-13 cs.CL cs.AI 62%

AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic

AraModernBERT:阿拉伯语的转令牌初始化和长上下文编码器建模

Omar Elshehy, Omer Nacar, Abdelbasset Djamai, Muhammed Ragab, Khloud Al Jallad, Mona Abdelazim

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 AraModernBERT通过转令牌初始化和长上下文建模提升了阿拉伯语的编码器性能,验证了其在多种自然语言理解任务中的有效性。

Comments 9 pages, 1 figure. Accepted at AbjadNLP Workshop, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11073 2026-03-13 cs.SE 50%

Context Before Code: An Experience Report on Vibe Coding in Practice

上下文在代码之前:关于在实践中使用Vibe编码的经验报告

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。

Comments 6 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 36 篇

2603.11351 2026-03-13 cs.RO cs.AI 92%

Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning

通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应

Hong Lu, Pierrick Lorang, Timothy R. Duggan, Jivko Sinapov, Matthias Scheutz

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10000 2026-03-13 cs.CL cs.LG 91%

Beyond the Prompt in Large Language Models: Comprehension, In-Context Learning, and Chain-of-Thought

大型语言模型中的提示之外:理解、上下文学习与推理链

Yuling Jiao, Yanming Lai, Huazhen Lin, Wensen Ma, Houduo Qi, Defeng Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型在提示之外的理解、上下文学习和推理链机制,揭示了模型通过自回归过程推断转移概率、减少提示歧义以及分解复杂问题的能力,为高级提示工程提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11896 2026-03-13 cs.CV cs.AI cs.CL 88%

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

边看边想:多轮视频推理的在线流式段级内存

Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, Jun Zhao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12908 2026-03-13 cs.CV cs.AI 88%

DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning

DeepSport: 一种基于代理强化学习的多模态大语言模型,用于通过主动推理实现综合体育视频理解

Junbo Zou, Haotian Xia, Zhen Ye, Shengjie Zhang, Christopher Lai, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Rice University(Rice大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学 Irvine分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 DeepSport通过代理强化学习实现多运动视频理解,首次端到端训练多任务模型,显著提升性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11082 2026-03-13 cs.SE cs.AI 85%

Quality-Driven Agentic Reasoning for LLM-Assisted Software Design: Questions-of-Thoughts (QoT) as a Time-Series Self-QA Chain

以质量为导向的代理推理用于大语言模型辅助软件设计:问题-思考(QoT)作为时间序列自我QA链

Yen-Ku Liu, Yun-Cheng Tsai

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出QoT框架,通过时间序列自我QA链提升大语言模型辅助软件设计的质量,通过多领域实验验证其在不同模型规模和复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03668 2026-03-13 cs.LO cs.AI 85%

Can LLM Aid in Solving Constraints with Inductive Definitions?

大语言模型能否帮助解决带有归纳定义的约束?

Weizhi Feng, Shidong Shen, Jiaxiang Liu, Taolue Chen, Fu Song, Zhilin Wu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经符号方法,利用大语言模型生成辅助引理,提升求解涉及归纳定义的约束的能力,实验表明其在证明任务上的有效性。

Comments Accepted by the 27th Symposium on Formal Methods (FM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18607 2026-03-13 cs.AI 85%

From Entity-Centric to Goal-Oriented Graphs: Enhancing LLM Knowledge Retrieval in Minecraft

从以实体为中心到以目标为导向的图:增强Minecraft中的LLM知识检索

Jonathan Leung, Yongjie Wang, Zhiqi Shen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出目标导向图(GoG)框架,通过构建目标依赖关系图提升LLM在Minecraft中的步骤推理能力,实验表明其优于GraphRAG等方法。

Comments Accepted at Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17053 2026-03-13 cs.CL cs.AI cs.DB 85%

Knowledge Distillation with Structured Chain-of-Thought for Text-to-SQL

基于结构化思维链的知识蒸馏用于文本到SQL

Khushboo Thaker, Yony Bresler

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出Struct-SQL框架,通过结构化思维链知识蒸馏提升小型语言模型在文本到SQL任务中的性能,实现8.1%的准确率提升。

Comments Accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026). This is the extended version containing additional details and appendices omitted from the camera-ready proceedings due to space constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 83%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01214 2026-03-13 cs.CL cs.LG 79%

Reasoning Boosts Opinion Alignment in LLMs

推理提升大语言模型中的观点一致性

Frédéric Berdoz, Yann Billeter, Yann Vonlanthen, Roger Wattenhofer

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏