arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交 85%

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07993 2026-07-10 cs.CL cs.LG 新提交 82%

Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator

幻觉自我博弈:通过进化生成器引导强化检测器

Shiping Yang, Shining Liang, Weihao Liu, Wenbiao Ding, Linjun Shou, Lu Cheng, Angel X. Chang

机构 * Simon Fraser University(西蒙 Fraser大学) Microsoft(微软) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对高质量标注数据稀缺致识别LLM生成输出中幻觉困难及现有方法局限,提出幻觉自我博弈框架,含检测器和生成器,经多轮训练优化,能在无外部监督下提升小型LLM性能。

Comments Accepted to COLM 2026. Camera-ready version to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08255 2026-07-10 cs.AI 新提交 81%

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

竞争然后合作:前沿人工智能教师构建可验证课程以提升编码学生超越模仿

Miseong Shawn Kim

机构 * Genesis Cortex AI Inc.(创世纪皮层人工智能公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究探讨大型语言模型作教师时的教学问题,提出竞争然后合作框架,让四个前沿人工智能教师先对决排名,再合作构建课程提升学生。发现执行验证下教师解决标准问题情况,模仿不一定提升学生,合作课程能提升学生,强调合作构建可验证环境的价值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08409 2026-07-10 cs.CL cs.AI 新提交 79%

When Synthetic Speech Is All You Have: Better Call GRPO

当你只有合成语音时:最好调用GRPO

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交 75%

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 70%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07937 2026-07-10 cs.CL 新提交 57%

When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

当去偏措施适得其反:基于预处理的刻板印象缓解的反直觉副作用

Yahan Zheng, John Guerrerio, Soroush Vosoughi, Weicheng Ma

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 研究基于预处理的刻板印象缓解方法的副作用,通过两个模型家族、多种策略及不同数据规模验证副作用存在,标准基准常忽略,注意力分析显示副作用与注意力流变化无关,还讨论评估意义并提供诊断方法及主张透明缓解措施。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 12 篇

2502.15543 2026-07-10 cs.CL cs.AI 版本更新 87%

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08284 2026-07-10 cs.AI 新提交 81%

Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench

通过PredicateLongBench理解长上下文任务的难度轴

Siddhartha Jain, Ameya Velingker

机构 * NVIDIA

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型长上下文能力评估不足,提出PredicateLongBench基准,通过识别满足谓词的最长连续子序列压力测试长上下文推理,探索多个难度轴,用两种生成管道实验,发现前沿模型在难度提升时表现不佳,助于理解能力局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05583 2026-07-10 cs.CL cs.AI 新提交 81%

ResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modeling

ResonatorLM:用于高效长上下文语言模型的因果共振场混合

Archie Chaudhury

机构 * Axionic Labs(轴子实验室)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer等模型处理长上下文效率低的问题,提出ResonatorLM机制,将令牌序列视为潜场,用阻尼谐振器因果函数替代注意力点积,在传统架构上实现并测试,取得训练和预填充加速、高解码速度及准确率提升等成果。

Comments 8 Pages. Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08399 2026-07-10 cs.CL cs.LG 新提交 79%

Prompt Compression via Activation Aggregation

通过激活聚合进行提示压缩

Thibaud Ardoin, Semira Einsele, Evis Bregu, Gerhard Wunder

机构 * Freie Universität Berlin(柏林自由大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨能否将指令提示的任务相关信息压缩成单个激活向量注入模型,利用中间层激活的学习加权和实现了这一点,压缩向量保留关键信息且准确率下降小,还揭示了语言模型激活空间的结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21074 2026-07-10 cs.NI 版本更新 75%

RepLLM: Toward Automatically Reproducing Network Research Results

RepLLM:迈向自动重现网络研究结果

Yining Jiang, Yunxin Xu, Wenyun Xu, Yufan Zhu, Rui Liu, Tangtang He, Haiying Huang, Letian Zhu, Qingyu Song, Qiang Su, Lizhao You, Lu Tang, Wanjian Feng, Yuchao Zhang, Linghe Kong, Qiao Xiang, Jiwu Shu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。

Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12145 2026-07-10 cs.LG 版本更新 74%

Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling

阈值差分注意力:用于无汇、超稀疏和非分散语言建模

Xingyue Huang, Xueying Ding, Mingxuan Ju, Yozen Liu, Neil Shah, Tong Zhao

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) Snap Inc

专题命中 长上下文与记忆 :language model(title);分类 cs.LG

AI总结 本文提出阈值差分注意力机制,解决长上下文下的注意力汇问题,实现超稀疏和鲁棒性提升,无需投影方法或标准注意力的噪声积累。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08716 2026-07-10 cs.AI cs.CL 新提交 73%

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

记住重要时刻:用于长期任务智能体的主动记忆智能体

Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao

机构 * Meta AI

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究长期任务中智能体决策时行为状态衰减问题,提出用主动记忆智能体并行干预,更新记忆库并决定是否提醒。该方法在多个基准测试中提升了智能体性能,消融实验证明其优势,还训练模型实现部分迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06269 2026-07-10 cs.AI cs.CL 新提交 73%

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

从应用层模拟到原生元架构:结构张力作为异构人工智能进化的内生驱动因素

Heting Mao

机构 * Shanghai Lixin University of Accounting and Finance(上海立信会计金融大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型无状态需应用层模拟的问题,提出理论框架,引入结构张力、离线循环回路、推理时可塑性三种机制,使模型实例能演化出不同拓扑结构,构成异构智能生态,重新定位治理为架构智能主要标准。

Comments 17 pages, 1 equation, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08395 2026-07-10 cs.CR cs.CL 新提交 70%

Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents

令牌流防火墙:持久人工智能代理的语义运行时审计

Puji Wang, Yingchen Zhang, Ruqing Zhang, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学北京校区)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对持久人工智能代理不安全内容传播问题,提出TokenWall运行时防御框架,通过对令牌流进行语义审计及相关操作,实现安全-效用权衡,实验显示其有效降低攻击成功率,保持高良性通过率且增加延迟少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08032 2026-07-10 cs.LG 新提交 70%

What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents

保留什么,遗忘什么:大语言模型和智能体中内存压缩的率失真视角

Ashwin Gerard Colaco, Nada Lahjouji

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型和智能体内存压缩问题,提出基于率失真视角统一分类各层方法,构建七轴分类法并转移机制,还针对相关问题未被测量及缺乏统一基准的情况,转化为提案、实验、原则并梳理开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08459 2026-07-10 cs.IR cs.DL 新提交 50%

Conversational Retrieval and On-the-Fly Knowledge Modeling of Historical Penitentiary Repression Records

历史监狱镇压记录的对话检索与实时知识建模

Paula Font Solà, Adrià Molina Rodríguez, Josep Lladós

专题命中 长上下文与记忆 :language model(abstract)

AI总结 针对历史数字图书馆管理,提出支持实时知识建模的文档分析系统,通过图结构存储事实,经专业交互实现跨源检索,可处理复杂查询,生成更丰富全面信息。

Comments Accepted at ICDAR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20644 2026-07-10 cs.CV 版本更新 50%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 长上下文与记忆 :language model(abstract)

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 33 篇

2606.05622 2026-07-10 cs.CL 版本更新 92%

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench: 在世界约束和用户约束下评估大语言模型智能体的自适应规划能力

Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu, Qing Zong, Heng Wang, Jeonghwan Kim, Yumeng Wang, Bingxiang He, Xiusi Chen, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有基准未充分探索渐进揭示的双重约束下的自适应规划问题,提出动态交互基准AdaPlanBench,通过307个家务任务和可扩展的约束构建流程,评估LLM智能体在交互中根据反馈迭代调整计划的能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20014 2026-07-10 cs.LG cs.AI 新提交 92%

Hierarchical Control in Multi-Agent Games: LLM-based Planning and RL Execution

多智能体博弈中的层次化控制:基于LLM的规划与RL执行

Jannik Hösch, Alessandro Sestini, Florian Fuchs, Amir Baghi, Joakim Bergdahl, Iolanda Leite, Konrad Tollmar, Jean-Philippe Barrette-LaPierre, Linus Gisslén

机构 * Electronic Arts KTH Royal Institute of Technology(皇家理工学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLM作为中央策略控制器选择RL技能策略的层次化架构,在2v2对抗环境中达到与手工BT相当的胜率,且被感知为最类人。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08018 2026-07-10 cs.AI 新提交 91%

Concretized Proposition Prompting Resolves Composition-Knowledge Dichotomy in Large Language Models

具体化命题提示解决大语言模型中的组合-知识二分法

Changhun Lee, Minguk Jeon, Jongkyung Shin, Chiehyeon Lim

机构 * Columbia University(哥伦比亚大学) UNIST(全南科学技术大学) POSCO Holdings(POSCO控股)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);foundation model(abstract)

AI总结 研究针对大语言模型组合-知识二分法难题,提出具体化命题提示(CPP)框架。通过明确相关命题具体化,提升推理性能,尤其在医学基准测试中表现突出,且可扩展到多种模型和参数规模,弥合两类方法差距,解决了二分法问题。

Comments 9

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07989 2026-07-10 cs.CR cs.AI cs.IR cs.LG cs.MA 新提交 90%

Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems

谁破坏了系统?基于大语言模型的多智能体系统中的故障定位

Yufei Xia, Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(得克萨斯大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的多智能体系统故障定位问题,提出AgentLocate框架,结合基于LLM的判断与多视角验证,通过置信感知策略聚合评估结果并微调判断,实验表明该框架在识别责任智能体和故障步骤上优于现有方法且高效。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07779 2026-07-10 cs.CL cs.AI 新提交 90%

From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier

从求解器到研究:前沿研究中的大语言模型驱动形式数学

Eric Jiang, Xiao Liang, Yikai Zhang, Yingjia Wan, Mengting Li, Haikang Deng, Alexander K. Taylor, Justin Baker, Rushil Raghavan, Junyi Zhang, Ying Nian Wu, Andrea L. Bertozzi, Kai-Wei Chang, Raghu Meka, Matthew Sottile, Nanyun Peng, Amit Sahai, Terence Tao, Wei Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 探讨AI4Math领域进展,指出当前系统处理前沿数学问题有局限。主张从预定义求解器转向研究代理,对该领域进行系统综述,识别现有系统局限性,为AI4Math未来发展规划战略路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20899 2026-07-10 cond-mat.mtrl-sci cs.AI 版本更新 88%

Predicting Scale-Up of Metal-Organic Framework Syntheses with Large Language Models

利用大语言模型预测金属有机框架合成的可扩展性

Peter Walther, Hongrui Sheng, Xinxin Liu, Bin Feng, Reid Coyle, Xinhua Yan, Kyle Smith, Harrison Kayal, Shyam Chand Pal, Zhiling Zheng

机构 * Department of Chemistry, Washington University(华盛顿大学化学系) Fudan University(复旦大学) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) College of Chemistry and Materials Science, Fujian Normal University(福建师范大学化学与材料科学学院) Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出ESU-MOF数据集和正例未标记学习策略,通过大语言模型预测MOF合成的可扩展性,准确率达91.4%,助力工业级MOF发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 85%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08080 2026-07-10 cs.CL 新提交 84%

MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction

MASTE:一种用于零样本方面情感三元组提取的多智能体管道

Ao Hong, Lehang Wang, Zhirun Yue, Mingxin Wang, Zihan Wang, Houde Liu

机构 * Tsinghua University(清华大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对方面情感三元组提取问题,提出多智能体管道MASTE,将其分解为四个阶段,由专门智能体处理不同子任务,实现完全无训练的零样本提取,在多个基准测试中显著优于基线,缩小与全监督方法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08046 2026-07-10 cs.CL cs.AI 新提交 84%

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

大语言模型预测器知道但不说的内容:探究校准和忠实性的内部表示

Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对预测微调的大语言模型校准和忠实性问题,通过在中间激活上训练表示池探测器,发现其校准效果更好,还能评估CoT忠实性、追踪行为变化等,证明探究内部表示可用于校准、审计和分类语言模型预测器及推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08700 2026-07-10 cs.CL 新提交 81%

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

深度研究源归因的基准测试:评估用于验证引用的前沿模型

Ethan Leung, Elias Lumer, Corey Feld, Austin Huber, Vamse Kumar Subbiah, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.(普华永道商业技术与创新办公室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究深度研究系统中引用质量校准问题,用现成LLM对1248个评分决策与黄金标准标签对比,发现较便宜模型有竞争力,校准模型是用引用评分作奖励信号的前提,校准不须最昂贵模型。

详情

展开后加载摘要…

URL PDF HTML 收藏