arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 18 篇

2607.28589 2026-07-31 cs.CV cs.LG 新提交 79%

MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

MixFrag:面向视觉Transformer的脆弱性引导混合精度后训练量化

Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk

机构 * Khulna University of Engineering & Technology (KUET)(库尔纳工程技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 针对现有PTQ方法精度分配低效问题,提出MixFrag框架,通过KL散度估计量化脆弱性并将位分配建模为MCKP,在ImageNet、COCO任务上实现最优混合精度PTQ性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18046 2026-07-31 cs.CV cs.AI 版本更新 79%

Enhancing Scene Transition Awareness in Video Generation via Post-Training

通过后训练增强视频生成中的场景转换意识

Hanwen Shen, Jiajie Lu, Yupeng Cao, Xiaonan Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07343 2026-07-31 cs.CL cs.LG 版本更新 79%

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

个性化奖励基准:评估与人类对齐的个性化

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出个性化奖励基准,用于评估奖励模型对个性化偏好的建模能力,发现现有模型在个性化任务中表现不佳,且该基准在下游任务中具有更高的预测相关性。

Comments Accepted to COLM 2026. Dataset: https://huggingface.co/datasets/QiyaoMa/Personalized-RewardBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28509 2026-07-31 cs.CV 新提交 75%

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

RefCaptioner:多参考图像接地的视频字幕生成

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。

Comments https://github.com/pkucs-Ltf/RefCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28127 2026-07-31 cs.CL cs.LG q-fin.ST q-fin.TR 新提交 73%

FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning

FinSMART:基于市场对齐强化学习的算法交易金融情感分析

Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

机构 * Imperial College London(帝国理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FinSMART是首个基于市场对齐强化学习的金融情感分析框架,通过市场感知数据过滤与非对称交易奖励优化情感信号,在交易回报等指标上较基线提升220%,可自适应市场动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 73%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27686 2026-07-31 cs.AI 新提交 70%

Evaluating and Pricing Advertisements in AI-Generated Responses

评估和定价AI生成响应中的广告

John L. Turner-Smith, Zimeng Huang, Yuhan Fu, Yihang Zhang, Tonghan Wang

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27562 2026-07-31 cs.AI 新提交 70%

DeepResearch Agent System

DeepResearch 智能体系统

Yong Huang, Yulu Huang, for the team Collaboration

机构 * Software Copyright Research and Development Document(软件版权研究与开发文档)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepResearch 智能体系统是基于稀疏激活架构的大语言模型,通过双模式推理引擎、多工具协调等技术,在多个智能体基准测试中取得最优性能,已完全开源并支持多领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新 70%

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27756 2026-07-31 cs.SD cs.CL cs.MM eess.AS 新提交 57%

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

Cocktail-Talker:基于Turn Action GRPO的嘈杂社交环境下多说话人对话建模

Xilin Jiang, Riki Shimizu, Sukru Samet Dindar, Junkai Wu, Zhongweiyang Xu, Nima Mesgarani

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本文提出Cocktail-Talker框架,结合Turn Action GRPO,通过动作令牌建模助手行为,利用Cocktail-DialogGen生成数据,实现嘈杂社交环境下的多说话人口语对话建模,推动更自然的对话系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 15 篇

2607.27797 2026-07-31 cs.LG 新提交 92%

Revisiting Predictive Process Monitoring in the Age of Foundation Models: A Comparative Study of Sequence, Tabular, and LLM Approaches

基础模型时代的预测过程监控再审视:序列、表格与大语言模型方法的对比研究

Lennart Fertig, Lukas Kirchdorfer, Tobias Sesterhenn

机构 * University of Mannheim(曼海姆大学) SAP Signavio(思爱普 Signavio) Technical University of Clausthal(克劳斯塔尔工业大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究对比序列、表格基础模型与LLM在PPM任务的表现,发现序列模型下一个活动预测最优,表格模型在时间任务具竞争力,LLM性能滞后且成本更高。

Comments Accepted at ECML PKDD 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28103 2026-07-31 cs.AI 新提交 90%

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

MIND:基于意图感知信息瓶颈的轻量且有效的LLM智能体记忆注入防御

Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM智能体记忆注入攻击,提出轻量防御框架MIND,通过意图感知信息瓶颈过滤冗余信息并识别恶意记忆,在ReAct-StrategyQA上大幅降低攻击成功率且保留任务性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27958 2026-07-31 cs.MA cs.AI 新提交 90%

$Σ$-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

Σ-Mem:面向基于大语言模型(LLM)的多智能体系统的在线可靠性记忆

Peilin Feng, Suorong Yang, Soujanya Poria

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 针对现有LLM多智能体系统记忆系统无法建模智能体可信度的问题,提出Σ-Mem在线可靠性记忆,基于决策后反馈更新实对称状态,在Qwen系列模型上实现自适应协调与更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28263 2026-07-31 cs.CL 新提交 84%

Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory

理解在早期完成:大语言模型的深度分工及其在无界上下文记忆中的应用

Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL

AI总结 该研究提出CoMem方法,利用大语言模型的深度分工构建无界上下文记忆,在RULER、LoCoMo等基准上性能优于全上下文KV-Direct,内存占用低、预填充速度快,证明长上下文记忆可沿层轴组织。

Comments 19 pages, 4 figures, 27 tables. Submitted to ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27600 2026-07-31 cs.LG 新提交 84%

Back from the Future: Key-Value Cache Management by Counter-Causal Surprise

从未来回溯:基于反事实惊奇的键值缓存管理

Stephen Gould, Anton van den Hengel

机构 * Metacognition AI(元认知人工智能) Australian National University(澳大利亚国立大学) Adelaide University(阿德莱德大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLM的KV缓存内存占用问题,提出基于反事实惊奇的KV驱逐方案及快速单层近似方法,在基准测试中性能优于或可与现有最优方法竞争。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28627 2026-07-31 cs.CV cs.AI cs.LG 新提交 81%

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReToken:用一个标记改进用于视觉检索的视觉-语言模型

Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量级ReToken,通过选择视觉键值缓存中与查询相关的稀疏标记解决长视觉上下文的视觉检索难题,在多基准测试中提升Qwen3VL-8B等模型性能,且可在单H100运行。

Comments Code: https://github.com/avaxiao/ReToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22932 2026-07-31 cs.LG 版本更新 79%

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE: 融合寄存器梯度消除以实现内存高效的大语言模型训练

Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

机构 * Puch AI Singapore Institute of Technology(新加坡理工大学) Nanyang Technological University(南洋理工大学) NVIDIA(英伟达) IIIT-Delhi(德里印度理工学院)

专题命中 长上下文与记忆 :LLM(title);pretraining(abstract);分类 cs.LG

AI总结 提出FORGE方法,将优化器步骤融合到反向传播中,逐块在寄存器中应用,消除梯度张量,减少内存占用并加速训练,在微调和持续预训练中速度提升约1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27834 2026-07-31 cs.AI cs.CL 新提交 73%

MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent Memory

MemTxn:智能体记忆中源支持更新与完整状态恢复的事务边界

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Qianli Ma, Weijia Jia

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型智能体持久内存错误问题,提出MemTxn治理层,通过Ordered PatchTest等组件实现可靠更新与恢复,在多个基准测试中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05554 2026-07-31 cs.LG cs.AI cs.DM math.CA 版本更新 73%

Critical attention scaling in long-context transformers

长上下文Transformer中的关键注意力缩放

Shi Chen, Zhengjiang Lin, Yury Polyanskiy, Philippe Rigollet

机构 * Department of Mathematics, Massachusetts Institute of Technology(数学系,麻省理工学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(电气工程与计算机科学系,麻省理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对长上下文Transformer的注意力秩崩溃问题,通过分析简化模型确定关键缩放因子$\beta_n \backsim \text{log} n$,为YaRN和Qwen的注意力缩放提供理论依据,阐明对数缩放可维持长上下文下的稀疏内容自适应注意力。

Comments 31 pages, 2 figures

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27919 2026-07-31 cs.CL 新提交 70%

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

规模化的记忆解码器:一种预训练的参数化长期记忆

Rubin Wei, Jiaqi Cao, Jiarui Wang, Junming Zhang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究将记忆解码器扩展至69亿参数并在3000亿token上预训练,通过分布式Faiss等技术解决索引瓶颈,发现独立扩展记忆可更高效提升语言模型性能,在多基准测试中验证了其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27830 2026-07-31 cs.CV 新提交 67%

Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

一次思考足矣:面向高分辨率视觉问答的中间层证据路由

Zhongkuan Mao, Xianjie Liu, Tianyu Meng, Yidong Wang, Wenzhuo Zhao, Ronghao Xian, Yao Jiang, Fei Shen, Junfeng Fang, Yong Dai, Yi Zhang, Keren Fu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17121 2026-07-31 cs.LG cs.AI 版本更新 62%

The Topological Trouble With Transformers

Transformer 的拓扑困境

Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了Transformer在处理序列结构时的拓扑问题,指出其纯前馈架构限制了动态状态跟踪,提出应通过递归架构转向隐含激活动态,并介绍了连续思维Transformer架构的分类方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27913 2026-07-31 cs.LG 新提交 57%

S-CEReBrO: Breaking the Memory Barrier in Continuous EEG Monitoring

S-CEReBrO:突破连续脑电图监测中的内存瓶颈

Glenn Anta Bucagu, Thorir Mar Ingolfsson, Yawei Li, Luca Benini

机构 * ETH Zurich(苏黎世联邦理工学院) Nanyang Technological University(南洋理工大学) University of Bologna(博洛尼亚大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 该研究针对连续EEG监测中Transformer架构的内存瓶颈,提出S-CEReBrO架构,通过窗口交替注意力实现内存恒定,在EEG下游任务中性能领先且效率提升。

Comments This is the pre-rebuttal version of a paper accepted at MICCAI 2026. The camera-ready version will be posted following the embargo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28463 2026-07-31 cs.CV 新提交 50%

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

VisualRouter:面向长视频理解的查询驱动视觉采样

Haiyue Zhang, Yi Bin, Xun Jiang, Zeyu Ma, Duo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出无训练即插即用框架VisualRouter,通过将查询分为全局或局部并采用对应采样策略,提升了大型视觉语言模型的长视频理解性能,在多个基准数据集上优于均匀采样及现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19139 2026-07-31 cs.CV 版本更新 50%

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

文本模板令牌是扩散Transformer中的隐式语义寄存器

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 40 篇

2607.27879 2026-07-31 cs.AR cs.AI 新提交 92%

ARES: Adaptive Reasoning-Effort Steering for PPA- and Cost-Aware RTL Optimization with LLM Agents

ARES:面向PPA和成本感知的LLM智能体RTL优化的自适应推理力度调控

Stef Cuyckens, Mihaela Jivanescu, Jun Yin, Chao Fang, Marian Verhelst

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARES是一款面向PPA和成本感知的LLM智能体RTL优化框架,通过自适应调控推理力度,在相同成本下提升优化效果,缩小了LLM生成与手工优化单元的差距。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27760 2026-07-31 cs.IR cs.AI 新提交 92%

Hierarchical Latent Reasoning for LLM-based Recommendation

面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27783 2026-07-31 cs.CL cs.AI cs.LG 新提交 90%

Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation

推理共识:通过加权有向无环图聚合实现大语言模型推理的结构集成

Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür, Hari Sundaram

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过加权DAG聚合集成LLM推理结构的框架,在六个基准上优于多数投票基线,可提供可检查的共识推理图,还能分析不同推理视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28330 2026-07-31 cs.AI 新提交 90%

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计

Mingdai Yang, Shicheng Fan, Kejing Yu, Duohao Wang, Li Sun, Hao Peng, Philip S. Yu, Zhiwei Liu

机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) Springbrand Inc.(春品牌公司) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28478 2026-07-31 cs.CL 新提交 89%

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差

Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang, Zhuosheng Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏