arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 1 篇

2603.15510 2026-06-24 cs.LG 版本更新 92%

Not All Invariants Are Equal: Curating Training Data to Accelerate Program Verification with SLMs

并非所有不变式都同等重要:利用SLM通过精选训练数据加速程序验证

Ido Pinto, Yizhak Yisrael Elboher, Haoze Wu, Nina Narodytska, Guy Katz

机构 * Hebrew University of Jerusalem, Israel(特拉维夫大学) Amherst College, USA(阿默斯特学院) VMware Research by Broadcom, USA(Broadcom VMware 研究)

专题命中 预训练与数据 :SLM(title_cn,summary_cn);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Wonda数据筛选流水线,通过AST归一化和LLM语义重写从原始验证器输出中提取高质量训练不变式,微调小语言模型(SLM)后,在多个模型上使不变式正确性和加速率翻倍甚至三倍,小模型性能媲美大模型。

Comments A preprint of the ICML 2026 paper with the same title

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 3 篇

2511.21056 2026-06-24 cs.LG cs.CL math.OC 版本更新 90%

Bilevel Data Curation for LLM Fine-tuning: Offline Selection and Online Self-Refining Generation

大语言模型微调的双层数据策展:离线选择与在线自优化生成

Quan Xiao, Yutong Xuan, Gaowen Liu, Ramana Rao Kompella, Tianyi Chen

机构 * Cornell University(康奈尔大学) Cisco Research(思科研究)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出双层框架结合离线数据选择与在线自优化生成,提升微调数据质量,理论证明优于直接混合,实验验证效果。

Comments updated the theories and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03867 2026-06-24 cs.CL cs.AI 版本更新 85%

A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs and Knowledge Graphs

一种基于LLM和知识图谱的无训练混合智能体框架用于多文档摘要

Cuong Vuong Tuan, Trang Mai Xuan, Tien-Cuong Nguyen, Vu-Duc Ngo, Thien Van Luong

机构 * Faculty of Artificial Intelligence and Data Science, Phenikaa University(人工智能与数据科学学院,泛尼克大学) VNPT AI, VNPT Group(VNPT AI,VNPT集团) MobiFone Research and Development Center, MobiFone Corporation(MobiFone研发与开发中心,MobiFone公司) Business AI Lab, Faculty of Data Science and Artificial Intelligence, National Economics University, College of Technology(商业人工智能实验室,数据科学与人工智能学院,国家经济大学,技术学院)

专题命中 指令微调 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练、结合大语言模型和知识图谱的混合智能体框架,通过分解摘要任务为专用智能体(抽取、知识感知抽象、迭代精炼)并利用多视角一致性机制,在英文和越南语数据集上取得领先性能。

Comments Accepted by Neural Computing and Applications

Journal ref Neural Comput & Applic 38, 538 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08245 2026-06-24 cs.CV cs.AI 版本更新 79%

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 3 篇

2604.01127 2026-06-24 cs.CR 版本更新 91%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03070 2026-06-24 cs.LG cs.AI 版本更新 87%

ASymPO: Asymmetric-Scale Policy Optimization for Asynchronous LLM Post-Training Without Behavior Information

ASymPO: 用于异步大语言模型后训练的非对称尺度策略优化(无需行为信息)

Zehua Liu, Yuxuan Yao, Xiaojin Fu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.AI、cs.LG

AI总结 针对异步强化学习中陈旧响应导致的分布漂移问题,提出非对称尺度策略优化(ASymPO),通过归一化每个响应的令牌损失来恢复零和平衡,无需行为策略概率。

Comments incorrect proofs in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14659 2026-06-24 eess.AS cs.LG cs.SD 版本更新 77%

Aligning Audio Captions with Human Preferences

对齐音频字幕与人类偏好

Kartik Hegde, Rehana Mahfuz, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc.(高通技术公司)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出基于人类反馈强化学习的音频字幕生成框架,通过CLAP奖励模型微调基线系统,无需真实标注即可生成更符合人类偏好的字幕。

Comments This paper has been accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 6 篇

2601.11957 2026-06-24 cs.CL 版本更新 88%

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

PEARL: 基于强化学习的自我进化时间管理助手

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Viven

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 针对日历冲突解决任务,提出PEARL框架,通过外部偏好记忆和逐轮奖励优化,显著降低LLM代理的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17473 2026-06-24 cs.CV cs.AI 版本更新 70%

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

双锚定:解决视觉语言导航中的状态漂移问题

Kangyi Wu, Pengna Li, Kailin Lyu, Xi Lin, Lin Zhao, Qingrong He, Jinjun Wang, Jianyi Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Johns Hopkins University(约翰霍普金斯大学) Joy Future Academy, JD(京东探索研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20892 2026-06-24 cs.AI 版本更新 70%

Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs

表示干预使大语言模型在终身学习中实现知识记忆控制

Xuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang, Yujun Yan, Haifeng Chen, Zhengzhang Chen

机构 * Dartmouth College(达特茅斯学院) NEC Laboratories America(NEC美国实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RILKE方法,通过在模型表示空间中进行干预,实现大语言模型的终身知识控制,有效更新知识并保持通用性。

Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: ACL 2026, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13645 2026-06-24 cs.LG 版本更新 70%

FuseSampleAgg: One-Pass Neighborhood Estimation for Budgeted Knowledge-Graph Refresh and Validation

FuseSampleAgg: 预算知识图谱刷新与验证的单遍邻域估计

Aleksandar Stanković, Haoran Du, Xinming Wang

机构 * University of Novi Sad(诺维萨德大学) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种融合的PyTorch CUDA算子,通过单遍采样和聚合实现邻域均值估计,避免显式子图构建,在保持GraphSAGE-mean语义的同时,将端到端步延迟提升2.24-3.48倍,瞬态内存降低至1/160。

Comments 11 pages. Code and reproducibility scripts: https://github.com/SV25-22/FuseSampleAgg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21321 2026-06-24 cs.LG cs.AR math.OC 版本更新 57%

Dynamic Symmetric Point Tracking: Tackling Non-ideal Reference in Analog In-memory Training

动态对称点跟踪:解决模拟内存训练中的非理想参考问题

Quan Xiao, Jindan Li, Zhaoxian Wu, Tayfun Gokmen, Tianyi Chen

机构 * Department of Electrical and Computer Engineering, Cornell University, New York, NY(康奈尔大学电气与计算机工程系) IBM T. J. Watson Research Center, Yorktown Heights, NY(IBM 沃森研究中心) Rensselaer Polytechnic Institute, Troy, NY(伦塞拉尔理工学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 针对模拟内存计算中非理想器件导致的权重更新偏向对称点问题,提出动态对称点估计方法,在训练中跟踪对称点并保证收敛,结合数字信号处理技术增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04560 2026-06-24 cs.RO 版本更新 50%

From Local Corrections to Generalized Skills: Improving Neuro-Symbolic Policies with MEMO

从局部修正到通用技能:利用MEMO改进神经符号策略

Benjamin A. Christie, Yinlong Dai, Mohammad Bararjanianbahnamiri, Simon Stepputtis, Dylan P. Losey

机构 * Collab Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, USA.(机械工程系,弗吉尼亚理工学院,黑斯堡,美国) TEA Lab(TEA实验室)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 针对机器人神经符号策略中技能不足的问题,提出MEMO框架,通过收集、聚类和改写多用户自然语言修正,构建检索增强的技能手册,动态扩展技能库,实现新任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 12 篇

2509.21543 2026-06-24 cs.RO 版本更新 91%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11790 2026-06-24 cs.CL cs.AI 版本更新 90%

Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions

使用未见过的随机变量问题对LLM的数学推理进行基准测试

Zijin Hong, Hao Wu, Su Dong, Junnan Dong, Yilin Xiao, Yujing Zhang, Zhu Wang, Feiran Huang, Linyi Li, Hongxia Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Tencent Youtu Lab(腾讯优图实验室) Beihang University(北京航空航天大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 86%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07774 2026-06-24 cs.IR cs.AI 版本更新 84%

GR2: Generative Reasoning Re-ranker

生成式推理重排序器

Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon

机构 * Meta AI

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20510 2026-06-24 cs.AI 版本更新 83%

Grounded Chess Reasoning in Language Models via Master Distillation

通过大师蒸馏实现语言模型中的接地国际象棋推理

Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Queen’s University(皇后大学) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00869 2026-06-24 cs.CL 版本更新 79%

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难

Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Texas A&M University(德克萨斯A&M大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19684 2026-06-24 cs.CV 版本更新 78%

TSegAgent: Zero-Shot Tooth Segmentation via Geometry-Aware Vision-Language Agents

TSegAgent:通过几何感知的视觉-语言代理实现零样本牙科分割

Shaojie Zhuang, Lu Yin, Guangshun Wei, Yunpeng Li, Xilu Wang, Yuanfeng Zhou

机构 * Shandong University(山东大学) University of Surrey(Surrey大学) King's College London(伦敦国王学院)

专题命中 推理与问题求解 :language agent(title);foundation model(abstract)

AI总结 本文提出TSegAgent,通过几何推理而非数据驱动方法,实现零样本牙科分割,减少标注成本并提升泛化能力。

Comments MICCAI 2026; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06395 2026-06-24 cs.CL 版本更新 77%

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages

AfriqueLLM: 数据混合与模型架构如何影响非洲语言的持续预训练

Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(魁北克AI研究所) LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) Microsoft AI for Good Research Lab(微软AI for Good研究实验室)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过持续预训练26B tokens,在20种非洲语言上构建了AfriqueLLM模型套件,系统研究了数据组成和模型架构对下游性能的影响,发现数据组成是主要驱动因素,且架构选择比模型规模更重要。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04883 2026-06-24 cs.CL cs.LO 版本更新 70%

Optimizing the Cost-Quality Tradeoff of Agentic Theorem Provers in Lean

优化 Lean 中智能定理证明器的成本-质量权衡

Kári Rögnvaldsson, Chenhao Sun, Jasper Dekoninck, Martin Vechev

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种包含数据平面和控制平面的动作路由智能体,通过观察失败轨迹并估计成功概率与成本来动态决定继续证明或重新分解,在 PutnamBench 子集上平均降低 25.8% 成本且保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01482 2026-06-24 cs.AI 版本更新 70%

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

通过群体相对策略优化在结构因果模型中 grounding 多跳推理

Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06138 2026-06-24 cs.MM cs.AI cs.HC 版本更新 57%

Multimedia and Visual Analytics in the Agentic Era

代理时代的多媒体与可视化分析

Marcel Worring, Jan Zahálka, Stef van den Elzen, Maximilian T. Fischer, Daniel A. Keim

机构 * University of Amsterdam(阿姆斯特丹大学) Czech Technical University in Prague(布拉格捷克技术大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出一个框架,将多媒体与可视化分析结合,以支持专业用户从大规模多媒体集合中获取可操作见解,实现人类与AI的真正协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 50%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 评测与基准 18 篇

2509.03647 2026-06-24 cs.CL cs.AI cs.LG 版本更新 93%

Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

打破镜像:基于激活的LLM评估者自我偏好缓解方法

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) School of Computer Science(计算机科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对LLM评估者自我偏好偏见,提出轻量级引导向量方法,在推理时无需重训练即可将不公正自我偏好降低97%,但存在稳定性问题。

Comments Presented at {Mechanistic Interpretability, Evaluations, Reliable-ML} Workshops, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22548 2026-06-24 cs.CL cs.AI cs.LG 版本更新 91%

Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer

机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Martian Research, San Francisco, California, USA(火星研究公司) Apart Research, San Francisco, California, USA(Apart研究公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24622 2026-06-24 cs.AI cs.LG 版本更新 91%

Random Rule Forest (RRF): Interpretable and Manageable Ensembles of LLM-Generated Questions for Predicting Success from Unstructured Data

随机规则森林 (RRF): 基于LLM生成问题的可解释且可控集成方法用于从非结构化数据预测成功

Ben Griffin, Aaron Ontoyin Yin, Diego Vidaurre, Ugur Koyluoglu, Joseph Ternasky, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford, United Kingdom Aarhus University, Aarhus, Denmark Centre de Recerca Matem\`atica, Barcelona, Spain Oliver Wyman, New York, United States Vela Research, San Francisco, United States

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出随机规则森林 (RRF),利用大语言模型生成简单的是/否问题作为弱学习器,通过等权投票形成可审计的“绿旗”评分卡,在低基准率任务中实现透明且竞争性的预测性能。

Comments 25 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13505 2026-06-24 cs.CL cs.AI cs.LG 版本更新 91%

Ensemble Learning for Large Language Models in Text and Code Generation: A Survey

面向文本与代码生成的大语言模型集成学习综述

Mari Ashiga, Wei Jie, Fan Wu, Vardan Voskanyan, Fateme Dinmohammadi, Paul Brookes, Jingzhi Gong, Zheng Wang

机构 * School of Computing and Engineering, University of West London(西伦敦大学计算机与工程学院) Turing Intelligence Technology Limited(图灵智能科技有限公司) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了七种大语言模型集成方法(权重合并、知识融合、混合专家、奖励集成、输出集成、路由和级联),分析了它们在文本与代码生成中提升多样性、输出质量和应用灵活性的能力。

Comments Accepted by IEEE TAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16131 2026-06-24 cs.CL 版本更新 90%

SciZoom: A Large-scale Benchmark for Hierarchical Scientific Summarization across the LLM Era

SciZoom:面向LLM时代的大规模层次化科学摘要基准

Han Jang, Junhyeok Lee, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University Hospital(首尔国立大学医院) Seoul National University College of Medicine(首尔国立大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对LLM时代科学摘要的多粒度需求,构建了包含2020-2025年四大ML顶会44946篇论文的基准,提供摘要、贡献和TL;DR三层摘要,压缩比达600:1,并揭示LLM辅助写作导致短语模式剧变和修辞风格同质化。

Comments 14 pages, 8 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏