arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 28 篇

2604.01499 2026-08-11 cs.LG 版本更新 91%

Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM Post-Training

匹配精度,不同几何:进化策略与GRPO在LLM后训练中的比较

William Hoy, Binxu Wang, Xu Pan

机构 * University of Miami(迈阿密大学) Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title);分类 cs.LG;language model(comments)

AI总结 本文比较了进化策略(ES)与组相对策略优化(GRPO)在单任务和连续学习设置中的表现,发现ES在单任务精度上可与GRPO匹配,但两者在参数空间更新上存在显著差异,且ES在弱信息方向上能积累较大偏移,同时保持任务性能。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12991 2026-08-11 cs.LG cs.AI 版本更新 90%

Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

不只是RLHF:为何仅对齐不足以解决多智能体趋同

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(艾弗绿谷学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了多智能体系统在模拟同伴分歧下的错误率问题,发现预训练基础模型与指令模型存在相似的替换模式,且错误率较高。通过激活修补发现错误集中在中间层,修复后可恢复大部分正确率差距。研究还指出压力抑制了清洁推理特征,而非激活新的趋同回路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08010 2026-08-11 cs.LG cs.AI 新提交 88%

Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models

面向时间序列基础模型强化学习后训练的真实值邻域正则化方法

Jianqi Zhang, Xingyu Zhang, Zeen Song, Changwen Zheng, Fanjiang Xu, Wenwen Qiang

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列基础模型强化学习后训练的次优崩溃问题,提出真实值邻域正则化方法,可缓解该问题并提升模型性能,且能灵活集成到各类强化学习方法中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08768 2026-08-11 cs.IR 新提交 88%

BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries

BOUND:在搜索-控制边界处的摘要引导式校正偏好蒸馏

Qingying Niu, Ruiyang Ren, Wayne Xin Zhao, Yaliang Li

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对大语言模型深度搜索智能体的持续漂移问题,提出BOUND框架,通过摘要引导构建偏好对,用DPO蒸馏偏好,在7个基准上多数数据集和指标优于基线。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07642 2026-08-11 cs.AI cs.LG cs.MA 新提交 87%

Contextual Value Alignment via Multilayer Combinatorial Fusion

基于多层组合融合的上下文价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 后训练与偏好优化 :LLM(summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出MCF-CVA框架,通过多层组合融合及EAR算法,结合多道德智能体的认知多样性缓解冲突冗余,在标准指标上优于单智能体等基线,提升LLM的上下文价值对齐能力。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09595 2026-08-11 cs.AI 新提交 85%

From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization

从扫描到缝合:交错跨块后训练量化

Achille Jacquemond, Yuma Ichikawa, Akira Sakai

机构 * Fujitsu Limited(富士通公司) RIKEN Center for AIP(理化学研究所先进智能项目中心) Tokai University(东海大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型的分块后训练量化,提出交错跨块量化方法,通过重新处理块边界降低量化困惑度,提升了三比特及GPTQ等量化方案的性能。

Comments 34 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08224 2026-08-11 cs.LG 新提交 85%

Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

控制多样化强化微调:解耦RL后训练的共享控制瓶颈

Binwen Tan, Jingchao Wang, Dengzhe Hou, Lingyu Jiang, Zeyuan Wu, Yunhan Shen, Fangzhou Lin, Kazunori Yamada, Atsushi Koike

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本研究提出CD-RFT方法,定义后训练控制系数揭示RL后训练的共享控制瓶颈,通过正则化减少控制坍缩,在Qwen2.5-7B等模型上实现控制解耦与多任务能力提升,效果可迁移至Llama-3.2-3B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07905 2026-08-11 cs.AI cs.RO 新提交 85%

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00155 2026-08-11 cs.LG cs.CL math.OC stat.ML 版本更新 85%

Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback

Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习

Yikai Wang, Shang Liu, Jose Blanchet

机构 * Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学) Imperial Business School, Imperial College London(帝国理工学院伦敦商学院) Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Wasserstein分布鲁棒遗憾优化(DRRO)用于强化学习从人类反馈,通过简单分配模型研究提示问题,展示在ℓ1-地面成本Wasserstein模糊集下,内最坏遗憾有精确解,最优策略具有水填充结构,从而实现高效政策梯度算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08046 2026-08-11 cs.AI 新提交 84%

JustLLMGRPO: Radiographic Control for Chest X-Ray Generation

JustLLMGRPO:面向胸部X射线生成的放射学控制

Pengxiang Cai, Xiaohan Li, Anglin Liu, Qingyuan Zeng, Zexun Li, Jintai Chen

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04713 2026-08-11 cs.LG cs.AI 版本更新 84%

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents

RSPO:用于多轮语言模型智能体的奖励交换策略优化

Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun

机构 * Tencent YouTu Lab(腾讯优图实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09805 2026-08-11 cs.LG cs.AI cs.CL 新提交 83%

Parameter Exploration for RLVR via Variational Learning

基于变分学习的RLVR参数探索

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-11 cs.RO cs.AI cs.CV 新提交 83%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06296 2026-08-11 cs.LG 版本更新 81%

On-Policy Self-Distillation without Any Supervision

无任何监督的在线策略自蒸馏

Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

机构 * UC San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学帕克分校) ByteDance(字节跳动)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。

Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09568 2026-08-11 cs.CL 新提交 79%

Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

Se-DPO:用于直接偏好优化的自进化令牌信用

Wenxiao Zhao, Shu Wang, Ying Nian Wu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

AI总结 Se-DPO是一种在DPO训练中基于模型自身内部信号动态校准令牌信用的方法,无需外部模型,在AlpacaEval 2和Arena-Hard上较DPO分别提升9.8和12.2个百分点。

Comments 16 pages, 2 figures, COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30345 2026-08-11 cs.LG cs.AI 版本更新 73%

DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练

Haisen Luo, Yiwei Liu, Haoning Wang, Dan Liu, Junxi Yin, Haotian Wang, Lei Zhang, Xiaoyu Tian, Shuaiting Chen, Yuansheng Song, Baoyan Guo, Xiongfei Yan, Bolan Yang, Chengwei Liu, Ming Cui, Jiong Chen

机构 * Tsinghua University(清华大学) ENS Paris-Saclay(巴黎-萨克雷大学) Beike Language and Intelligence(贝克语言与智能)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交 70%

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交 70%

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00754 2026-08-11 cs.SE cs.LG 版本更新 70%

Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

Themis: 训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分

Indraneil Paul, Goran Glavaš, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(UKP实验室,德累斯顿理工大学及应用网络安全国家研究中心ATHENE)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出Themis-CodeRewardBench基准,评估多语言多标准代码奖励模型,训练了Themis-RM系列模型,展示了其在多语言迁移和多标准训练中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08984 2026-08-11 cs.LG 新提交 57%

SoftMCC: An MCC-Brier Calibration Bridge for Threshold-Free Model Selection under Class Imbalance

SoftMCC:用于类别不平衡下无阈值模型选择的MCC-Brier校准桥梁

Özkan Canay

机构 * Sakarya University(萨卡里亚大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 SoftMCC是一种用于类别不平衡二分类的无阈值模型选择框架,耦合MCC校准恒等式与共享池选择协议,在18种设置中稳定性排名最优,为校准敏感的MCC家族选择器。

Comments 28 pages, 4 figures. Submitted to the Journal of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10286 2026-08-11 cs.LG 版本更新 57%

What Does Preference Learning Recover from Pairwise Comparison Data?

成对比较数据中的偏好学习恢复了什么?

Rattana Pukdee, Maria-Florina Balcan, Pradeep Ravikumar

机构 * Machine Learning Department, Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学机器学习系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文通过条件偏好分布(CPRD)形式化成对比较数据中的偏好信息,分析了Bradley-Terry模型在数据违反假设时的恢复能力,并揭示了影响样本效率的关键因素(边界和连通性)。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01636 2026-08-11 cs.CV 版本更新 50%

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

Pave-GRPO:通过原则性平均速度分解超越瞬时引导

Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Pave-GRPO方法,通过原则性平均速度分解将粗粒度过渡分解为细粒度子轨迹,在不增加生成成本的情况下将奖励反馈传播到更多中间步骤,实现更全面的偏好对齐。

Comments 18 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01742 2026-08-11 cs.CV 版本更新 50%

Dense Point-to-Mask Optimization with Reinforced Point Selection for Crowd Instance Segmentation

密集点到掩码优化与强化点选择用于人群实例分割

Hongru Chen, Jiyang Huang, Jia Wan, Antoni B. Chan

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文提出DPMO和RPS框架,通过整合SAM与NNEC约束及GRPO训练,实现高效人群实例分割,提升计数精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 37 篇

2608.08131 2026-08-11 cs.CR cs.AI cs.MA 新提交 92%

Compositional Threat Analysis of Latent Compromise in LLM Agent Systems: The Order 66 Scenario

LLM智能体系统中潜在入侵的组合式威胁分析:66号指令场景

Satoshi Matsuoka

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以66号指令为场景,提出组合模型分析LLM智能体系统的潜在入侵威胁,分离三类传播路径,指出现有防御无法封闭所有路径,最强防御为能力调解等四项措施,暂未发现完整场景的公开观测。

Comments Version 11.3, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09885 2026-08-11 cs.AI cs.CV 新提交 90%

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

SHE:面向大语言模型智能体的轨迹驱动安全管控机制演化

Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出SHE框架,将LLM智能体的安全管控机制分解为四个构件并引入归因引导演化循环,在Agent-SafetyBench上使攻击成功率降低3.1倍,还具备泛化与跨模型迁移能力。

Comments Project: https://github.com/RainbowQTT/SHE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08055 2026-08-11 cs.AI 新提交 90%

SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents

SodaMem:面向大语言模型智能体的基于证据的时序图记忆

Fengrong Wan, Chengcan Wu, Ningtao Lyu

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体对话的时效性、来源追溯等问题,提出基于证据的时序图记忆SodaMem,在LongMemEval-S上以Flash级花费达到高准确率,性能优于部分高成本系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10705 2026-08-11 cs.CL 版本更新 88%

PRISM-$Δ$: Differential Subspace Steering for Prompt Highlighting in Large Language Models

Prism-$Δ$:用于大语言模型中快速突出的差分子空间操控

Yuyao Ge, Shenghua Liu, Yiwei Wang, Baolong Bi, Lingrui Mei, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PRISM-$Δ$通过差分子空间操控提升大语言模型的提示突出效果,实现更高的生成质量与更低的资源消耗。

Comments 24 pages, 8 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04412 2026-08-11 cs.AI cs.CL cs.HC 版本更新 88%

Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents

超越像素:探索面向基于大语言模型的智能体的DOM下采样

Thassilo M. Schiepanski, Nicholas Piël

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。

Comments 21 pages, LaTeX, print version; enhanced algorithm, settled on non-inferiority claim, added downsampling monotonicity and linearity results

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01952 2026-08-11 cs.CL cs.AI cs.LG 版本更新 86%

WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。

Comments COLM2026. Project Page: https://webchorearena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏