arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 29 篇

2512.14157 2026-07-03 cs.AI cs.CV 版本更新 81%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02479 2026-07-03 cs.CV 新提交 80%

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

EAGLE-360: 360°环境中的具身主动全局到局部探索

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学) Central China Normal University(华中师范大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 80%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 80%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02140 2026-07-03 cs.LG 新提交 79%

Probing Chemical Language Models: Effects of Pre-training and Fine-tuning

探测化学语言模型:预训练与微调的影响

Anna Karnysheva, Dietrich Klakow, Ji-Ung Lee

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 通过探测78种分子子结构,系统研究了预训练和微调对化学语言模型分子结构感知能力的影响,发现预训练提升上层结构意识,微调增强任务相关子结构表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01918 2026-07-03 cs.LG 新提交 79%

Zeus: Towards Tuning-Free Foundation Model for Time Series Analysis

Zeus:面向时间序列分析的无调优基础模型

Yisong Fu, Zezhi Shao, Chengqing Yu, Yujie Li, Yongjun Xu, Xueqi Cheng, Fei Wang

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出统一无调优时间序列基础模型Zeus,通过多尺度Transformer和Multi-Objective Temporal Masking策略,在无需任务特定调优下实现多种分析任务的优异性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02025 2026-07-03 cs.CV 新提交 78%

Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition

评估视觉语言模型作为尼日利亚车牌识别的零样本学习替代方案:对比YOLO与光学字符识别

Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu

专题命中 指令微调 :language model(title,abstract)

AI总结 研究探索视觉语言模型作为尼日利亚车牌识别的统一零样本解决方案,在88张真实图像上评估5种VLM,发现Gemini和Qwen在字符错误率上显著优于YOLO+OCR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01908 2026-07-03 cs.CV 新提交 78%

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

迈向真实世界超声理解:基于多图像检查与长文本报告的大规模视觉语言模型

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI科技(无锡)有限公司) Technical University of Munich(慕尼黑工业大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 通过构建150万次真实超声检查的大规模数据集(含1770万图像和多器官覆盖),采用标准视觉语言模型结合低秩适配微调,无需复杂架构即实现多任务超声理解性能领先。

Comments Project Page: https://medai-t.github.io/LUMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02010 2026-07-03 cs.AI 新提交 77%

InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应

Qianyu Chen, Ziteng Feng, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01849 2026-07-03 cs.LG cs.AI cs.SD 新提交 73%

Decomposer: Learning to Decompile Symbolic Music to Programs

Decomposer: 学习将符号音乐反编译为程序

Yewon Kim, Apurva Gandhi, David Chung, Graham Neubig, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出Decomposer框架,通过两阶段方法(合成数据微调+强化学习优化)将符号音乐反编译为可读、可编辑的程序,在MIDI重建保真度和代码可读性上优于基线。

Comments Project page: https://yewon-kim.com/decomposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02020 2026-07-03 cs.AI 新提交 70%

Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

持续多模态学习中的隐藏遗忘:当准确率幸存但基础失效时

Qianyu Chen, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对持续多模态学习中模型答案准确但证据使用方式改变的问题,提出无重放依赖约束框架RCL,通过冻结旧模型、反事实干预估计证据依赖并联合优化,有效降低隐藏遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 67%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 指令微调 :language model(abstract);post-training(abstract)

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01737 2026-07-03 cs.CV 新提交 67%

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

ReQuest:基于重新思考的问题感知帧选择用于长视频问答

Minkuk Kim, Suyong Yun, Young Tae Kim, Jinyoung Moon, Jinwoo Choi, Seong Tae Kim

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02454 2026-07-03 hep-th 新提交 67%

Boundary observables in string field theory

弦场论中的边界可观测量

Klaus Kaja, Carlo Maccaferri, Ulisses Portugal, Jakub Vošmera

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文从自由弦场论的规范不变作用量出发,定义了类似Brown-York荷的边界可观测量,并给出了开弦和闭弦场论中的例子。

Comments 32 pages, 2 appendices, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01120 2026-07-03 cs.DC 新提交 67%

Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents

下一代智能体强化学习系统实现自进化智能体

Ran Yan, Wei Fu, Jiale Li, Shusheng Xu, Zhiyu Mei, Jiaxuan Gao, Jiarui Zhang, Wentai Zhang, Hao Dai, Xujie Shen, Chuyi He, Zhen Pu, Jun Mei, Zhiyao Lin, Haitao Wang, Zhiqiang Ding, Jiawei Zhang, Huaijie Wang, Ruida Xu, Honghua Dong, Youhe Jiang, Yi Wu, Tongkai Yang, Binhang Yuan

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 针对企业级大规模智能体服务中自进化部署的瓶颈,提出智能体在线强化学习系统需在轨迹数据协议、数据代理和进化控制平面三方面进行协同设计,并通过AReaL2.0实例化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09105 2026-07-03 cs.LG cs.AI quant-ph 版本更新 62%

MetaTT: A Global Tensor-Train Adapter for Parameter-Efficient Fine-Tuning

MetaTT: 一种用于参数高效微调的全局张量列适配器

Javier Lopez-Piqueres, Pranav Deshpande, Archan Ray, Mattia J. Villani, Marco Pistoia, Niraj Kumar

机构 * Global Technology Applied Research(全球技术应用研究)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MetaTT,一种基于张量列(TT)分解的适配器框架,通过共享单个TT因子化Transformer子模块,实现参数高效的多任务微调,并在单任务和多任务基准上达到竞争性性能。

Comments Accepted version to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-07-03 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02158 2026-07-03 cs.CV 新提交 50%

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

面向资源受限消费级GPU的视觉模型与VLM的高效PEFT方法及自适应检查点技术

Altay Toktassyn, Jurn-Gyu Park

机构 * Department of Computer Science, Nazarbayev University(计算机科学系,纳扎尔拜耶夫大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文在2GB VRAM限制下,比较了五种PEFT方法在Transformer和Mamba视觉骨干上的表现,并提出了自适应梯度检查点算法,在CIFAR-100和DTD上评估了准确率、训练时间、能耗及多目标指标。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 15 篇

2504.02327 2026-07-03 cs.CL 版本更新 91%

LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习

Weibin Liao, Xin Gao, Tianyu Jia, Rihong Qiu, Yifan Zhu, Yang Lin, Xinyu Ma, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) Huawei Technologies Co., Ltd(华为技术有限公司) Seed, ByteDance Inc.(字节跳动公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title);language model(title);preference optimization(abstract)

AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。

Comments Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02091 2026-07-03 cs.CL cs.AI cs.IR 版本更新 91%

Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning

通过强化学习优化RAG重排序器与LLM反馈

Yuhang Wu, Xiangqing Shen, Fanfan Wang, Cangqi Zhou, Zhen Wu, Xinyu Dai, Rui Xia

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RRPO框架,通过强化学习将重排序与LLM生成质量对齐,消除了对昂贵人工标注的依赖,实验显示其在知识密集型基准上优于基线模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01083 2026-07-03 cs.LG cs.AI 新提交 88%

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

异步RLHF的陈旧度-学习率缩放定律

Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi

机构 * The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Gradient University of Southern California(南加州大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究异步GRPO中陈旧rollout的影响,推导出陈旧度与学习率之间的缩放定律,揭示稳定性受累积漂移和陈旧度约束的双重条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01964 2026-07-03 cs.CL 新提交 84%

Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing

超越有监督澄清:基于LLM的输入重写用于对话篇章解析

Yiming Liu, Ziyue Zhang, Zhichao Xu, Xin Yu, Yingheng Tang, Tianyu Jiang, Jie Cao

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。

Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01763 2026-07-03 cs.LG cs.CL 新提交 84%

Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training

更密集 ≠ 更好:持续后训练中同策略自蒸馏的局限性

Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过自蒸馏策略优化(SDPO)发现,同策略自蒸馏在持续后训练中会加剧遗忘甚至崩溃,而GRPO等强化学习方法更保守地保留先前能力,表明密集自蒸馏并非默认的稳定器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01830 2026-07-03 cs.LG 新提交 83%

Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

众声归一:面向大模型评判与奖励建模的多角色评分标准生成

Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) LIGHTSPEED Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出多角色评分标准生成框架(MRRG),通过整合多个互补角色的评估标准,消除单一通用评估器的维度盲区,在偏好验证和强化学习奖励信号上均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 82%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 78%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23426 2026-07-03 cs.CV 版本更新 78%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01490 2026-07-03 cs.LG cs.AI 新提交 73%

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

不要让收益消失:解析强化学习中的策略梯度权重

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen

机构 * FAIR at Meta(Meta FAIR) Inria, Ecole Normale Supérieure(法国国家信息与自动化研究所,巴黎高等师范学院) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出FADE方法,通过动态调整优势函数的正负和难度权重,解决RL训练不稳定和多样性崩溃问题,在7B和32B模型上分别提前20k和2k步达到最佳pass@1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01707 2026-07-03 cs.CV 新提交 67%

LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression

LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜

Bowen Yuan, Zijian Wang, Yadan Luo, Shijie Wang, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。

Comments The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17426 2026-07-03 cs.CL cs.AI cs.LG 版本更新 67%

Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging

导航对齐-校准权衡:通过模型合并实现帕累托更优前沿

Tiancheng Hu, Benjamin Minixhofer, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现后训练对齐不仅降低任务准确率,还严重损失校准性能,导致模型过度自信且输出多样性下降。通过简单地在对齐前后模型权重间进行插值,可以持续获得帕累托最优模型,同时提升准确率和恢复校准。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏