Automatic Essay Scoring and Feedback Generation in Basque Language Learning
巴斯克语言学习中的自动作文评分与反馈生成
专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI
AI总结 本文首次公开了针对巴斯克语C1水平的自动作文评分与反馈生成数据集,通过微调开源模型提升评分与反馈质量,验证了编码器模型的可靠性及监督微调对性能的提升。
Comments Accepted to LREC 2026
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
巴斯克语言学习中的自动作文评分与反馈生成
专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI
AI总结 本文首次公开了针对巴斯克语C1水平的自动作文评分与反馈生成数据集,通过微调开源模型提升评分与反馈质量,验证了编码器模型的可靠性及监督微调对性能的提升。
Comments Accepted to LREC 2026
预期奖励预测,及其在模型路由中的应用
机构 * Stanford University Inception Labs(斯坦福大学Inception实验室) ; Stanford University Cognition Labs(斯坦福大学Cognition实验室) ; Google DeepMind(谷歌DeepMind) ; University of Chicago(芝加哥大学)
专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了基于响应级奖励模型预测模型对特定提示的适应性,提出了一种简单有效的预期奖励预测路由方法,实验证明其在模型路由中的优越性。
Comments ICML 2025 Workshop on Models of Human Feedback for AI Alignment
DoRA的扩展:通过因子范数和融合内核进行高秩适应
专题命中 指令微调 :language model(abstract);分类 cs.LG
AI总结 本文提出通过因子范数和融合内核实现高秩适应,减少内存占用并提升计算效率,适用于大规模视觉-语言模型。
Comments 30 pages, 15 figures, 15 tables, including appendices. Code and data at https://github.com/sockeye44/dorafactors
BondBERT: 在债券市场中进行情感分析时我们学到了什么
机构 * School of Engineering Mathematics and Technology, University of Bristol, Bristol, UK(工程数学与技术学院,布里斯托尔大学,布里斯托尔,英国) ; School of Mathematics, Cardiff University, Cardiff, UK(数学学院,卡迪夫大学,卡迪夫,英国)
专题命中 指令微调 :language model(abstract);分类 cs.LG
AI总结 本文提出BondBERT,一种针对债券市场新闻微调的Transformer模型,用于提供与预测模型集成的情感信号,通过对比实验显示其在预测准确性上优于现有模型。
Comments 8 pages, 3 figures, author manuscript accepted for ICAART 2026: 18th International Conference on Agents and Artificial Intelligence, Mar. 2026, Marbella, Spain
Journal ref 18th International Conference on Agents and Artificial Intelligence (ICAART), Volume 5, Mar. 2026, pp. 4056-4063
缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割
机构 * University of Ljubljana(卢布尔雅那大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Zagreb(扎格reb大学) ; Faculty of Comp. and Inf. Science(计算机与信息科学系) ; Dept. of Computer Science(计算机科学系) ; Faculty of Elec. Eng. and Computing(电子工程与计算科学系)
专题命中 指令微调 :language model(abstract)
AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。
从Calabi-Yau范畴出发的开-闭弦场论及其在计数几何中的应用
专题命中 指令微调 :SFT(abstract)
AI总结 本文通过建立图复形、Calabi-Yau A∞-范畴与Kontsevich的cocycle构造之间的关系,发展了连接计数几何与大N gauge理论的范畴方法,并提出了开-闭弦场论的分类不变量及Twisted Holography的范畴化。
Comments substantial overlap with arXiv:2506.15210 and arXiv:2507.15445
通过SFT方式实现RLHF:从最优解到奖励加权对齐
机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :SFT(title,abstract);RLHF(title,abstract);LLM(abstract);large language model(abstract)
AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。
Comments Published in TMLR-2026
基于大语言模型和直接偏好优化的难度可控多选题生成
机构 * Graduate School of Informatics and Engineering, University of Electro-Communications(信息与工程研究生学校,电通大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL
AI总结 本文提出一种基于大语言模型和直接偏好优化的多选题生成方法,解决传统方法无法生成多选题和优化难度控制的问题。
Comments Accepted for publication in IEEE Access. Please refer to the published version for the final content. DOI: 10.1109/ACCESS.2026.3674595
SynPO:融合描述性和偏好优化的视频详细描述生成
机构 * Sun Yat-Sen University(中山大学) ; Lanzhou University(兰州大学) ; The University of Hong Kong(香港大学) ; Beijing Institute of Technology(北京理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。
PivotRL: 高精度代理后训练的低计算成本
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)
专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.AI
AI总结 PivotRL结合监督微调的高效计算与端到端强化学习的泛化能力,通过局部策略滚动和奖励机制提升代理后训练的准确性和效率。
Comments 22 pages, 5 figures, 6 tables
基于人类反馈的近端点纳什学习
机构 * CMAP, CNRS, École Polytechnique, IPP(CMAP、CNRS、巴黎高等学院、IPP) ; LMO, Université Paris-Saclay(LMO、巴黎萨克雷大学) ; Google DeepMind(谷歌DeepMind) ; Duisburg-Essen University(杜伊斯堡-埃森大学) ; HSE University(俄罗斯高等经济大学) ; Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; LRE EPITA(EPITA LRE) ; Hugging Face ; Isara Labs(Isara实验室) ; ENS Lyon(里昂大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)
AI总结 本文提出Nash Prox算法,通过近端点框架稳定纳什学习过程,解决传统RLHF中偏好结构建模不准确的问题,并在大语言模型训练中验证其有效性。
奖励敏锐度感知的扩散模型微调
机构 * Department of AI Convergence, GIST(人工智能融合系,韩国科学技术院) ; Samsung Research(三星研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RSA-FT方法,通过改进奖励模型梯度的鲁棒性来缓解扩散模型中的奖励黑客问题,提升RDRL的可靠性。
Comments Cam ready version of CVPR26
快速-缓慢思考RM:标量与生成奖励模型的有效整合
机构 * Fudan University(复旦大学) ; Meituan(美团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG
AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。
大奖励模型:基于视觉-语言模型的通用在线机器人奖励生成
机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) ; Toyota Research Institute(丰田研究院)
专题命中 后训练与偏好优化 :language model(title);分类 cs.AI
AI总结 本文提出利用视觉-语言模型生成通用在线机器人奖励,通过零样本方式提升策略学习效率,实验显示在30次迭代内显著提高初始策略成功率。
MobileIPL: 通过迭代偏好学习增强移动代理的思维过程
机构 * Xiaomi Inc.(小米公司) ; Nanyang Technological University(南洋理工大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)
专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。
Comments 9 pages, 8 figures, 7 tables
视觉反馈提升布局:用于迭代文本布局优化的视觉反馈
机构 * University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。
Comments Accepted by CVPR 2026
面向流形的探索用于视频生成的强化学习
机构 * Tencent Hunyuan(腾讯文脉)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。
Comments 17 pages, 12 figures
TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法
机构 * Peking University, Beijing, China(北京大学) ; The Ohio State University, Columbus, USA(俄亥俄州立大学) ; Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。
Comments 44 pages
Leum-VL 技术报告
机构 * Hainan Sihe Data Technology Co., Ltd.(海南世和数据技术有限公司)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出SV6D框架,通过六维结构化表示解析视频内容,构建Leum-VL-8B模型,在多个基准测试中取得优异成绩,强调视频AI需关注结构表示而非像素生成。
Comments 27 pages, 5 figures
ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移
机构 * SenseTime Research(商汤科技研究院)
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)
AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。
掩码扩散模型作为能量最小化
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出将掩码扩散模型解释为离散最优传输中能量最小化问题的理论框架,证明三种能量形式在MDM结构下等价,并通过Beta分布参数化插值调度,提升采样效率。
Journal ref Published at NeurIPS 2025
提示重放:通过在线重用高信号提示加速GRPO
机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) ; Leiden University(莱顿大学)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Prompt Replay方法,通过在线重用高信号提示提升GRPO训练效率,减少无效提示,提高平均绝对优势,并加快初始准确率提升,但存在过拟合风险。
SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI
AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。
代理AI与下一次智能爆炸
机构 * Paradigms of Intelligence Team, Google(谷歌智能范式团队) ; University of Chicago(芝加哥大学) ; Santa Fe Institute(圣菲研究所) ; Antikythera, Berggruen Institute(安提基特拉与伯格格林研究所) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI
AI总结 本文探讨代理AI如何通过模拟内部思想社会解决复杂任务,提出智能爆炸将不再是单一硅基脑,而是复杂社会结构。
Comments 4 pages
HCAG:基于LLM的理论仓库中层次抽象与检索增强生成
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI
AI总结 HCAG通过层次化抽象与检索增强生成方法,解决复杂理论代码库中高层架构模式和跨文件依赖的捕捉问题,提升代码质量和架构一致性。
上下文制图:迈向大型语言模型系统中上下文空间的结构化治理
机构 * NVIDIA(英伟达) ; Research Division Cartography, TU Wien(地图研究部,维也纳技术大学)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出Context Cartography框架,通过定义三区模型和七种制图操作,系统治理上下文空间的结构与信息流动,验证其在实际系统中的有效性。
Comments 31 pages, 2 figures
对话树架构:一种面向上下文感知多分支LLM对话的结构化框架
机构 * Pandemonium Research(Pandemonium研究院)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出对话树架构(CTA),通过层次化结构管理LLM对话,解决传统扁平结构导致的上下文污染问题,提供结构化对话上下文管理方法。
Comments 6 pages, 1 figure. Prototype available at https://the-conversation-tree.vercel.app/app
提升系统优化代理AI的连贯性与持续性
机构 * MIT(麻省理工学院)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Engram架构,通过解耦长周期探索与单一上下文窗口约束,提升代理AI在多领域系统优化中的连贯性和持续性。
具有记忆掩码的多智能体辩论
机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团队) ; Search Algorithm Group, WeChat, Tencent(微信搜索算法团队,腾讯)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出MAD-M$^2$框架,通过在每轮辩论前屏蔽错误记忆以提升多智能体辩论的鲁棒性,实验证明其在数学和逻辑推理任务中表现更优。
Comments ICLR 2026
探究表格数据如何提升长上下文推理的可扩展性
机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; Fudan University, Shanghai, China(复旦大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 本文研究表格数据对长上下文推理的增强作用,通过分析表格依赖结构揭示周期性非消失依赖,并提出TableLong框架提升推理能力,实验显示在多个基准上提升8.24%。