arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 23 篇

2512.08713 2026-03-24 cs.CL cs.AI 62%

Automatic Essay Scoring and Feedback Generation in Basque Language Learning

巴斯克语言学习中的自动作文评分与反馈生成

Ekhi Azurmendi, Xabier Arregi, Oier Lopez de Lacalle

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文首次公开了针对巴斯克语C1水平的自动作文评分与反馈生成数据集,通过微调开源模型提升评分与反馈质量,验证了编码器模型的可靠性及监督微调对性能的提升。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20217 2026-03-24 cs.CL cs.LG 62%

Expected Reward Prediction, with Applications to Model Routing

预期奖励预测,及其在模型路由中的应用

Kenan Hasanaliyev, Silas Alberti, Jenny Hamer, Dheeraj Rajagopal, Kevin Robinson, Jasper Snoek, Victor Veitch, Alexander Nicholas D'Amour

机构 * Stanford University Inception Labs(斯坦福大学Inception实验室) Stanford University Cognition Labs(斯坦福大学Cognition实验室) Google DeepMind(谷歌DeepMind) University of Chicago(芝加哥大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于响应级奖励模型预测模型对特定提示的适应性,提出了一种简单有效的预期奖励预测路由方法,实验证明其在模型路由中的优越性。

Comments ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22276 2026-03-24 cs.LG stat.ML 57%

Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels

DoRA的扩展:通过因子范数和融合内核进行高秩适应

Alexandra Zelenin, Alexandra Zhuravlyova

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出通过因子范数和融合内核实现高秩适应,减少内存占用并提升计算效率,适用于大规模视觉-语言模型。

Comments 30 pages, 15 figures, 15 tables, including appendices. Code and data at https://github.com/sockeye44/dorafactors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01869 2026-03-24 q-fin.CP cs.LG 57%

BondBERT: What we learn when assigning sentiment in the bond market

BondBERT: 在债券市场中进行情感分析时我们学到了什么

Toby Barter, Zheng Gao, Eva Christodoulaki, Jing Chen, John Cartlidge

机构 * School of Engineering Mathematics and Technology, University of Bristol, Bristol, UK(工程数学与技术学院,布里斯托尔大学,布里斯托尔,英国) School of Mathematics, Cardiff University, Cardiff, UK(数学学院,卡迪夫大学,卡迪夫,英国)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出BondBERT,一种针对债券市场新闻微调的Transformer模型,用于提供与预测模型集成的情感信号,通过对比实验显示其在预测准确性上优于现有模型。

Comments 8 pages, 3 figures, author manuscript accepted for ICAART 2026: 18th International Conference on Agents and Artificial Intelligence, Mar. 2026, Marbella, Spain

Journal ref 18th International Conference on Agents and Artificial Intelligence (ICAART), Volume 5, Mar. 2026, pp. 4056-4063

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21386 2026-03-24 cs.CV 50%

Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割

Nikolay Kormushev, Josip Šarić, Matej Kristan

机构 * University of Ljubljana(卢布尔雅那大学) ETH Zurich(苏黎世联邦理工学院) University of Zagreb(扎格reb大学) Faculty of Comp. and Inf. Science(计算机与信息科学系) Dept. of Computer Science(计算机科学系) Faculty of Elec. Eng. and Computing(电子工程与计算科学系)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18186 2026-03-24 math.QA hep-th math-ph math.MP math.SG 50%

Open-Closed String Field Theory from Calabi-Yau Categories and its Applications to Enumerative Geometry

从Calabi-Yau范畴出发的开-闭弦场论及其在计数几何中的应用

Jakob Ulmer

专题命中 指令微调 :SFT(abstract)

AI总结 本文通过建立图复形、Calabi-Yau A∞-范畴与Kontsevich的cocycle构造之间的关系,发展了连接计数几何与大N gauge理论的范畴方法,并提出了开-闭弦场论的分类不变量及Twisted Holography的范畴化。

Comments substantial overlap with arXiv:2506.15210 and arXiv:2507.15445

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 19 篇

2502.11026 2026-03-24 cs.LG cs.AI cs.CL 92%

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :SFT(title,abstract);RLHF(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19265 2026-03-24 cs.CL 92%

Difficulty-Controllable Multiple-Choice Question Generation Using Large Language Models and Direct Preference Optimization

基于大语言模型和直接偏好优化的难度可控多选题生成

Yuto Tomikawa, Masaki Uto

机构 * Graduate School of Informatics and Engineering, University of Electro-Communications(信息与工程研究生学校,电通大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型和直接偏好优化的多选题生成方法,解决传统方法无法生成多选题和优化难度控制的问题。

Comments Accepted for publication in IEEE Access. Please refer to the published version for the final content. DOI: 10.1109/ACCESS.2026.3674595

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV 85%

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21383 2026-03-24 cs.AI 83%

PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost

PivotRL: 高精度代理后训练的低计算成本

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam Dipak Devare, Khushi Bhardwaj, Abhibha Gupta, Oleksii Kuchaiev, Jiantao Jiao, Jian Zhang, Venkat Srinivasan

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.AI

AI总结 PivotRL结合监督微调的高效计算与端到端强化学习的泛化能力,通过局部策略滚动和奖励机制提升代理后训练的准确性和效率。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19731 2026-03-24 stat.ML cs.LG 81%

Proximal Point Nash Learning from Human Feedback

基于人类反馈的近端点纳什学习

Daniil Tiapkin, Daniele Calandriello, Denis Belomestny, Eric Moulines, Alexey Naumov, Kashif Rasul, Michal Valko, Pierre Menard

机构 * CMAP, CNRS, École Polytechnique, IPP(CMAP、CNRS、巴黎高等学院、IPP) LMO, Université Paris-Saclay(LMO、巴黎萨克雷大学) Google DeepMind(谷歌DeepMind) Duisburg-Essen University(杜伊斯堡-埃森大学) HSE University(俄罗斯高等经济大学) Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) LRE EPITA(EPITA LRE) Hugging Face Isara Labs(Isara实验室) ENS Lyon(里昂大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

AI总结 本文提出Nash Prox算法,通过近端点框架稳定纳什学习过程,解决传统RLHF中偏好结构建模不准确的问题,并在大语言模型训练中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21175 2026-03-24 cs.LG cs.AI 79%

Reward Sharpness-Aware Fine-Tuning for Diffusion Models

奖励敏锐度感知的扩散模型微调

Kwanyoung Kim, Byeongsu Sim

机构 * Department of AI Convergence, GIST(人工智能融合系,韩国科学技术院) Samsung Research(三星研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RSA-FT方法,通过改进奖励模型梯度的鲁棒性来缓解扩散模型中的奖励黑客问题,提升RDRL的可靠性。

Comments Cam ready version of CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20212 2026-03-24 cs.CL cs.LG 79%

Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

快速-缓慢思考RM:标量与生成奖励模型的有效整合

Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16065 2026-03-24 cs.RO cs.AI 74%

Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models

大奖励模型:基于视觉-语言模型的通用在线机器人奖励生成

Yanru Wu, Weiduo Yuan, Ang Qi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 后训练与偏好优化 :language model(title);分类 cs.AI

AI总结 本文提出利用视觉-语言模型生成通用在线机器人奖励,通过零样本方式提升策略学习效率,实验显示在30次迭代内显著提高初始策略成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 73%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI 70%

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 70%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02833 2026-03-24 cs.LG 70%

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法

Lei Pang, Jun Luo, Ruinan Jin

机构 * Peking University, Beijing, China(北京大学) The Ohio State University, Columbus, USA(俄亥俄州立大学) Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20354 2026-03-24 cs.MM cs.AI 70%

Leum-VL Technical Report

Leum-VL 技术报告

Yuxuan He, Chaiming Huang, Yifan Wu, Hongjun Wang, Chenkui Shen, Jifan Zhang, Long Li

机构 * Hainan Sihe Data Technology Co., Ltd.(海南世和数据技术有限公司)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出SV6D框架,通过六维结构化表示解析视频内容,构建Leum-VL-8B模型,在多个基准测试中取得优异成绩,强调视频AI需关注结构表示而非像素生成。

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 67%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13866 2026-03-24 cs.LG cs.AI cs.CL 67%

Masked Diffusion Models as Energy Minimization

掩码扩散模型作为能量最小化

Sitong Chen, Shen Nie, Jiacheng Sun, Zijin Feng, Zhenguo Li, Ji-Rong Wen, Chongxuan Li

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将掩码扩散模型解释为离散最优传输中能量最小化问题的理论框架,证明三种能量形式在MDM结构下等价,并通过Beta分布参数化插值调度,提升采样效率。

Journal ref Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21177 2026-03-24 cs.LG cs.AI 62%

Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts

提示重放:通过在线重用高信号提示加速GRPO

Andrei Baroian, Rutger Berger

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Prompt Replay方法,通过在线重用高信号提示提升GRPO训练效率,减少无效提示,提高平均绝对优势,并加快初始准确率提升,但存在过拟合风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 57%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20639 2026-03-24 cs.AI 57%

Agentic AI and the next intelligence explosion

代理AI与下一次智能爆炸

James Evans, Benjamin Bratton, Blaise Agüera y Arcas

机构 * Paradigms of Intelligence Team, Google(谷歌智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣菲研究所) Antikythera, Berggruen Institute(安提基特拉与伯格格林研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 本文探讨代理AI如何通过模拟内部思想社会解决复杂任务,提出智能爆炸将不再是单一硅基脑,而是复杂社会结构。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20299 2026-03-24 cs.SE cs.AI 57%

HCAG: Hierarchical Abstraction and Retrieval-Augmented Generation on Theoretical Repositories with LLMs

HCAG:基于LLM的理论仓库中层次抽象与检索增强生成

Yusen Wu, Xiaotie Deng

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 HCAG通过层次化抽象与检索增强生成方法,解决复杂理论代码库中高层架构模式和跨文件依赖的捕捉问题,提升代码质量和架构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 23 篇

2603.20578 2026-03-24 cs.AI 89%

Context Cartography: Toward Structured Governance of Contextual Space in Large Language Model Systems

上下文制图:迈向大型语言模型系统中上下文空间的结构化治理

Zihua Wu, Georg Gartner

机构 * NVIDIA(英伟达) Research Division Cartography, TU Wien(地图研究部,维也纳技术大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出Context Cartography框架,通过定义三区模型和七种制图操作,系统治理上下文空间的结构与信息流动,验证其在实际系统中的有效性。

Comments 31 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21278 2026-03-24 cs.CL cs.AI cs.HC 86%

Conversation Tree Architecture: A Structured Framework for Context-Aware Multi-Branch LLM Conversations

对话树架构:一种面向上下文感知多分支LLM对话的结构化框架

Pranav Hemanth, Sampriti Saha

机构 * Pandemonium Research(Pandemonium研究院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对话树架构(CTA),通过层次化结构管理LLM对话,解决传统扁平结构导致的上下文污染问题,提供结构化对话上下文管理方法。

Comments 6 pages, 1 figure. Prototype available at https://the-conversation-tree.vercel.app/app

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21321 2026-03-24 cs.AI cs.CL 79%

Improving Coherence and Persistence in Agentic AI for System Optimization

提升系统优化代理AI的连贯性与持续性

Pantea Karimi, Kimia Noorbakhsh, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT(麻省理工学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Engram架构,通过解耦长周期探索与单一上下文窗口约束,提升代理AI在多领域系统优化中的连贯性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20215 2026-03-24 cs.CL cs.LG 79%

Multi-Agent Debate with Memory Masking

具有记忆掩码的多智能体辩论

Hongduan Tian, Xiao Feng, Ziyuan Zhao, Xiangyu Zhu, Rolan Yan, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团队) Search Algorithm Group, WeChat, Tencent(微信搜索算法团队,腾讯)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MAD-M$^2$框架,通过在每轮辩论前屏蔽错误记忆以提升多智能体辩论的鲁棒性,实验证明其在数学和逻辑推理任务中表现更优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21719 2026-03-24 cs.CL 77%

Probing How Scalable Table Data Enhances General Long-Context Reasoning

探究表格数据如何提升长上下文推理的可扩展性

Huaibing Xie, Guoliang Zhao, Yang Liu, Shihan Dou, Siming Huang, Yanling Xiao, Shaolei Wang, Yiting Liu, Cheng Zhang, Shaofan Liu, Pluto Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Fudan University, Shanghai, China(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文研究表格数据对长上下文推理的增强作用,通过分析表格依赖结构揭示周期性非消失依赖,并提出TableLong框架提升推理能力,实验显示在多个基准上提升8.24%。

详情

展开后加载摘要…

URL PDF HTML 收藏