arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-17 至 2026-07-17 共收录 171 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 9 篇

2607.14112 2026-07-17 cs.CL cs.AI cs.IT math.IT 新提交 90%

Information-Theoretic Limits of Reliability and Scaling in Language Models

语言模型中可靠性和扩展性的信息论极限

Subhabrata Majumdar

机构 * Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型可靠性和扩展性的信息论极限,通过分析任务输出不确定性等因素得出缩放定律,指出LLM性能受训练数据或模型容量限制,还统一多种实际现象,提供生成语言模型性能极限的统一理论。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14703 2026-07-17 cs.CV cs.AI 新提交 88%

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

基于病理切片基础模型的多教师蒸馏预训练多实例学习网络

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Washington(华盛顿大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Medical Optical Technology R&D Center, Research Institute of Tsinghua(清华研究院医学光学技术研发中心) Jinfeng Laboratory(金凤实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 针对计算病理学中多实例学习存在的问题,提出基于蒸馏的预训练框架,利用两个基础模型作为教师,引入角分散归一化蒸馏损失,将蒸馏权重用于下游适应,实验表明该方法在少样本场景中优势明显,能提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15267 2026-07-17 cs.AI cs.CL 新提交 84%

Pretraining Data Can Be Poisoned through Computational Propaganda

预训练数据可通过计算宣传被下毒

Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现预训练数据可通过公共讨论界面被下毒,引入HalfLife方法衡量恶意内容,探索在网络规模下毒预训练语料库的可行性,证明估计毒注入重要性,确立第三方网页内容为攻击语言模型预训练的可能载体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交 77%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15209 2026-07-17 cs.CL 新提交 70%

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya

扩展基于吉兹语的非洲语言词汇:阿姆哈拉语和提格雷尼亚语的比较研究

Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对低资源非拉丁脚本语言表现不佳问题,提出VEXMLM。通过训练特定语言分词器扩展XLM - R词汇并初始化嵌入,分两阶段训练,在多种任务上评估。贡献为定制程序、两阶段策略及多语言评估,提升了相关语言任务性能。

Comments 13 pages , 7 tables , 2 figurs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14903 2026-07-17 cs.SE 新提交 67%

FirmPilot: Evidence-Guided Multi-Agent Environment Recovery for IoT Firmware Rehosting

FirmPilot:用于物联网固件重新托管的证据引导多智能体环境恢复

Yanbing Shen, Fan Zhang, Haitao Xu

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究针对物联网固件重新托管管道脆弱问题,提出证据引导多智能体框架FirmPilot,通过迭代环境重建解决跨层依赖,经实验验证其能提升可达性、增加检测服务数并支持下游分析,提高了固件重新托管的成功率和效用。

Comments 11 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14811 2026-07-17 cs.CR 新提交 67%

Is External Database Protection Static in Retrieval-Augmented Generation? Rethinking Privacy Preservation under Dynamic Queries

检索增强生成中的外部数据库保护是静态的吗?重新思考动态查询下的隐私保护

Gang Zhang, Mingyu Tian, Xukun Luan, Yuanchi Ma, Jinyan Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究检索增强生成中外部数据库隐私保护问题,提出Prompt-Aware动态分层差分隐私框架PA-HDP,通过风险分层评估和自适应保护,在减少隐私泄露的同时保持高检索质量,实现更好的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14532 2026-07-17 cs.CY 新提交 67%

Probabilistic "Copies" in Generative AI Models

生成式人工智能模型中的概率性“复制”

Mark A. Lemley, A. Feder Cooper

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究探讨生成式人工智能模型中概率性“复制”问题,指出能从大语言模型提取版权作品文本,因其权重存储令牌统计关系影响概率性生成过程。版权法对此判定重要但现有法律难助力,认为可能采取功能性方法,还建议了法律变革。

Comments Forthcoming, Berkeley Technology Law Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 50%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 12 篇

2607.14371 2026-07-17 cs.LG econ.TH stat.ML 新提交 90%

Supervised Fine-Tuning vs. In-Context Learning: An Equilibrium Analysis of LLM Personalization under Congestion

监督微调与上下文学习:拥塞下大语言模型个性化的均衡分析

Fengzhuo Zhang, Zhuoran Yang, Dirk Bergemann

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型个性化中监督微调与上下文学习的选择问题,通过构建框架分析用户面临的统计 - 经济权衡,得出不同方法占优情况、资源消耗特性及平台策略等结论,实验与平台调研验证了相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14581 2026-07-17 cs.AI cs.CV 新提交 88%

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成

Sinyoung Ra, Jonghun Kim, Hyunjin Park

专题命中 指令微调 :LLM(title);instruction tuning(title);large language model(abstract);language model(abstract)

AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14605 2026-07-17 cs.CL cs.CY 新提交 85%

Investigating first-language bias in LLM-based automated essay scoring: A cross-prompt evaluation of an open-weight AI-model on TOEFL essays

研究基于大语言模型的自动作文评分中的母语偏见:对托福作文的开放权重人工智能模型进行跨提示评估

John Maurice Gayed

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于大语言模型的自动作文评分中母语偏见,用LoRA适配的开放权重模型Gemma-3-27B-it,在托福作文语料库测试其跨提示泛化和母语评分效果,发现有评分偏移,实现了较高等级一致性,是首次此类大规模L1公平性分析。

Comments 21 pages, 2 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14895 2026-07-17 cs.LG cs.CL 新提交 84%

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

利用指令微调与合并实现推理模型适配

Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14163 2026-07-17 q-bio.QM cs.CV cs.LG 新提交 83%

A vision foundation model for single-cell biology via spatial gene cartography

通过空间基因制图构建单细胞生物学的视觉基础模型

Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究提出scVision视觉基础模型,利用最优传输将基因布局成图像,通过掩码图像建模预训练视觉Transformer。该模型在零样本评估中表现出色,能无监督恢复基因程序,在多研究整合中效果好,还证明基因布局位置携带信号,重塑单细胞表示学习为视觉问题。

Comments 54 pages, 34 figures, 10 tables, including supplementary information. Project page: https://islamlab.org/scvision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14111 2026-07-17 cs.CL cs.AI 新提交 79%

Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect

内省微调(IFT):训练小型语言模型进行内省

Ely Hahami, Ishaan Sinha, Lavik Jain

机构 * Harvard College(哈佛大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究小型语言模型内省能力,提出句子定位和强度比较评估范式,发现小模型有内省能力且随规模提升,引入内省微调(IFT),能提高模型内省能力,还表明内省能力可训练,对AI透明度和对齐有意义。

Comments 9 pages (excluding appendices / references), 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15081 2026-07-17 cs.CR 新提交 67%

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

DataShield:通过共识子空间对齐揭示跨语言模型的风险微调数据

Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对LLMs微调数据存在安全风险及现有方法局限性,提出DataShield框架,通过共识子空间对齐识别风险微调样本和响应段,经实验对比,该方法能有效降低误识率,还保留下游效用并避免特定模型风险计算。

Comments 24 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15004 2026-07-17 cs.RO 新提交 67%

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

机构 * Autel Robotics(大疆创新科技有限公司) Northeast Normal University(东北师范大学) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 指令微调 :pretraining(abstract);SFT(abstract)

AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 67%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 57%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 57%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14727 2026-07-17 cs.CV 新提交 50%

WorkDrive: Roadwork Chain of Causation for Autonomous Driving

WorkDrive:自动驾驶的道路施工因果链

Tianyi Jiang, Wen Zhang, Sihan Yang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动汽车)

专题命中 指令微调 :language model(abstract)

AI总结 针对自动驾驶视觉语言模型在道路施工区域的难题,提出WorkDrive框架,通过自动化多任务感知管道提取场景事实,经监督微调与强化学习,在ROADWork数据集上降低轨迹平均位移误差,实现渐进改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 7 篇

2607.14171 2026-07-17 cs.LG cs.CL 新提交 88%

Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

分支策略优化:沙盒原生语言智能体强化学习

Bowei He, Yankai Chen, Xiaokun Zhang, Xue Liu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill Univeristy(麦吉尔大学) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。

Comments Accepted by WAIC Academic 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14682 2026-07-17 cs.AI cs.CL cs.LG 新提交 87%

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化

Harikrishnan P M, Goutham Vignesh, Ganesh Parab, Saisubramaniam Gopalakrishnan, Vishal Vaddina, Varun V, Rohit Agrawal

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。

Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14485 2026-07-17 cs.AI 新提交 81%

Step-Level Preference Learning for Generative Agents in Social Simulations

社会模拟中生成式智能体的步骤级偏好学习

Wenchang Gao, Pingyue Sheng, Lanlan Qiu, Yunfei Ma, Jian Zhao, Baicheng Chen, Kangda Wang, Yuyang Tian, Shunqiang Mao, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Xiongan AI Institute(雄安人工智能研究院) Tsinghua University(清华大学) CUHK-Shenzhen(香港中文大学(深圳)) USTC(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。

Comments WAICA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 81%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交 79%

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14522 2026-07-17 cs.LG 新提交 77%

A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

用于微调离散扩散模型的连续时间强化学习框架

Zikun Zhang, Jiayuan Sheng, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14333 2026-07-17 cs.CV cs.CL 新提交 77%

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

SD-MAR:通过合成数据和强化学习进行多图像分析推理

Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang, Dmitriy Bespalov, Wesley Rose, Huzefa Rangwala

机构 * Stevens Institute of Technology(史蒂文斯理工学院) AGI Foundations for AWS(AWS的通用人工智能基金会) Amazon Web Services (AWS)(亚马逊网络服务公司)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 6 篇

2607.14431 2026-07-17 cs.CL cs.AI cs.LG cs.PF 新提交 75%

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

一举实现更智能与更廉价:字节精确的键值缓存嫁接将冻结的小模型转变为经过验证的知识飞轮

Sietse Schelpe

机构 * Corbenic AI(Corbenic人工智能公司)

专题命中 长上下文与记忆 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出通过字节精确的键值缓存嫁接,在不改变权重的情况下让冻结小语言模型更强大且廉价。此方法能精确恢复知识,提升模型性能,如在AIME 2025上提高准确率,还能扩展可用上下文,减少能耗,且可验证评分。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14651 2026-07-17 cs.CR cs.AI 新提交 74%

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点

Jifeng Gao, Kang Xia, Yi Zhang, Xiaobin Hong, Mingkai Lin, Xingshen Wei, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏