arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-09 至 2026-07-09 共收录 150 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2607.07494 2026-07-09 cs.DC cs.LG 新提交 92%

GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining

GIFT:用于大语言模型预训练的几何感知低精度梯度通信

Jieying Wang, Shuyuan Fan, Mingkai Zheng, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对LLM预训练中梯度通信瓶颈,提出几何感知梯度缩放方法GIFT,通过变换梯度到近各向同性空间进行低精度通信,开发简化算法平衡开销与减少量,经实验验证可减少预训练时间并改善下游任务保留情况。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-07-09 cs.CL cs.AI 新提交 85%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06617 2026-07-09 cs.LG cs.AI 新提交 84%

Inertia-1: An Open Exploration of Wearable Motion Foundation Models

Inertia-1:可穿戴运动基础模型的开放探索

Zongzhe Xu, Aakarsh Anand, Sarah Jiang, Chuntung Zhuang, Zitao Shuai, Sriram Sankararaman, Yuzhe Yang

机构 * John Hopkins University(约翰·霍普金斯大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究可穿戴运动基础模型,利用大量加速度计数据构建框架,涵盖数据、模型和训练选择等,通过多数据集评估得出有趣发现,不仅提供先进方法,还为可穿戴运动表示学习提供全面实用开放指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07675 2026-07-09 cs.CV 新提交 82%

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

用于具身智能的缩放专家混合视频预训练

Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng

机构 * Robbyant(蚂蚁灵波)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 针对视频生成模型领域不匹配问题,提出LingBot-Video,采用MoE架构、构建数据剖析引擎、开发多维奖励系统进行视频预训练,验证了其性能和效率,贡献了首个大规模开源MoE视频基础模型。

Comments Project page: https://technology.robbyant.com/lingbot-video

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 82%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 预训练与数据 :LLM(title);instruction tuning(abstract);pretraining(abstract)

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06802 2026-07-09 eess.SP cs.AI 新提交 79%

A Multi-Analyst LLM Pipeline for Auditable Rule Discovery Across 68 Public Physiological Corpora

用于跨68个公共生理语料库进行可审计规则发现的多分析师大语言模型管道

Dovy Paukstys

机构 * Komori Care, LLC(科莫里护理公司)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI

AI总结 针对开放生理语料库异质性无法确定新监测平台探测器规则的问题,提出多分析师大语言模型工作流程,通过读取语料库文档、去重、审核、整合等操作,产生可审计规则形状库及探测器组件,推动文献规则向硬件验证发展。

Comments 8 pages, 2 figures, 9 tables; submitted to IEEE SPMB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06948 2026-07-09 cs.CV cs.AI 新提交 79%

Self-Supervised Pretraining Improves Cross-Site and Cross-Scale Robustness of Point Cloud Leaf-Wood Segmentation

自监督预训练提高点云树叶-木材分割的跨站点和跨尺度鲁棒性

Heeju Mun, Tackang Yang, Yunsoo Nam, Changhyun Choi

机构 * Department of Landscape Architecture and Rural Systems Engineering, Seoul National University, Seoul, South Korea(景观建筑与乡村系统工程系,首尔国立大学,首尔,韩国) Interdisciplinary Program in Landscape Architecture, Seoul National University, South Korea(景观建筑跨学科项目,首尔国立大学,韩国) Integrated Major in Smart City Global Convergence, Seoul National University, Seoul, Republic of Korea(智能城市全球融合整合专业,首尔国立大学,首尔,韩国) Research Institute of Agriculture and Life Sciences, Seoul National University, Seoul, Republic of Korea(农业与生命科学研究院,首尔国立大学,首尔,韩国)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 研究树木点云树叶-木材分割方法跨森林类型和地点准确性差异问题,采用自监督预训练Point-M2AE并结合递归体素细分,提升了分割精度,在跨站点和跨尺度上表现良好,还改善了下游木材体积估计的性能。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06845 2026-07-09 cs.CL 新提交 77%

LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

大语言模型对非裔美国英语的隐性纠正:通过激活引导来审计和减轻方言偏见

Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds(连接思维公司) Emory University(埃默里大学) Wilfrid Laurier University(威尔弗里德·劳里埃大学) University of Toronto(多伦多大学) University of Guelph(圭尔夫大学) Monark Health(莫纳克健康公司) CIFAR Solution Network(加拿大高级研究院解决方案网络)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现大语言模型会将非裔美国英语重写为标准美国英语,提出端到端框架审计和减轻偏见,审计用cDGI等方法,减轻偏见用激活引导,该方法比提示更有效,还发布了真实AAE平行语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02707 2026-07-09 cs.CV 新提交 71%

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

VLRC:视觉语言重投影一致性作为用于更好的前馈3D预训练的可扩展信号

Marwane Hariat, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris(U2IS,法国国立高等先进技术学校 - 巴黎综合理工学院) Pôle Recherche, Agence Ministérielle pour l’IA de Défense(军事人工智能部研究中心)

专题命中 预训练与数据 :pretraining(title)

AI总结 研究提出视觉语言重投影一致性(VLRC),利用冻结的视觉语言表征作为语义多视图监督,无需额外3D标注,能提升3D重建精度等,为前馈3D预训练提供可扩展辅助目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07282 2026-07-09 cs.CL cs.DL 新提交 57%

A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon

带有商羯罗注疏的吠檀多三经的词级数字阅读器:语料库、方法以及为不二论吠檀多经典提供的开放离线阅读辅助工具

Tamal Maharaj

机构 * Ramakrishna Mission Vivekananda Educational and Research Institute(罗摩克里希那传道会辨喜教育与研究学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 该研究针对吠檀多三经阅读难题,构建开放离线词级数字阅读器。利用混合管道和人工审核循环处理文本,涵盖多单元及大量词分析与字典。经评估其分析与权威词典高度一致,提供了便捷的教学阅读辅助工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07542 2026-07-09 cs.RO cs.CV 新提交 50%

SonoRank: Towards Calibration-Free Real-Time Finger Flexion Detection from Forearm Ultrasound Sequences

SonoRank:迈向无需校准的实时前臂超声序列手指弯曲检测

Dean Zadok, Alon Wolf, Alex M. Bronstein, Oren Salzman

机构 * Technion(以色列理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对动力假肢手因依赖sEMG功能受限的问题,提出SonoRank方法,通过对超声序列对排序学习及微调,实现无需校准的手指弯曲检测,在交叉验证中F1分数比直接分类基线提高28%,推动超声假肢实用化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 50%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07230 2026-07-09 cs.CV 新提交 50%

`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation

用于自监督视频对象分割的注意力引导跨时间聚类

Waqas Arshid, Mohammad Awrangjeb, Alan Wee-Chung Liew, Yongsheng Gao

机构 * Griffith University(格里菲斯大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对视频对象分割任务,现有自监督方法存在问题。本文提出跨时间一致性和聚类框架,结合注意力引导令牌选择与轻量级时间聚类,通过显著性加权目标对齐软部分分配,利用冻结变压器主干实现有效扩展,提升自监督视频对象分割性能。

Comments Accepted for publication in Machine Intelligence Research journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 6 篇

2607.07237 2026-07-09 eess.SY cs.SY 新提交 82%

A Physics-guided Fine-tuned LLM-based Framework for Customized Power Distribution System Feeder Generation

基于物理引导微调大语言模型的定制化配电网馈线生成框架

Zhenghao Zhou, Yiyan Li, Tao Xu, Yike Guo, Zheng Yan, Mo-Yuen Chow

专题命中 指令微调 :LLM(title,abstract);SFT(abstract)

AI总结 针对配电网馈线模型获取难问题,提出基于大语言模型的合成馈线生成框架。通过监督微调、组相对策略优化及双智能体架构,实现从自然语言到物理一致馈线模型的端到端生成,所生成馈线具备多种优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07403 2026-07-09 cs.MA cs.RO 新提交 78%

Multi-Agent Robotic Control with Onboard Vision-Language Models

基于机载视觉语言模型的多智能体机器人控制

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。

Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07023 2026-07-09 cs.LG 新提交 77%

Online Data Selection Is Implicit Alignment

在线数据选择即隐式对齐

Aoxiong Zeng, Yuxin Yang, Xiangquan Yang

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.LG

AI总结 研究将在线数据选择视为隐式对齐机制,给定相同条件比较多种在线选择器在无偏好优化时引起的行为漂移,提出评估和量化方法,引入ADA和AAS,可在保持数据效率时限制安全和风格轴漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00572 2026-07-09 cs.AI cs.CR 新提交 77%

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07529 2026-07-09 cs.GT 新提交 50%

FedMark-FM: Auditable, Risk-Adjusted Data Markets for Federated Foundation-Model Adaptation

FedMark-FM:用于联邦基础模型适配的可审计、风险调整数据市场

Phat T. Tran-Truong, Xuan-Bach Le, Minh Nhat Nguyen

专题命中 指令微调 :foundation model(abstract)

AI总结 研究联邦基础模型适配中激励机制问题,提出FedMark-FM框架,将客户端视为工件卖家,用S3Val估计贡献,转换支付惩罚不良行为,经多任务评估表现出色,证明管道有序估值独特性,能在一定规模下保留专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07195 2026-07-09 cs.CV 新提交 50%

DiffCVE: Diffusion-based Compressed Video Enhancement

DiffCVE:基于扩散的压缩视频增强

Wenqiang Xiao, Wenzhuo Ma, Junxi Zhang, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 指令微调 :prompting(abstract)

AI总结 针对严重压缩视频感知质量增强难题,提出DiffCVE方法。设计CPDC分支联合建模,引入CDSP机制与CPWF模块,利用编码先验及条件提示等,经实验验证该方法能有效提升感知质量,尤其在严重压缩时。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交 84%

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07646 2026-07-09 cs.AI cs.CL 新提交 84%

RL Post-Training Builds Compositional Reasoning Strategies

强化学习后训练构建组合推理策略

Azwar Abdulsalam, Nishil Patel, Andrew Saxe

专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。

Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交 82%

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交 79%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07554 2026-07-09 quant-ph 新提交 75%

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

RubriQ:用于约束感知量子电路合成的基于规则的组相对策略优化

Ziqing Guo, Ziwen Pan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对量子电路合成瓶颈,RubriQ框架将其作为大语言模型代码生成任务,用组相对策略优化,以程序化规则为奖励函数,集成CUDA-Q模拟,在基准任务和量子处理器上表现出色,建立高性能计算驱动管道大规模生成容错电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23190 2026-07-09 eess.AS cs.SD 新提交 75%

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech

FlowTTS-GRPO:基于流匹配的文本转语音的多目标奖励优化的在线强化学习

Haoxu Wang, Biao Tian, Weiqin Li, Xiang Lv, Han Zhao, Xiangang Li

机构 * Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FlowTTS-GRPO在线强化学习框架,通过将ODE轨迹转换为SDE路径,直接微调流匹配模型,并采用加权奖励组合、省略无分类器引导等优化,在CosyVoice 3.0和F5-TTS上提升了说话人相似度和感知质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 70%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06609 2026-07-09 cs.LG cs.AI 新提交 62%

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

D2PO:通过动态偏好优化扩散采样器

Jinkyu Kim, Jinyoung Choi, Bohyung Han

机构 * Seoul National University(首尔国立大学) Ulsan National Institute of Science and Technology(蔚山国立科学技术院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 10 篇

2607.06964 2026-07-09 cs.RO cs.AI 新提交 90%

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划

Amin Tabrizian, Arsyi Aziz, Aarifah Ullah, Mahyar Ghazanfari, Pouria Razzaghi, Peng Wei

机构 * George Washington University(乔治华盛顿大学) Metis Solutions Technology Inc

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07387 2026-07-09 cs.MA cs.SI physics.soc-ph 新提交 89%

A Large Language Model-Driven Agent-Based Modeling Framework with Multi-Round Communication for Simulating Vaccine Opinion Dynamics

一种用于模拟疫苗舆论动态的基于多轮通信的大语言模型驱动的基于代理的建模框架

Bo Zhang, Na Jiang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 该研究引入大语言模型(Qwen3-8B)集成到基于代理的建模框架,以疫苗接种舆论动态为例,通过启用不同认知模块模拟舆论动态,发现不同模块对突发舆论有相反影响,再现了社会影响的非线性行为模式,证明框架有效性和潜力。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06595 2026-07-09 cs.CR cs.AI 新提交 88%

When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents

当智能体记忆过多时:对大语言模型智能体的内存中毒攻击

George Torres, Sharad Shrestha, Satyajayant Misra

机构 * George Torres3(乔治·托雷斯(第三作者)) Sharad Shrestha1(沙拉德·什雷斯塔(第一作者)) Satyajayant Misra4(萨蒂亚扬特·米什拉(第四作者))

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大语言模型驱动的个人智能体因缺乏内存安全治理存在安全漏洞,提出攻击向量GhostWriter,实现近98%注入率和约60%激活率,还提出AM-Sentry缓解技术,显著降低GhostWriter成功率并保持智能体效用。

详情

展开后加载摘要…

URL PDF HTML 收藏