arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-02 至 2026-07-02 共收录 69 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2607.00083 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Harnessing the Latent Space: From Steering Vectors to Model Calibrators for Control and Trust

利用潜在空间:从引导向量到模型校准器以实现控制与信任

Nishant Subramani

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用潜在空间中的引导向量控制语言模型行为,并开发基于潜在空间的模型校准器评估输出可信度,从而增强模型的可控性与可靠性。

Comments ACL 2026 (BigPicture Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20817 2026-07-02 cs.IR cs.MM 67%

RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation

RAG-VisualRec: 一种面向电影领域的视觉与文本增强的检索增强生成推荐开放资源

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出RAG-VisualRec,通过结合LLM生成的项目描述和剪辑生成的视觉嵌入,提升多模态推荐系统的检索与生成能力,通过可配置融合策略和质量控制模块提高推荐效果和可复现性。

Comments 30 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13715 2026-07-02 cs.AI cs.CL cs.MA 新提交 62%

WorkBench Revisited: Workplace Agents Two Years On

WorkBench 再探:两年后的工作场所智能体

Olly Styles, Sam Miller

机构 * Independent researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。

Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 62%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04500 2026-07-02 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

Large language models replicate and predict human cooperation across experiments in game theory

大型语言模型在博弈论实验中复制并预测人类合作行为

Andrea Cera Palatsi, Samuel Martin-Gutierrez, Ana S. Cardenal, Max Pellert

机构 * Department for Computational Social Sciences and Humanities, Barcelona Supercomputing Center(巴塞罗那超级计算中心计算社会科学与人文学系) Grupo de Sistemas Complejos, Universidad Politécnica de Madrid(马德里理工大学复杂系统研究组) School of Law and Political Science, Universitat Oberta de Catalunya(加泰罗尼亚开放大学法律与政治科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复制大规模博弈实验,发现Llama模型能高保真复现人类合作模式,而Qwen更接近纳什均衡,并揭示了Llama的注意力机制与人类行为对齐的机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 57%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00767 2026-07-02 cs.LG 版本更新 57%

ActivityNarrated: An Open-Ended Narrative Paradigm for Wearable Human Activity Understanding

ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式

Lala Shakti Swarup Ray, Mengxi Liu, Alcina Pinto, Deepika Gurung, Daniel Geissler, Paul Lukowoicz, Bo Zhou

机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿 57%

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01230 2026-07-02 eess.SY cs.SY 新提交 50%

Distributed Containment of a Compromised Agent through Repulsive Cages

通过排斥笼实现对被入侵智能体的分布式围堵

Luigi Petruzziello, Camilla Fioravanti, Gabriele Oliva

专题命中 安全评测 :safety(abstract)

AI总结 针对无人机群等自主系统中智能体被劫持的安全问题,利用低层避碰模块在高层被入侵时仍保持活跃的特性,提出分布式围堵框架,通过防御者配置几何形状塑造排斥场以约束和引导目标,基于Stackelberg博弈和排斥笼概念实现,并证明亚线性动态遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 50%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 安全评测 :alignment(abstract)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00635 2026-07-02 cs.SE 新提交 50%

Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators

从执行视频中检查程序恢复:针对不可信生成器的可靠预言机

Yuan Si, Jialu Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出一种双层验证预言机,通过静态检查证明镜头等价性并颁发证书,确保从不正确程序中拒绝,从而可靠恢复Scratch程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00579 2026-07-02 cs.CV 新提交 50%

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization

EPO:基于边缘位姿优化的3D基础模型增强

Mattia D'Urso, Christian Sormann, Mattia Rossi, Friedrich Fraundorfer

机构 * Graz University of Technology(格拉茨技术大学) Sony Europe(索尼欧洲)

专题命中 安全评测 :alignment(abstract)

AI总结 提出EPO,一种无跟踪的几何优化框架,通过边缘图对齐替代特征提取和轨迹构建,提升3D基础模型的SfM重建精度,在降低运行时和内存的同时匹配或超越束调整方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 50%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 安全评测 :safety(abstract)

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00099 2026-07-02 eess.SY cs.SY 新提交 50%

Grid-Interactive Thermal Management of AI Data Centers via Contextual Distributionally Robust Optimization

基于情境分布鲁棒优化的AI数据中心电网交互热管理

Jiachen Shen, Jian Shi, Yijie Yang, Chenye Wu, Dan Wang, Ju Bin Song, Zhu Han

专题命中 安全评测 :safety(abstract)

AI总结 针对AI数据中心突发工作负载和不确定热量生成导致的热违规问题,提出情境分布鲁棒优化(CDRO)框架,通过动态调整Wasserstein半径实现电网交互冷却控制,在极端负载下实现近零热违规,并将鲁棒性成本溢价降低约13.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00024 2026-07-02 cs.RO cs.MA cs.SY eess.SY 新提交 50%

Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation

基于自适应质量估计的缆绳悬挂载荷运输的分散几何控制

Hadi Hajieghrary, Benedikt Walter, Paul Schmitt, Miguel Hurtado

机构 * MassRobotics

专题命中 安全评测 :safety(abstract)

AI总结 提出GPAC四层分层架构,通过隐式协调实现多四旋翼无中心协调运输缆绳悬挂载荷,结合几何控制、自适应质量估计和CBF安全滤波,仿真显示低计算成本下平均跟踪误差33.8厘米。

Comments Accepted to be presented at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27660 2026-07-02 cs.CV 新提交 50%

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。

Comments accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 50%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2607.00334 2026-07-02 cs.AI 新提交 79%

Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理

Srini Ramaswamy, Wang Miaosheng

机构 * DNRS.ai, USA

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。

Comments to be submitted to a Journal, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06160 2026-07-02 cs.AI cs.CL cs.CY 版本更新 67%

Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

通过逻辑网格谜题评估LLM推理中的隐性偏见

Fatima Jahara, Mark Dredze, Sharon Levy

机构 * Rutgers University(罗格斯大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出PRIME框架,利用逻辑网格谜题系统探测LLM在复杂推理中受社会刻板印象的影响,发现模型在解与刻板印象一致时推理更准确。

Comments 26 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00415 2026-07-02 cs.CL cs.LG 新提交 62%

A Mechanistic View of Authority Hierarchy in LLM Sycophancy

LLM 谄媚中权威层级的机制性视角

Emil Joswin, Srujananjali Medicherla, Priyanka Mary Mammen

机构 * Independent Research(独立研究)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过受控医疗QA实验,发现LLM按感知权威程度分级响应,机制是特定后期层中正确答案表征被权威信号主动擦除,且该擦除与权威水平成比例、抵抗均值向量干预、仅部分可逆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17673 2026-07-02 cs.AI cs.CL 62%

Bridging Symbolic Control and Neural Reasoning in LLM Agents -- The Structured Cognitive Loop

连接符号控制与神经推理的LLM代理——结构认知循环

Myung Ho Kim

机构 * JEI University(JEI大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结构认知循环(SCL)架构,通过分离检索、认知、控制、行动和记忆模块,解决LLM代理的推理与执行纠缠、记忆波动和行动序列失控问题,实现零策略违规、防止冗余调用并保持决策可追溯性。

Comments This update clarifies the theoretical architecture by separating Regulation as the Soft Symbolic Control layer from Control as a deterministic runtime engine, while adding explicit discussion of how the current implementation should be interpreted in light of that distinction

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00423 2026-07-02 cs.CL 新提交 57%

Selective Test-Time Debiasing for CLIP via Reward Gating

通过奖励门控实现CLIP的选择性测试时去偏

Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 提出基于强化学习的测试时自适应框架RG-TTA,根据输入对偏见的敏感性选择性应用去偏,在减少偏见的同时保持零样本性能。

Comments 15 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00046 2026-07-02 cs.MA cs.SE 新提交 50%

A Role-Based Multi-Agent Model for Climate Adaptation Deliberation Across Living Labs

基于角色的多智能体模型用于生活实验室间气候适应讨论

Önder Gürcan, David Eric John Herbert, F. LeRon Shultz, Christopher Frantz, Ivan Puga-Gonzalez

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出一种模块化多层级智能体架构,整合基于动机的个体决策、社会影响网络和机构策略模块,以模拟气候治理中的复杂互动,支持情景探索。

Comments 4 pages, 1 figure, accepted as poster at the 21st annual Social Simulation Conference (SSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 15 篇

2605.01896 2026-07-02 cs.CV 版本更新 78%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 78%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18372 2026-07-02 cs.HC cs.AI cs.CY cs.ET 62%

The Hidden Cost of Contextual Sycophancy: an AI Literacy Intervention in Human-AI Collaboration

上下文谄媚的隐性成本:人类-人工智能协作中的AI素养干预

Cansu Koyuturk, Sabrina Guidotti, Dimitri Ognibene

机构 * Università degli Studi di Milano-Bicocca(米兰-比科卡大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨了在人类-人工智能协作中上下文谄媚现象的成因,并通过干预提升AI素养和提示能力以减轻其影响,发现AI反馈质量受用户错误传播影响显著,提示需系统层面改进以促进批判性参与。

Comments SPRINGER AIED 2026: Accepted for LBR, poster presentation at the 27th International Conference on Artificial Intelligence in Education, 27 Jun - 3 Jul 2026, Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13059 2026-07-02 cs.LG cs.AI 版本更新 62%

Competition-Aware CPC Forecasting with Near-Market Coverage

竞争感知的CPC预测与近市场覆盖

Sebastian Frey, Edoardo Beccari, Maximilian Kranz, Nicolò Alberto Pellizzari, Ali Mete Karaman, Qiwei Han, Maximilian Kaiser

机构 * Nova School of Business and Economics(新里斯本大学商业与经济学院) University of Hamburg(汉堡大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对付费搜索中部分可观测的竞争环境,提出结合语义邻域、行为邻域和地理意向协变量的竞争感知CPC预测方法,在短期(1周)图模型降低sMAPE 15.1%,长期(6-12周)协变量增强基础模型降低sMAPE 22.5%-27.6%。

Comments 17 pages, 2 figures, 6 tables, European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD), the code is availale at https://github.com/Sebastian-Frey/Competition-Aware-GNNs-for-TimeSeriesForecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21013 2026-07-02 cs.LG cs.AI 版本更新 62%

Predicting LLM Reasoning Performance with Small Proxy Model

用小代理模型预测LLM推理性能

Woosung Koh, Juyoung Suk, Sungjun Han, Se-Young Yun, Jamin Shin

机构 * Trillion Labs KAIST AI(韩国科学技术院人工智能系)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21589 2026-07-02 cs.CL cs.AI 62%

Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning

Middo: 通过闭环学习提升LLM微调的模型感知动态数据优化

Zinan Tang, Xin Gao, Qizhi Pei, Zhuoshi Pan, Mengzhang Cai, Jiang Wu, Conghui He, Lijun Wu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Middo框架,通过闭环学习动态优化数据,提升LLM微调效果,实验显示在多个基准上平均提升7.15%的准确率。

Comments Accepted by EMNLP 2025 (Main)

Journal ref EMNLP Main (2025) 6871-6891

详情

展开后加载摘要…

URL PDF HTML 收藏