arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 704 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 704 篇

2607.20351 2026-07-23 cs.CV cs.CL 新提交 83%

Test-Time Training for Modality Order Consistency in Vision-Language Models

视觉语言模型中模态顺序一致性的测试时训练

Aditi Gupta, Yossi Gandelsman

机构 * University of Chicago(芝加哥大学)

专题命中 其他LLM :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现视觉语言模型对图像和问题呈现顺序敏感,利用此设计测试时训练方法,缩小模态顺序差距,使两种顺序相互一致,定位顺序失败区域,证明该方法可缓解故障并提升性能。

Comments 16 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09474 2026-07-13 cs.AI 新提交 83%

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

ProofCouncil:用于解决开放性数学问题的语言模型智能体

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学) Leiden University(莱顿大学)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在提升大型语言模型解决数学开放性问题的性能,介绍了ProofCouncil智能体,它采用作者-评论家架构,在FirstProof挑战及其他问题测试中表现出色,还介绍了其开发及相关构建库并开源。

Comments 25 pages, 7 figures. ProofCouncil appears as System A (IMProofBench ProofCouncil) in the official FirstProof second-batch report (arXiv:2606.18119). Code and agent-building library: https://github.com/eth-sri/proof-council

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05694 2026-07-08 stat.ML cs.LG 新提交 83%

Beyond Heuristic Tuning: Power-Calibrated LLM Watermarking

超越启发式调优:功率校准的大语言模型水印

Xiaopu Wang, Zelin He, Chengyuan Liu, Runze Li

机构 * Department of Statistics, Pennsylvania State University(统计学系,宾夕法尼亚州立大学)

专题命中 其他LLM :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型水印,针对现有基于对数几率水印在可检测性和语义失真权衡及超参数选择上的问题,开发功率校准统计框架,建立相关定量关系,推导出实用参数选择程序,经实验验证可识别帕累托最优点。

Comments Accepted ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26918 2026-06-26 cs.AI 新提交 83%

Diagnosing Task Insensitivity in Language Agents

诊断语言智能体中的任务不敏感性

Jingyu Liu, Xiaopeng Wu, Kehan Chen, Chuan Yu, Yong Liu

机构 * Gaoling School of Artificial Intelligence Renmin University of China(中国人民大学高瓴人工智能学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心)

专题命中 其他LLM :language agent(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文发现大语言模型在长程任务中因过度依赖训练模式而忽略任务指令,导致分布外泛化失败,并提出任务扰动负对数似然优化(Task-Perturbed NLL Optimization)来增强任务敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11483 2026-08-13 cs.AI cs.LG q-bio.QM 新提交 82%

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

用于合成约束多目标先导化合物优化的模块化智能体框架

Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Alterovitz, Marcello DeLuca, Alexander Tropsha

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出开源模块化智能体框架SABLE,结合LLM与专用工具实现合成约束下的多目标先导化合物优化,可高效富集符合计算目标的候选集,为早期药物发现提供决策支持。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08383 2026-08-11 cs.CL cs.LG 新提交 82%

Safety Cost of Steering Vectors Is Separable and Reducible

引导向量的安全代价是可分离且可降低的

Yuxiao Li, Gjergji Kasneci

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06750 2026-08-10 cs.CL cs.AI 新提交 82%

Progressive Content Refinement with Decaying Reward Joint LinUCB

结合衰减奖励的渐进式内容优化与联合LinUCB

Shion Ishikawa, Pablo Loyola, Young-joo Chung, Yun Ching Liu

机构 * Rakuten Group, Inc.(乐天集团)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有迭代优化方法忽略奖励衰减导致过度利用的问题,提出结合奖励衰减建模与EM算法的联合LinUCB算法,在Sentiment Reversal和GSM8K基准上显著优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27614 2026-07-31 cs.CL cs.AI 新提交 82%

DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

DualAnchor:无注释手语翻译中保留语言先验并提升词汇保真度

Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有无注释手语翻译方法的语言先验退化与词汇保真度差距问题,提出结合TPA和OTA的DualAnchor框架,在两个基准数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26383 2026-06-26 cs.LG cs.AI cs.AR cs.MA cs.PF 新提交 82%

SOLAR: AI-Powered Speed-of-Light Performance Analysis

SOLAR: AI驱动的光速性能分析

Qijing Huang, Sana Damani, Zhifan Ye, Athinagoras Skiadopoulos, Siva Kumar Sastry Hari, Jason Clemons, Sahil Modi, Jingquan Wang, Aditya Kane, Edward C Lin, Humphrey Shi, Christos Kozyrakis

机构 * NVIDIA(英伟达)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出SOLAR框架,自动从PyTorch和JAX代码推导理论最小执行时间(光速界限),通过LLM前端和确定性分析实现无违反界限的多保真度性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18309 2026-06-18 cs.LG cs.AI 新提交 82%

SAGE: Retain-Aware Post-Hoc Sanitization of Final Unlearning Vector

SAGE: 保留感知的最终遗忘向量事后净化

Jingyuan Zhang, Yucheng Bai, Peixi Wen, Zhehao Huang, Zhengbao He, Hanling Tian, Xinwen Cheng, Haiyin Ran, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SAGE方法,通过事后净化最终更新向量,在不重新运行原始遗忘流程的情况下,缓解大语言模型遗忘与保留能力之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 82%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11371 2026-06-11 cs.CL cs.AI eess.AS eess.SP 新提交 82%

The Dynamics of Human and AI-Generated Language: How Semantics Fluctuates across Different Timescales

人类与AI生成语言的动态:语义如何在不同时间尺度上波动

Han-Jen Chang, Yasir Çatal, Angelika Wolman, Agustín Ibáñez, David Smith, I-Wen Su, Kai-Yuan Cheng, Georg Northoff

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出语义时间尺度分析流程,通过自相关窗口度量(ACW-0)量化人类与AI生成语音中语义特异性与上下文相似性的时间组织,发现ACW-0长度与词汇通用性相关,且该关联在随机化后被削弱。

Comments 45 pages, 4 figures, 4 tables. Accepted manuscript; published in Computer Speech & Language

Journal ref Computer Speech & Language (2026) 102013

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08919 2026-06-09 cs.AI cs.CR cs.LG 新提交 82%

Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human

监督具有容量:将智能体守卫校准到主观且易疲劳的人类

Emre Turan

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体动作审批中人类评审者主观且易疲劳的问题,提出将守卫建模为成本敏感的选择性分类,并引入负载感知策略,发现过度监督反而降低安全性,形成倒U型曲线。

Comments 12 pages, 4 figures. Code and interactive demo: https://github.com/turangenesis/headroom

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16318 2026-07-21 cs.HC cs.RO 新提交 82%

The World According to a Social Robot -- Augmenting Human-Robot Dialogue With Vision Language Models

社交机器人眼中的世界——用视觉语言模型增强人机对话

Thomas Sievers

机构 * Institute of Information Systems, University of Lübeck(信息系统研究所,吕贝克大学)

专题命中 其他LLM :language model(title,abstract);LLM(abstract)

AI总结 研究探讨如何用视觉语言模型增强人机对话,通过将米斯特拉尔人工智能语言模型与胡椒机器人结合用于人机交互对话,并研究视觉信息对响应时间的影响,发现纳入视觉信息可增添对话背景,且使用欧洲托管的语言模型便于实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15684 2026-07-20 cs.SE 新提交 82%

Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports

理解模型-框架边界处的代理反应性错误:对大型语言模型代理问题报告的实证研究

Jingyi Chen, Songqiang Chen, Hengcheng Zhu, Jialun Cao, Jiasi Shen, Shing-Chi Cheung

专题命中 其他LLM :LLM(title,abstract)

AI总结 研究聚焦大型语言模型代理在模型-框架边界处的反应性错误,通过分析255份错误报告构建分类法,发现此类错误多为无明确测试预言的静默错误,检测和重现困难,还揭示了用户与开发者对错误归因及修复的不匹配,推动相关技术设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06818 2026-07-09 cs.CL cs.AI cs.LG 新提交 82%

Ad Headline Generation using Self-Critical Masked Language Model

使用自批判掩码语言模型生成广告标题

Yashal Shakti Kanungo, Sumit Negi, Aruna Rajan

机构 * amazon(亚马逊)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何为电商网站生成吸引人的广告标题,核心方法是将强化学习策略梯度方法应用于基于Transformer的掩码语言模型,通过联合多种产品信息生成标题,该方法在指标和质量审核上优于现有方法,生成标题质量也优于人工提交的。

Comments Accepted at NAACL-HLT 2021 (Industry Track). 9 pages, 3 tables, 3 figures - ACL Anthology URL: https://aclanthology.org/2021.naacl-industry.33/ - Editors of the proceedings: Young-bum Kim, Yunyao Li, Owen Rambow - Bibkey: kanungo-etal-2021-ad

Journal ref Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies: Industry Papers, pages 263-271, June 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05121 2026-07-07 cs.SE 新提交 82%

From Failing to Passing: Evolving Natural Language Prompt Optimization Rules for LLM Code Generation

从失败到通过:为大语言模型代码生成演化自然语言提示优化规则

Amal Akli, Melissa Akli, Cedric Richter, Mike Papadakis, Yves Le Traon

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型提示敏感性,用搜索法演化自然语言转换规则,提出DUALFIX管道,结合规则与执行反馈修复,可跨问题跨模型使用,提升代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 82%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 其他LLM :language model(title,abstract);large language model(abstract)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06711 2026-06-08 physics.ins-det 新提交 82%

Lightfall: An API-first, LLM-addressable control platform for synchrotron beamlines

Lightfall: 一种面向同步辐射光束线的API优先、LLM可寻址控制平台

Ronald J. Pandolfi, Damian Guenzing, Marcus M. Noack, Sophie A. Morley, Damon English

专题命中 其他LLM :LLM(title,title_cn)

AI总结 针对同步辐射光束线控制界面定制化需求,提出Lightfall平台,采用API优先架构,通过统一可寻址接口暴露所有面板、设备和扫描计划,并嵌入语言模型代理驱动实验,支持自然语言修改界面,降低定制成本。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11256 2026-08-13 cs.LG cs.CY 新提交 81%

Why AI Detection Fails for Academic Integrity

为什么AI检测无法保障学术诚信

Jonathan A. Karr, Grigorii Khvatskii, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(圣母大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究发现商业AI检测器无法区分AI编辑与LLM完整生成稿,轻度AI辅助润色的论文标记率远高于未修改稿,且人性化处理可大幅规避检测,表明检测器分数不能单独作为学术不端证据。

Comments Accepted to ACM AI Leadership Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10319 2026-08-12 cs.SE cs.AI 新提交 81%

Do Personalized Skills Help Coding Agents? An Empirical Study of Developer Interaction Histories

个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究

Shuyan Huang, Kai Du, Andrew Lan

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10171 2026-08-12 cs.AI cs.CR 新提交 81%

Generating Attacks for LLMs with GFlowNets

用GFlowNets为大语言模型生成攻击

Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali, Emin Islam Tatli

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于GFlowNets的自动化自适应红队评估方法,训练攻击者模型测试目标大语言模型,可生成更有效的英文攻击及土耳其语攻击输入,用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08303 2026-08-11 cs.AI cs.MA 新提交 81%

Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning

通过轨迹投毒对自进化技能实施仅查询式后门攻击

Yuyang Luo, Haoran Wang, Kai Shu

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对自进化技能系统提出仅查询式轨迹后门攻击TBA,通过构造查询诱导生成带后门技能,实验证实其可可靠植入条件后门且效果优于直接注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 81%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29383 2026-08-03 cs.LG cs.DC cs.SE 新提交 81%

Exploring Block Anomaly Detection In HDFS Log Data Analysis

HDFS日志数据分析中的块异常检测探索

WenYang Zhong, Tutut Herawan

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本研究针对HDFS日志人工异常检测复杂枯燥的问题,提出结合LLM-BiLSTM模型与Kafka流式管道的检测方案,实现HDFS块异常的快速准确检测。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27951 2026-07-31 cs.CR cs.AI 新提交 81%

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性

Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

专题命中 其他LLM :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27497 2026-07-31 cs.CL 新提交 81%

SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge

SkillSmith:学习组合参数化技能与文本知识

Lucio M. Dery, Benedict Aaron Tjandra, Siavash Samiei, Adhiguna Kuncoro, Zohar Yahav, Jiajun Shen, Arthur Szlam

机构 * Google(谷歌)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillSmith将模型权重作为可推理模态,结合前缀调优与文本数据,实现指令引导的参数化合成,性能优于单模态基线,解决了文本与权重集成的未探索问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20501 2026-07-24 cs.AI cs.MA 新提交 81%

MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation

MKEvolve:用于内核代码生成的模块化多智能体框架

Jason Yoo, Rajarshi Saha, Shaowei Zhu, Tao Yu, Wei Tang, Youngsuk Park

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对硬件加速器内核代码生成瓶颈,MKEvolve框架通过迭代共同进化PyTorch模块分解与子模块内核,经拆分融合优化分解并以束搜索改进子内核,实验证明其在正确性、加速及减少LLM令牌使用上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07980 2026-07-10 cs.SE cs.AI 新提交 81%

3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论

Shyam Agarwal, Courtney Miller, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07702 2026-07-09 cs.CL 新提交 81%

From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

从噪声轨迹到根本原因:用于智能体优化的结构轨迹分析和因果提取

Ying Chang, Jiahang Xu, Xuan Feng, Chenyuan Yang, Peng Cheng, Yuqing Yang

机构 * Microsoft Research(微软研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对长期智能体优化中实际执行轨迹难直接用于优化的问题,提出STRACE框架。该框架在批次和轨迹内分别进行故障模式挖掘与因果定位,去除冗余和非因果步骤,实验表明其显著优于基线,提升了智能体优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏