arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 730 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 730 篇

2607.02961 2026-07-07 cs.CV cs.CR 新提交 82%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 其他LLM :language model(title,abstract);large language model(abstract)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06711 2026-06-08 physics.ins-det 新提交 82%

Lightfall: An API-first, LLM-addressable control platform for synchrotron beamlines

Lightfall: 一种面向同步辐射光束线的API优先、LLM可寻址控制平台

Ronald J. Pandolfi, Damian Guenzing, Marcus M. Noack, Sophie A. Morley, Damon English

专题命中 其他LLM :LLM(title,title_cn)

AI总结 针对同步辐射光束线控制界面定制化需求,提出Lightfall平台,采用API优先架构,通过统一可寻址接口暴露所有面板、设备和扫描计划,并嵌入语言模型代理驱动实验,支持自然语言修改界面,降低定制成本。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15546 2026-08-18 cs.AI cs.NE 新提交 81%

ATLAS: Scaffold-Free Algorithm Synthesis by LLMs via Embedding-Guided Quality-Diversity Search

ATLAS:基于嵌入引导的质量多样性搜索的无支架大语言模型算法合成

Danial Yazdani, Mohammad Nabi Omidvar, Yuan Sun, Maksud Ibrahimov, Xiaodong Li

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 ATLAS是基于LLM的无支架全算法合成框架,通过嵌入引导质量多样性搜索解决全算法设计空间问题,在NP难问题上优于相关基线,可保留不同区域的多类算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15165 2026-08-18 cs.AI 新提交 81%

SkillCommit: Evolving Agent Skills through Behaviorally Validated Scope Expansion

SkillCommit:通过行为验证的范围扩展实现智能体技能演化

Yu He, Weikai Yang

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出SkillCommit框架,通过保留经验的验证行为、抽象相关技能,在RuleArena等数据集上提升智能体性能,且所学技能可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11256 2026-08-13 cs.LG cs.CY 新提交 81%

Why AI Detection Fails for Academic Integrity

为什么AI检测无法保障学术诚信

Jonathan A. Karr, Grigorii Khvatskii, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(圣母大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究发现商业AI检测器无法区分AI编辑与LLM完整生成稿,轻度AI辅助润色的论文标记率远高于未修改稿,且人性化处理可大幅规避检测,表明检测器分数不能单独作为学术不端证据。

Comments Accepted to ACM AI Leadership Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10171 2026-08-12 cs.AI cs.CR 新提交 81%

Generating Attacks for LLMs with GFlowNets

用GFlowNets为大语言模型生成攻击

Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali, Emin Islam Tatli

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于GFlowNets的自动化自适应红队评估方法,训练攻击者模型测试目标大语言模型,可生成更有效的英文攻击及土耳其语攻击输入,用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08303 2026-08-11 cs.AI cs.MA 新提交 81%

Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning

通过轨迹投毒对自进化技能实施仅查询式后门攻击

Yuyang Luo, Haoran Wang, Kai Shu

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对自进化技能系统提出仅查询式轨迹后门攻击TBA,通过构造查询诱导生成带后门技能,实验证实其可可靠植入条件后门且效果优于直接注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 81%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29383 2026-08-03 cs.LG cs.DC cs.SE 新提交 81%

Exploring Block Anomaly Detection In HDFS Log Data Analysis

HDFS日志数据分析中的块异常检测探索

WenYang Zhong, Tutut Herawan

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本研究针对HDFS日志人工异常检测复杂枯燥的问题,提出结合LLM-BiLSTM模型与Kafka流式管道的检测方案,实现HDFS块异常的快速准确检测。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27951 2026-07-31 cs.CR cs.AI 新提交 81%

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性

Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

专题命中 其他LLM :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27497 2026-07-31 cs.CL 新提交 81%

SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge

SkillSmith:学习组合参数化技能与文本知识

Lucio M. Dery, Benedict Aaron Tjandra, Siavash Samiei, Adhiguna Kuncoro, Zohar Yahav, Jiajun Shen, Arthur Szlam

机构 * Google(谷歌)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillSmith将模型权重作为可推理模态,结合前缀调优与文本数据,实现指令引导的参数化合成,性能优于单模态基线,解决了文本与权重集成的未探索问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20501 2026-07-24 cs.AI cs.MA 新提交 81%

MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation

MKEvolve:用于内核代码生成的模块化多智能体框架

Jason Yoo, Rajarshi Saha, Shaowei Zhu, Tao Yu, Wei Tang, Youngsuk Park

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对硬件加速器内核代码生成瓶颈,MKEvolve框架通过迭代共同进化PyTorch模块分解与子模块内核,经拆分融合优化分解并以束搜索改进子内核,实验证明其在正确性、加速及减少LLM令牌使用上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07980 2026-07-10 cs.SE cs.AI 新提交 81%

3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论

Shyam Agarwal, Courtney Miller, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07702 2026-07-09 cs.CL 新提交 81%

From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

从噪声轨迹到根本原因:用于智能体优化的结构轨迹分析和因果提取

Ying Chang, Jiahang Xu, Xuan Feng, Chenyuan Yang, Peng Cheng, Yuqing Yang

机构 * Microsoft Research(微软研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对长期智能体优化中实际执行轨迹难直接用于优化的问题,提出STRACE框架。该框架在批次和轨迹内分别进行故障模式挖掘与因果定位,去除冗余和非因果步骤,实验表明其显著优于基线,提升了智能体优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07277 2026-07-09 cs.CL cs.CY 新提交 81%

Understanding Interpretation Difficulty in Harmful Online Communication: Insights from Cybercrime Communities

理解有害网络通信中的解释难度:来自网络犯罪社区的见解

Tomohiro Okatsu, Naoki Takada, Yin Min Pa Pa, Katsunari Yoshioka, Tatsunori Mori

机构 * Yokohama National University(横滨国立大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究网络犯罪相关Discord聊天中解释难度,构建参考解释评估人类和大语言模型在不同条件下的解释,发现局部上下文对人类不足,外部知识等可提升,还进行错误分析并分类影响因素,指出有害内容分析应视解释为证据整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19042 2026-07-09 cs.SE cs.AI 新提交 81%

Where Did the Variability Go? From Vibe Coding to Product Lines by Regeneration

可变性去哪了?从氛围编码到通过再生的产品线

Xhevahire Tërnava

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, Palaiseau, France(LTCI,巴黎电信学院,巴黎理工学院,Palaiseau,法国)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究AI驱动编程(氛围编码)中可变性缺失问题,提出通过再生实现可变性(VbR)方法,让LLM作为推导引擎生成无死代码的变体二进制。

Comments VARIABILITY 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02846 2026-07-07 cs.AI 新提交 81%

Object-Centric Environment Modeling for Agentic Tasks

用于智能任务的以对象为中心的环境建模

Yiyang Li, Tianyi Ma, Zehong Wang, Yijun Ma, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体经验维护难题,提出以对象为中心的环境建模(OCM),将经验组织成可执行模型,含对象知识与过程知识,在线更新并验证,实验表明其能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02057 2026-07-03 cs.SE cs.AI 新提交 81%

Prompt Coverage Adequacy

提示覆盖充分性

Florian Tambon, Michael Konstantinou, Cedric Richter, Charles Chenouard, Mark Harman, Mike Papadakis

机构 * SnT, University of Luxembourg(斯蒂尔夫研究所,卢森堡大学) University College London(伦敦大学学院) University of Luxembourg(卢森堡大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出提示覆盖充分性标准,通过注意力机制衡量测试套件对提示需求的覆盖,相比传统代码覆盖能多检测30%以上缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00007 2026-07-03 cs.IR cs.AI 新提交 81%

BaRA: Budget-constrained and Reliable Web Data Collection Agent

BaRA: 基于BFS与反思的网络数据收集代理

Soojeong Lee, Joseph Lee, Yongseong Cho, Sunjae Kim, Youngwoo Moon, Kyungwoo Song

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出BaRA框架,结合有界广度优先搜索和历史自反思,在固定交互预算下高效收集网站级数据,在链接发现和可下载多模态提取上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00062 2026-07-02 cs.SE cs.AI cs.PL 新提交 81%

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation

AlgoBench: 代码生成中算法适配的基准测试

Xinyuan Song, Zekun Cai, Liang Zhao

专题命中 其他LLM :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出AlgoBench框架,通过结构化约束变换自动生成新算法问题,并引入复杂度感知指标评估模型适配能力,实验发现LLM在算法适配中性能显著下降。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00035 2026-07-02 cs.AI 新提交 81%

Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

确保失败安全:一个用于开放网络数据收集的受约束、可验证的智能体框架

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一个受约束、可验证的智能体框架,通过将LLM输出从自由形式代码转换为类型化JSON收集器配置,结合六类型收集器分类、模板和效用函数约束、静态Airflow DAG执行、基于规则的质量检查和结构化反馈纠正,实现了零执行阶段LLM令牌消耗和最低平均挂钟时间。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00394 2026-07-02 cs.DB cs.CL 新提交 81%

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers

当经典缓存策略失效时:面向语义检索缓冲区的学习增强替换

Yushi Sun, Bowen Cao, Wai Lam

机构 * LIGHTSPEED, Tencent(腾讯光速) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM代理中语义检索缓冲区的缓存替换问题,提出学习增强框架SOLAR,通过遗憾积累和贝叶斯在线学习实现恒定竞争比≤3,在紧缓存下相对FIFO提升5-75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25421 2026-06-25 cs.CL 新提交 81%

Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making

超越下一观测预测:面向序贯决策的智能体自创世界建模

Guangfeng Cai, Kaibing Yang, Shuo He, Yu Li, Shengtian Yang, Jiaqi Lv, Lei Feng

机构 * Southeast University(东南大学) Meituan(美团)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出智能体自创世界建模(AAWM),根据策略决策需求构建训练目标,而非预测下一观测,实验证明其比下一观测预测提供更有效的学习信号。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24839 2026-06-24 cs.AI stat.AP 新提交 81%

Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

给评分者打分:评估智能数据分析系统的经验教训

Tian Zheng, Kai-Tai Hsu

机构 * Columbia University(哥伦比亚大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对智能数据分析系统输出复杂、难以评估的问题,提出三层人机评分级联(严格正则匹配、LLM宽松评分、基于片段的人工检查),在153个任务上实现100%精确率,宽松评分召回率97%,并通过迭代提示机制将评分成功率从36%提升至97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24627 2026-06-24 cs.CL 新提交 81%

The Warrant Gap: Claim-Conditioned Re-scoring for Fact-Checking

证据差距:基于主张条件重新评分的事实核查

Arka Ujjal Dey, John Collomosse

专题命中 其他LLM :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出SIFT方法,通过主张条件重新评分提取的证据片段,结合WSP自动NLI检查,解决LLM事实核查中证据与主张不匹配问题,在多个基准上提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24311 2026-06-24 cs.AI 新提交 81%

LemonHarness Technical Report

LemonHarness 技术报告

Kailong Ren, Fubo Sun, Jiachen Liu, Liu Yang, Zimo Yin, Jiaying Li, Congli Yin, Ming He, Yu Huo, Jiawei Liu, Zeping Chen, Yubin Huangfu, Ronghua Li, Yixuan Wu, Xing Su, Yanzhi Xu, Likang Wu, Hongke Zhao, Lei Zhang, Xiaohui Geng, Jianping Fan

机构 * Tianjin University(天津大学) Anhui University(安徽大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长周期智能体因工作空间状态变化难以追踪的问题,提出LemonHarness框架,通过显式执行边界、可复用规则知识库和时感知执行机制,在Terminal-Bench 2.0上实现86.52%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21514 2026-06-23 cs.LG 新提交 81%

Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

理解Muon优化器的能力与局限:河流-山谷视角

Tianqi Shen, Jinji Yang, Runze Shi, Jianhao Ma, Jiaye Teng, Ziye Ma

机构 * City University of Hong Kong (CityUHK)(香港城市大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出混合尖峰矩阵感知模型,从河流-山谷视角分析Muon优化器在早期加速收敛但后期易振荡的机制,并建议在最后阶段切换为GD类优化器。

Comments 44 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21397 2026-06-23 cs.CR cs.AI 新提交 81%

Evaluating LLMs for Real-World Web Vulnerability Detection

评估LLMs在真实世界Web漏洞检测中的表现

Sebastian Neef, Luca Jungnickel, Antonio Benjamin Buchholz, Valene Spence, Vicente Birke Gonzalez

机构 * Technische Universität Berlin(柏林技术大学) Freie Universität Berlin(柏林自由大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过基准测试六种前沿和开源LLMs在WordPress插件静态分析中的Web漏洞检测能力,发现模型和提示设计显著影响检测率,其中Claude Opus 4.6达到最高63%,但所有模型均存在报告不一致问题。

Comments To be published at AI&CCPS Workshop @ ARES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19924 2026-06-19 cs.AI 新提交 81%

The Tao of Agency: Autotelic AI, Embedded Agency and Dissolution of the Self

主体之道:自生目标人工智能、嵌入主体与自我的消解

Aritra Sarkar

机构 * Aritra Sarkar

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文探讨自生目标AI中主体生成自身目标的问题,通过内在动机、资源驱动先验、因果干预学习、稳态和嵌入性等概念,揭示嵌入性虽必要但不充分,并指出核心难题在于主体如何生成并相对化自我,最后提出量子表述、哲学解读和基于LLM的具体实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19735 2026-06-19 cs.AI cs.CV 新提交 81%

GLARE: A Natural Language Interface for Querying Global Explanations

GLARE: 用于查询全局解释的自然语言接口

Bhavan Vasu, Rajesh Mangannavar

机构 * Oregon State University(俄勒冈州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于LLM的交互接口GLARE,将自然语言问题转换为SQL查询以聚合局部解释数据,提升全局解释的可访问性和可用性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏