arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 33 篇

2608.02645 2026-08-05 cs.SE cs.AI 新提交 92%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03093 2026-08-05 cs.CR 新提交 91%

DHMark: Public-Key Watermarking for LLM-Generated Text via Diffie-Hellman-Guided Rejection Sampling

DHMark:基于Diffie-Hellman引导拒绝采样的LLM生成文本公钥水印

Haocheng Fu, Yuqi Qian, Luyao Wang, Yun Cao

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 DHMark是一种LLM生成文本的公钥水印框架,通过Diffie-Hellman引导拒绝采样分离载荷授权与文本证据,在多类攻击下保持高有效率且负控制接受率为0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13981 2026-08-05 cs.CR 版本更新 91%

VirtualCrime: Evaluating the Criminal Potential and Agentic Behaviors of Large Language Models via Sandbox Simulation

VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力

Yilin Tang, Yu Wang, Lanlan Qiu, Wenchang Gao, Yunfei Ma, Baicheng Chen, Tianxing He

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15030 2026-08-05 cs.AI 90%

Collab-REC: An LLM-based Agentic Framework for Balancing Recommendations in Tourism

Collab-REC:一种基于LLM的代理框架,用于平衡旅游推荐

Ashmi Banerjee, Adithi Satish, Fitri Nur Aisyah, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种多代理框架Collab-REC,通过三个LLM代理(个性化、流行度、可持续性)生成城市建议,并由非LLM调节器迭代优化,以缓解流行度偏差并提高推荐多样性。

Comments Accepted at ACM Transactions on Recommender Systems (TORS), August 2026

Journal ref ACM Transactions on Recommender Systems (TORS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03970 2026-08-05 cs.AI 新提交 89%

Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations

我们应该向大语言模型智能体打字还是说话?语音与键盘输入扰动的综合研究

Zizhao Hu, Nathan Elijah Segura, Mohammad Rostami, Jesse Thomason

专题命中 其他LLM :LLM(title,summary_cn);language model(abstract);分类 cs.AI

AI总结 本文通过提出HIVE工具集,研究语音与键盘输入扰动对LLM智能体性能的影响,发现语音转录扰动损害更大、两种扰动影响源于标记留存数量等七项结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22014 2026-08-05 cs.CL cs.AI 版本更新 88%

Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models

面向大型语言模型中对抗性后缀的可迁移性理解

Sarah Ball, Niki Hasrati, Alexander Robey, Avi Schwarzschild, Frauke Kreuter, Zico Kolter, Andrej Risteski

机构 * Ludwig-Maximilians-Universität München(慕尼黑莱布尼茨-马克斯大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的对抗性后缀可迁移性,分析出三个与迁移成功高度相关的统计属性,其成果可用于提升越狱攻击的实际效果。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01366 2026-08-05 cs.MA cs.AI 版本更新 88%

Asking Questions the Right Way: A Multi-Agent Conversational System for Prompt Formulation in Complex Task Resolution

以正确方式提问:用于复杂任务解决中提示词生成的多智能体对话系统

B. Sankar, Pawni Yadav, Srinidhi Ranjini Girish, Amogh A. S

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出多智能体对话系统PAWNI,通过三层提示框架优化提示生成前端,实验显示其可提升提示结构完整性、LLM输出质量并降低人类工作量,支持人-AI协作优化。

Comments 53 pages, 31 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02985 2026-08-05 cs.LG cs.CL stat.ML 新提交 88%

Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

大语言模型回测中的时间泄漏:测量、验证与调整后得分

Zeyu Zhang, Bradly C. Stadie

机构 * Northwestern University(西北大学)

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 该研究指出LLM回测的标准污染检测方法无效,提出利用已知截止时间和匹配干净对照组测量时间泄漏的方法,可检测并调整回测得分,澄清部分模型优势源于近期性而非真实技能。

Comments 12 pages main content, 45 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03160 2026-08-05 cs.MM cs.CV 新提交 88%

Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

屈服还是信服:时序采样门控视频大语言模型的主张依从性

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对视频大语言模型的两种失败情况,区分了可用性与权重两个原因,提出反转测试缓解屈服于错误主张的问题,提升了顺序准确率并使模型可弃权而非猜测。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20851 2026-08-05 cs.CV 版本更新 88%

Poisoning Prompt-Guided Sampling in Video Large Language Models

针对视频大语言模型中提示引导采样的投毒攻击

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01243 2026-08-05 cs.CL 版本更新 87%

Suffix-Constrained Greedy Search Algorithms for Causal Language Models

后缀约束的贪心搜索算法用于因果语言模型

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

机构 * Université Paris-Saclay, CNRS, LISN(巴黎萨克雷大学、法国国家科学研究中心、LISN) Université de Rennes, INSA Rennes, CNRS, IRISA(雷恩大学、里昂国立应用科学学院、法国国家科学研究中心、IRISA)

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本研究提出后缀约束贪心搜索算法,用于在因果语言模型中确保最终答案的结构化提取,同时不损害性能甚至提升结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02356 2026-08-05 cs.AI 版本更新 83%

SkillTrace: Traversing a Query-Skill Graph for Composable LLM Agents

SkillTrace:遍历查询-技能图以构建可组合的大语言模型智能体

Yue Yao, Shengyuan Wang, Xin Chen, Minke Zhang, Jia He, Bingjun Luo, Tom Gedeon

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SkillTrace通过查询-技能图的三个层级关系实现技能组合,在SkillsBench和ALFWorld上取得SOTA性能,且对不同骨干语言模型具备通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03676 2026-08-05 cs.DC 新提交 80%

TAOT: Topology-Aware Optimal Transport for Dynamic Expert Replica Placement in MoE Training

TAOT:MoE训练中面向动态专家副本放置的拓扑感知最优传输方法

Lingyun Zhang, Henghua Zhang, Shilei Gu, Kai Mo, Shuai Han, Shiyong Li, Yanpeng Wang, Dou Shen

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对MoE训练中动态路由引发的负载不平衡问题,提出TAOT拓扑感知最优传输方法,可实现1.43倍训练加速,平衡质量优异且通信成本降幅最高达74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 80%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06620 2026-08-05 eess.AS 版本更新 80%

Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection

预训练模型为何失效:多模态抑郁检测中的特征纠缠

Xiangyu Zhang, Beena Ahmed, Julien Epps

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02971 2026-08-05 cs.CL 新提交 79%

Mapping the City Through the Lens of Language Models

通过语言模型的视角映射城市

Wanqi Liu, Rong Zhao, Zhizhou Sha, Qinyu Cui, Yecheng Zhang

机构 * University College London(伦敦大学学院) Centre for Advanced Spatial Analysis (CASA)(高级空间分析中心) Tsinghua University(清华大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) South China University of Technology(华南理工大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究通过10个开放权重检查点结合多类技术,匿名测量语言模型对城市的隐含假设,勾勒出模型视角下的城市画像,揭示其对城市的偏好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04683 2026-08-05 cs.CV cs.CL 版本更新 79%

Failing to See or Failing to Know? Attributing Errors in Vision-Language Models

是看不见还是不知道?归因视觉语言模型中的错误

Khang Nhat Hoang Vo, Artem Vazhentsev, Artem Shelmanov, Timothy Baldwin, Yova Kementchedjhieva

机构 * MBZUAI The University of Melbourne(MBZUAI墨尔本大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 研究视觉语言模型在回答需额外知识问题时的错误,提出统一框架分离失败模式,探讨预生成信号能否预测错误源,发现可在解码前预测,能据此进行针对性干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03123 2026-08-05 cs.LG cs.AI 新提交 76%

Trajectory-Guided Forget-Recover Network for Continual LLM Unlearning

用于持续大语言模型遗忘的轨迹引导遗忘-恢复网络

Zezheng Wu, Xinghe Cheng, Qinggang Zhang, Haoran Luo, Jiapu Wang, Qing Yang, Jingwei Zhang

专题命中 其他LLM :LLM(title);分类 cs.AI、cs.LG

AI总结 针对持续大语言模型遗忘的两大挑战,提出TFR-Net,通过跟踪通道级风险抑制持久目标相关通道、恢复休眠通道,在四个数据集上取得更优的遗忘效果与保留性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03598 2026-08-05 cs.SE 新提交 71%

From Bug Reports to Browser-Executable Procedures: An LLM-Driven Agent for Web GUI Bug Reproduction

从错误报告到浏览器可执行流程:一种大语言模型驱动的Web GUI错误复现智能体

Cunming Zhang, Yu Pei, Michail Papadakis

专题命中 其他LLM :LLM(title)

AI总结 本文提出ReBug智能体系统,通过分阶段驱动真实浏览器复现Web GUI错误,在667条真实报告上的评估显示其性能优于基线,可有效支持基于报告的浏览器错误复现。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03361 2026-08-05 cs.CY cs.AI 新提交 70%

The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk

价值的进化起源:对AI对齐、感知能力和生存风险的启示

Francis Heylighen

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过追溯生物价值的进化起源,论证LLMs无内在生存动机与感知能力,正交性论点不适用于它们,AI对齐的核心挑战是确保LLMs应用习得的伦理价值。

Comments submitted chapter for book: T. Veloz & C. Rittberg (Eds.), AI and Human Values. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28587 2026-08-05 cs.SE cs.AI 版本更新 70%

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks

PAIChecker:揭示与检查类SWE-Bench基准中的PR-Issue不匹配问题

Manyi Wang, Junjielong Xu, Pinjia He

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对类SWE-Bench基准中13.6%的PR-Issue不匹配问题,提出多智能体系统PAIChecker,经实验验证其在两类基准上的二元准确率最高达92.12%

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Github Repo: https://github.com/manyiResearch/PAIChecker

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02792 2026-08-05 cs.CV 新提交 67%

PixelUp: Zero-Shot Semantic Feature Upsampling for Fine-Grained Vision Tasks

PixelUp:用于细粒度视觉任务的零样本语义特征上采样

Deepank Singh, Anurag Nihal, Vedhus Hoskere

专题命中 其他LLM :foundation model(abstract,abstract_cn)

AI总结 PixelUp是一种零样本、与视觉基础模型无关的语义特征上采样器,通过多尺度语义引导的窗口交叉注意力架构实现细粒度视觉任务的最优性能,可提升语义分割、深度估计等任务的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02764 2026-08-05 cs.MA cs.DB 新提交 67%

Stateful Governance for Concurrent Agentic Systems

并发智能体系统的有状态治理

Yuxiang Peng, Xiaodi Wu

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 本文针对并发智能体系统的有状态治理问题,提出Provenact运行时架构,可防止失效授权,在采购工作流中避免策略违规,为智能体框架的有状态治理提供了可行路径。

Comments 18 pages, 8 figures. Revision notes: system terminology updated; technical content and results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02607 2026-08-05 cs.DB cs.CY 新提交 67%

Extracting ODRL Policies from Business Process Models: A Graph Traversal Approach to Compliance-by-Extraction

从业务流程模型中提取ODRL策略:一种用于“通过提取实现合规性”的图遍历方法

Meem Arafat Manab, Marinella Quaranta, Ilaria Angela Amantea, Sheyla Leyva-Sánchez, Víctor Rodríguez-Doncel

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究提出一种图遍历流程管线,可自动从BPMN流程模型中提取ODRL策略,解决了大规模编写ODRL效率低、大型语言模型生成存在结构无效性的问题,捕捉了现有方法遗漏的等待语义,实现了可审计、互操作的合规策略生成。

Comments 10 pages, 2 figures, ODRL and beyond: practical applications and challenges for policy-base access and usage control. OPAL 2026, 2nd edition Co-located with the Extended Semantic Web Conference Dubrovnik , Croatia, 10th-11th MAY (half-day), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03507 2026-08-05 cs.CL cs.AI 新提交 62%

ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels

ChronoLens:测量跨时间、语言和语言层面的语言变化

Gagan Bhatia, Julian Schlenker, Simone Paolo Ponzetto, Steffen Eger

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 ChronoLens框架结合多语言模型等技术,分析1803-2026年五议会传统的海量文本,揭示同语言内各语言层面变化幅度相当、不同语言变化轨迹有差异,为跨语言历史语言变化研究提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03270 2026-08-05 cs.CV cs.AI 新提交 57%

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

GUI-Lens:面向通用视觉语言模型(VLM)的GUI定位粗到精裁剪框架

Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 GUI-Lens是面向通用VLM的GUI定位粗到精裁剪框架,通过主动视觉观察逐步聚焦确定目标,在四个基准和三个VLM后端上使定位准确率最高提升24.9个百分点,在GPT-5.5上达SOTA性能。

Comments Preprint. Code: https://github.com/Fzkuji/GUI-Agent-Harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03210 2026-08-05 cs.CL 新提交 57%

ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

ICO:通过迭代上下文优化增强语义偏移越狱攻击

Hujian Zhu, Yihao Huang, Felix Juefei-Xu, Xinfeng Li, Peng Zeng, Simeng Qin, Qing Guo, Geguang Pu

专题命中 其他LLM :foundation model(abstract);分类 cs.CL

AI总结 本研究针对现有语义偏移越狱攻击有效性有限的问题,提出带迭代上下文优化(ICO)的黑盒上下文感知框架,经多数据集与多模型实验,其攻击效果优于现有基线,平均成功率达74.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03050 2026-08-05 cs.SD cs.AI cs.MM eess.AS 新提交 57%

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

通过跨模态自举学习音乐风格以实现钢琴编曲

Jingwei Zhao, Gus Xia, Ziyu Wang, Ye Wang

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02935 2026-08-05 cs.CL 新提交 57%

Character Iconicity vs. Arbitrariness: An Arabic NLP Perspective

字符象似性与任意性:阿拉伯语自然语言处理视角

Dorieh Alomari, Irfan Ahmad, Maged S. Al-shaibani

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本研究从NLP视角探究阿拉伯语字符形式-功能关系,对比加点、无点及随机重映射的阿拉伯语,发现随机重映射可在降本减存的同时保持良好性能,表明阿拉伯语字符形式-功能关系具任意性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03329 2026-08-05 cs.SE 新提交 50%

Making AI Visible, Not Vanished: How AI Policies Reshape Developer Experience on GitHub

让AI可见而非消失:AI政策如何重塑GitHub上的开发者体验

Yunqi Chen, Thomas Zimmermann, Bianca Trinkenreich

专题命中 其他LLM :prompting(abstract)

AI总结 本研究通过分析29624个GitHub代码库,提出TRACE框架,发现AI治理主要规范而非禁止AI辅助开发,强调透明度与责任性的政策效果更优。

详情

展开后加载摘要…

URL PDF HTML 收藏