arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1562 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1562 篇

2607.26306 2026-07-30 cs.PL 新提交 83%

Foundational Refinement Proofs for Deployed Bytecode, at the Price of Tokens

已部署字节码的基础精化证明:以代币为代价

Lefteris Lazaropoulos, Zoe Paraskevopoulou

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究构建了Lean框架EquiVM,利用前沿LLM以代币为代价,为EVM上23个真实合约生成了可复现的基础精化机器证明,实现了此前技术未达的特性组合,重塑验证框架架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21306 2026-07-24 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 83%

AI Assistants Overassist

人工智能助手过度协助

Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner

机构 * Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型作导师时,其干预方式对学习的影响。介绍Int-Bench基准,模拟学生解题、教师决定干预。在多领域评估大语言模型教师干预情况,并与人类对比,发现其干预频繁且倾向提供完整方案,表明为短期成功而非深层学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31260 2026-07-01 cs.RO 新提交 83%

Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning

先规划正确,再规划紧凑:面向高效具身推理的符号强化学习

Xiangli Shi, Xiaomeng Zhu, Ye Tian, Yuchun Guo, Ziyang Sun, Lujie Yin, Yuxuan Zhou, Yufei Huang

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯) University of London(伦敦大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。

Comments 18 pages, 10 figures, 14 tables; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20621 2026-06-23 cs.AI cs.CL cs.LG cs.MA stat.ML 新提交 83%

PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate

PEAR: 置换等变自适应路由多智能体辩论

Yang Feng, Ziwei Xu, Xia Hu, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15972 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning

一次形式化,其余编辑:基于Lean的高效数学推理答案选择

Ji Feng, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BASE流水线,通过形式化一个候选答案并编辑其余答案,减少自动形式化调用约5倍,同时提升选择准确性。

Comments 15 pages, 1 figure. Code available at https://github.com/ucr-rai/base-and-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 83%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 83%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12689 2026-08-14 cs.CV cs.AI 新提交 83%

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

Mr3D-VL:面向多参数3D磁共振成像的通用视觉语言基础模型

Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文针对现有3D视觉语言模型无法满足多参数3D MRI跨模态协同推理需求的问题,提出Mr3D-VL模型,通过特定设计实现性能提升,在多项任务上优于同规模的领域及通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09485 2026-08-11 cs.AI 新提交 83%

Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents

能力并非倾向:评估公民大语言模型智能体的压力鲁棒合作行为

Neel Tushar Shah, Manglam Kartik, Akshat Karkar

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 推理与问题求解 :LLM(title);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 该研究针对公民大语言模型智能体,推出DiffCoop-Civic评估套件,发现压力会显著影响模型合作行为,提出Pareto-Trace提示干预提升压力鲁棒性。

Comments Accepted at ICML AI4GOOD Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08964 2026-08-11 cs.LG 新提交 83%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-10 cs.CL 新提交 83%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05097 2026-08-06 cs.CL 新提交 83%

Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?

相同公式,不同语义:语言模型是否遵循模态逻辑规范?

Réemi Andrieu, Damien Sileo

机构 * Univ. Lille(里尔大学) Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) Centrale Lille(里尔中央理工学院) UMR 9189 - CRIStAL(UMR 9189 - CRIStAL(法国国家科研中心联合研究机构))

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 该研究探究语言模型是否遵循模态逻辑规范,构建成对模态问题测试五款模型,发现遵循规定模态语义依赖推理模式与模型身份,发布相关产物。

Comments 9 pages. Code: https://github.com/sileod/modal-semantics-reasoning. Data and artifacts: https://huggingface.co/datasets/sileod/modal-semantics-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04719 2026-08-06 cs.AI 新提交 83%

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

用金丝雀工具诊断大语言模型智能体的工具选择推理

Atul Anand, Sourav Chattaraj

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究引入金丝雀工具诊断LLM智能体的工具选择推理,通过多维度分类法评估8个模型,发现模型能力提升会降低易感性,分类法具能力分层性,且发布了相关框架与数据。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00014 2026-08-04 cs.AI 新提交 83%

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

CoT-Core:通过感知思维链的核心集选择加速大语言模型评估

Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。

Comments 23 pages, 3 figures, 10 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27304 2026-07-31 cs.LG cs.CV 新提交 83%

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) School of UEMK Kolkata(UEMK Kolkata学院) Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 83%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21933 2026-07-27 cs.AI 新提交 83%

Semiotic logical hexagon theory for LLM logical reasoning

用于大语言模型逻辑推理的符号逻辑六边形理论

Yunyao Zhang, Xinglang Zhang, Zeliang Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21558 2026-07-24 cs.AI 新提交 83%

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

超越谄媚:大语言模型道德推理中的结构化抵抗与顺从

Baihui Wang, Bernard Koch

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交 83%

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18249 2026-07-22 q-bio.QM cs.AI 新提交 83%

MechAInistic: An LLM-guided Multi-Agent System for Reasoning over Genome-Scale Constraint-Based Metabolic Models

MechAInistic:一种由大语言模型引导的多智能体系统,用于基于基因组规模的约束代谢模型进行推理

Josh Loecker, Narayna Puraja, William Bryan, Bhanwar Lal Puniya, Ahmed Abdeen Hamed, Tomáš Helikar

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在降低基于约束的代谢建模使用门槛,开发了MechAInistic多智能体系统,借助大语言模型,围绕特定模式将自然语言问题转化为可执行工作流程,通过两个免疫细胞代谢模型用例验证,能生成可追溯的治疗假设。

Comments 23 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15277 2026-07-17 cs.CL 新提交 83%

Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

划分、提示、聚合:语言模型中的统计自一致性

Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner

专题命中 推理与问题求解 :language model(title);LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 研究语言模型估计是否遵循自一致性原则,用二叉树划分总体,以子总体描述提示模型并聚合结果,发现广泛违反一致性,揭示宏观谬误模式,表明模型虽有子总体知识但未有效用于总体估计,建立了评估语言模型的新准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14753 2026-07-17 cs.SD cs.AI 新提交 83%

Large Audio Language Models for Spoofing-Aware Speaker Verification

用于防欺骗语音识别的大型音频语言模型

Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir, Artem Dvirniak, Dmitrii Korzh, Oleg Y. Rogov

机构 * Applied AI Institute(应用人工智能研究所) MIRAI(未来人工智能研究机构) HSE(高等经济学院) MTUCI(莫斯科国立通信与信息技术大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究用于防欺骗语音识别的大型音频语言模型,通过零样本提示等多种方式进行系统评估,发现预训练模型零样本时不佳,特定任务适应可改善,还找到多种实现竞争力性能的途径,为统一防欺骗语音识别提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06757 2026-07-09 cs.AI cs.MA 新提交 83%

LLM-powered reasoning in agent-based modeling

基于代理建模中的大语言模型驱动推理

Sifat Afroj Moon, Dakotah Maguire, Adam Spannaus, Joe Tuccillo, Maksudul Alam, Sudip K. Seal, John Gounley, Heidi Hanson

机构 * ORNL(橡树岭国家实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04394 2026-07-07 cs.AI cs.SC 新提交 83%

MechMath Agent Team: LLM Driven Agents for Mathematical Research

机械数学智能体团队:用于数学研究的大语言模型驱动智能体

Yichuan Cao, Ruichen Qiu, Junqi Liu, Jiaqi Wang, Dakai Guo, Ruyong Feng, Lihong Zhi, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数学研究给现有推理系统带来的挑战,提出机械数学智能体团队,设计三方架构,实例化三个专业智能体,闭环协作生成形式化认证的数学证明,经评估可在研究全周期辅助,有通用架构、系统实例及实证验证三大贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02873 2026-07-07 cs.SE cs.AI cs.CR 新提交 83%

Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

大语言模型安全工具编排的决定因素与限制:基于HexStrike-AI的研究

Romain Gerard, Assmaa Zeghaider, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 以HexStrikeAI为测试平台,通过评估系统、诊断故障并改进,运行多类挑战,发现驱动客户端是固定模型的首要因素,整体解决率提升,剩余故障受推理或环境限制,还讨论了编排器评估及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26935 2026-06-26 cs.AI 新提交 83%

Where Do CoT Training Gains Land in LLM based Agents?

CoT训练在基于LLM的智能体中的增益何在?

Jingyu Liu, Zhiwen Wang, Yuxin Jing, Huanyu Zhou, Yong Liu

机构 * ByteDance(字节跳动) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 通过比较有无思维链的动作预测,发现CoT训练主要提升直接动作预测质量,而非CoT推理优势,后期检查点更依赖提示,选择性掩码动作监督可改善泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17082 2026-06-17 cs.RO cs.AI 新提交 83%

ParkingTransformer: LLM-Enhanced End-to-End Trajectory Planning for Autonomous Parking

ParkingTransformer: 基于大语言模型增强的端到端自主泊车轨迹规划

Hauteng Wu, Xu Li, Dong Kong, Zihang Wang, Xieyuanli Chen, Benwu Wang, Wenkai Zhu

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) School of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) College of Transportation, Shandong University of Science and Technology(山东科技大学交通学院) National University of Defense Technology(国防科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ParkingTransformer框架,利用多视角感知和大语言模型场景理解能力,结合轨迹查询与隐状态特征,直接输出规划轨迹,无需密集BEV表示,通过3D位置编码、固定窗口流机制和粗到细解码策略提升性能,在CARLA和实车实验中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15308 2026-06-16 cs.AI 新提交 83%

Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades

强制延迟:在多模态大语言模型级联中操纵路由决策

Zhongye Liu, Yaopei Zeng, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出强制延迟攻击(FDA),通过对抗性图像攻击降低弱模型置信度,迫使级联系统将查询路由到强模型,揭示了MLLM级联在计算分配上的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12336 2026-08-14 cs.CL cs.AI 新提交 82%

StorySpark: Module-wise Evolutionary Search for Story Premise Generation

StorySpark:面向故事前提生成的模块级进化搜索

Yang Yang, Zining Zhong, Qian Cao, Jindong Li, Boyun Xu, Kaishen Yuan, Menglin Yang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Shandong University(山东大学) Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM故事生成中前提构思不足的问题,提出StorySpark模块级进化搜索框架,通过优化叙事模块生成更优质的故事前提,提升下游故事质量与创意性。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12125 2026-08-13 cs.GT cs.AI cs.CL cs.MA 新提交 82%

Do LLMs Take Care of Their Own? Similarity Signals Can Induce Cooperation

大语言模型会照顾同类吗?相似性信号可诱导合作

Akash Kundu, Emanuel Tewolde, Ratip Emin Berker, Samuel F. Brown, Vincent Conitzer

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个带分级相似性信号的LLM决策评估框架,发现不同LLM应对相似性信号差异大、数据集对诱导合作影响小等,构建的LLM-行为博弈论模型可在高相似性下支持合作均衡。

Comments 41 pages, 18 Figures, 4 Tables, 16 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏