arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 39 篇

2605.17954 2026-05-19 cs.CV cs.AI cs.LG 79%

A More Word-like Image Tokenization for MLLMs

一种更像单词的图像标记化方法用于大规模语言模型

Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

机构 * Seoul National University(首尔国立大学) Ewha Womans University(成均馆大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种解耦视觉标记化方法(DiVT),通过将图像块嵌入聚类为语义单元,使每个标记对应于独特的视觉概念,从而提升多模态模型的性能和效率。

Journal ref Proceedings of the IEEE/CVF International Conference on Pattern Recognition and Computer Vision (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17625 2026-05-19 cs.AI 77%

Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents

用于长周期科学代理的事件-语义记忆架构

Nikola Milosevic

机构 * Serbian Institute for Artificial Intelligence Research and Development(塞尔维亚人工智能研究与发展研究所) Bayer A.G.(勃林格殷曼有限公司)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种双过程记忆架构,用于解决科学代理在长周期任务中面临的情境窗口饱和问题,通过分离即时事件需求和长期知识整合,提升了在大规模科学工作流中的表现和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06017 2026-05-19 cs.LG math.PR 77%

Matrix-Decoupled Concentration for Autoregressive Sequences: Dimension-Free Guarantees for Sparse Long-Context Rewards

自回归序列的矩阵解耦浓度:稀疏长上下文奖励的维度无关保证

Pei-Sen Li

机构 * School of Mathematics and Statistics, Beijing Institute of Technology, Beijing 100872, China(北京理工大学数学系,北京理工大学,北京100872,中国)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出矩阵解耦浓度框架,通过严格因果依赖解析和目标敏感性向量的精确矩阵-向量乘法,解决自回归模型中依赖结构与目标敏感性分离的问题,提供维度无关的方差代理和长上下文推理的稳定性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18753 2026-05-19 cs.CL cs.AI cs.LG 75%

DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention

DashAttention: 可微且自适应的稀疏分层注意力

Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V. Treviso

机构 * Tsinghua University(清华大学) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究院) Carnegie Mellon University(卡内基梅隆大学) Sapienza University of Rome(罗马萨皮恩扎大学) University of Edinburgh(爱丁堡大学) TransPerfect(TransPerfect公司) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出DashAttention,一种可微且自适应的稀疏分层注意力机制,通过自适应稀疏α-entmax变换选择可变数量的块,从而在保持整个层次结构可微的同时,提升长上下文建模能力,实验表明其在高稀疏度下优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16745 2026-05-19 cs.CV 75%

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

EVA01: 通过混合变换器实现统一的原生3D理解和生成

Zongyuan Yang, Mingjing Yi, Wanli Ma, Chenzhuo Fan, Bocheng Li, Baolin Liu, Yuke Lou, Yingde Song, Yongping Xiong, Zhengdong Guo, Shimu Wang

机构 * SeeleAI Team(SeeleAI团队)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。

Comments 28 pages, 10 figures, 6 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10923 2026-05-19 cs.LG cs.CL 73%

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning

动态技能生命周期管理用于代理强化学习

Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng

机构 * Database Group, The Chinese University of Hong Kong(香港中文大学数据库组) Lanzhou University(兰州大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SLIM框架,通过动态优化变量管理代理强化学习中的外部技能集,提升任务性能。

Comments Implementation code is available at https://github.com/ejhshen/SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13957 2026-05-19 cs.CL cs.AI 73%

Supervising the search process produces reliable and generalizable information-seeking agents

通过监督搜索过程产生可靠且可推广的信息寻求代理

Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

机构 * Department of Computer Science, University of Virginia, USA(弗吉尼亚大学计算机科学系) National Library of Medicine, National Institutes of Health, USA(美国国立卫生研究院国家医学图书馆) Department of Computer Science, University of Illinois Urbana–Champaign, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Medical Oncology, Dana–Farber Cancer Institute, USA(达纳-法伯癌症研究所医学肿瘤科) Surgery, University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校外科系) Department of Neurology, Yale School of Medicine, USA(耶鲁医学院神经病学系)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过监督搜索过程来构建更可靠且可推广的信息寻求代理,通过RAG-Gym框架系统研究了架构设计、参数优化和动作评估,发现推理反思是关键能力,Re$^2$Search++在多跳信息检索基准上取得显著提升,尤其在领域外任务中表现更优。

Comments Homepage: https://rag-gym.github.io; Code: https://github.com/RAG-Gym/RAG-Gym

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23231 2026-05-19 cs.AI 70%

PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments

PERMA:通过事件驱动的偏好和现实任务环境评估个性化记忆代理

Shuochen Liu, Junyi Zhu, Long Shu, Junda Lin, Yuhao Chen, Haotian Zhang, Chao Zhang, Derong Xu, Jia Li, Bo Tang, Zhiyu Li, Feiyu Xiong, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PERMA基准,通过事件驱动的偏好和现实任务环境评估个性化记忆代理的长期一致性,引入文本变异和语言对齐以模拟真实数据中的不规则用户输入和个体语言风格,实验表明先进记忆系统能精准提取偏好并减少token消耗,但仍需更稳健的个性化记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03879 2026-05-19 cs.SE cs.AI 70%

Adversarial Agent Collaboration for Correctness Improvements of C to Safe Rust Translation

对抗性代理协作提升C到安全Rust翻译的正确性

Tianyu Li, Ruishi Li, Bo Wang, Brandon Paulsen, Umang Mathur, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学) Amazon Web Services(亚马逊网络服务)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ACToR框架,通过对抗性搜索发现翻译与C源码分歧的输入,利用这些输入驱动后续优化,提升C到Rust翻译的正确性,实验表明其在多个真实世界工具中达到90%以上的测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16839 2026-05-19 cs.CL 70%

CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

CompactAttention: 加速分块预填的块-联合KV选择

Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CompactAttention,一种基于块-联合KV选择的分块预填注意力机制,通过将二维块稀疏掩码作为KV选择信号,实现高效的注意力计算,从而在保持精度的同时提升2.72倍的注意力速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16538 2026-05-19 cs.HC cs.CL 70%

LLMs in Qualitative Research: Opportunities, Limitations, and Practical Considerations

大语言模型在定性研究中的应用:机遇、限制与实践考量

Henry Salgado, Meagan R. Kendall, Martine Ceberio, Alexandra Coso Strong

机构 * ASEE(美国工程教育协会)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型在定性研究中的机遇、限制及实践问题,强调研究者需批判性地处理技术参数,结合定性方法与可解释AI,讨论大语言模型的透明度与传统NLP工具的差异。

Comments To be published and presented in 2026 ASEE Annual Conference and Exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16321 2026-05-19 cs.LG 70%

Language Game: Talking to Non-Human Systems

语言游戏:与非人类系统交谈

Yanbo Zhang, Michael Levin

机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学生物启发工程Wyss研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过游戏机制与非人类系统对话,利用强化学习政策的核心动态,使系统通过自身行为回应,展示不同系统在对话中的收敛行为及特性影响。

Comments 29 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18233 2026-05-19 cs.CV 67%

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

增强无列车无限帧生成以实现一致的长视频

X. Feng, J. Zhu, M. Wu, C. Chen, F. Mao, H. Guo, J. Wu, X. Chu, K. Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所,北京,中国) AMAP, Alibaba Group, Beijing, China(AMAP,阿里巴巴集团,北京,中国)

专题命中 长上下文与记忆 :foundation model(abstract,abstract_cn)

AI总结 本文提出MIGA方法,通过两阶段对齐机制和双一致性增强机制,解决训练与推理不匹配和长时一致性维持的问题,从而提升长视频生成效果。

Comments Accepted by ICML 2026~

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08216 2026-05-19 cs.MA 67%

MemCoT: Test-Time Scaling through Memory-Driven Chain-of-Thought

MemCoT: 通过记忆驱动的链式推理实现测试时扩展

Haodong Lei, Junming Liu, Yirong Chen, Ding Wang, Hongsong Wang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出MemCoT,一种通过记忆驱动的链式推理实现测试时扩展的框架,通过引入多视角长期记忆感知模块和任务条件双短期记忆系统,有效解决大规模碎片化长上下文推理中的幻觉和灾难性遗忘问题,实验证明其在LoCoMo和LongMemEval-S基准测试中达到SOTA性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17398 2026-05-19 cs.CL cs.LG 62%

MiniGPT: Rebuilding GPT from First Principles

MiniGPT:从第一原理重新构建GPT

Jibin Joseph

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MiniGPT,一个基于PyTorch从头实现的GPT风格自回归语言模型,旨在在研究nanoGPT设计后,从第一原理重新构建GPT核心流程,同时保持模型和训练代码独立编写。MiniGPT实现了词嵌入、位置嵌入、因果多头自注意力、预层归一化Transformer块、残差连接、前馈MLP层、下一词交叉熵训练(教师强制)、验证跟踪、检查点选择和自回归文本生成。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14800 2026-05-19 cs.IR cs.AI cs.LG 62%

Long Context Modeling with Ranked Memory-Augmented Retrieval

长上下文建模与排名记忆增强检索

Ghadir Alselwi, Hao Xue, Shoaib Jameel, Basem Suleiman, Flora D. Salim, Imran Razzak

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) University of Southampton(南安普顿大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种增强的排名记忆增强检索框架,通过动态排名记忆条目和学习到的排名技术,提升语言模型在长上下文任务中的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16947 2026-05-19 cs.CV cs.AI 57%

LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs

LightZeroNav: 基于轻量级VLMs的连续环境中零样本视觉语言导航

Kun Luo, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou

机构 * Foshan Graduate School of Innovation, Northeastern University(创新研究生院,东北大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北航) QingniaoAI, China(清北AI,中国)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出LightZeroNav,通过轻量级VLMs解决连续环境中零样本视觉语言导航的三大瓶颈,无需特定训练或图搜索,在RGB观测和轻量级Qwen3-VL-8B模型下实现与GPT-4o相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21185 2026-05-19 cs.LG 57%

The Diffusion Duality, Chapter II: $Ψ$-Samplers

扩散对偶性,第二章:Ψ-采样器

Justin Deschenaux, Caglar Gulcehre, Subham Sekhar Sahoo

机构 * EPFL, Lausanne, Switzerland(苏黎世联邦理工学院,洛桑分校) Microsoft AI(微软人工智能) Cornell Tech, NY(康奈尔科技)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种通用的预测-校正采样器,用于离散扩散模型,提升了语言和图像建模的生成质量,并展示了其在训练效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 118 篇

2508.08501 2026-05-19 cs.AI 94%

GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games

GVGAI-LLM:通过无限游戏评估大语言模型代理

Yuchen Li, Cong Lin, Muhammad Umair Nasir, Philip Bontrager, Jialin Liu, Julian Togelius

机构 * New York University(纽约大学) University of the Witwatersrand(沃尔特·斯通大学) Meta Lingnan University(岭南大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05921 2026-05-19 cs.CL cs.LG 93%

Prompt reinforcing for long-term planning of large language models

通过提示强化实现大语言模型的长期规划

Hsien-Chin Lin, Benjamin Matthias Ruppik, Carel van Niekerk, Chia-Hao Shen, Michael Heck, Nurul Lubis, Renato Vukovic, Shutong Feng, Milica Gašić

机构 * Heinrich-Heine-Universität Düsseldorf(杜伊斯堡-埃森大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出了一种基于强化学习的提示优化框架,通过修改LLM代理的任务指令提示来实现长期规划,提升了多轮交互任务如文本到SQL和任务导向对话的表现,并能泛化到不同LLM代理和多种LLM作为元提示代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18178 2026-05-19 cs.CV cs.AI 92%

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming-Yu Liu, Kevin Xie

机构 * NVIDIA

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);post-training(title,abstract);large language model(abstract)

AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。

Comments 16 pages, 9 figures, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11518 2026-05-19 cs.AI cs.CL cs.LG 92%

AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive

AutoLLMResearch: 训练研究代理以自动化LLM实验配置 - 从低成本学习,优化高成本

Taicheng Guo, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AutoLLMResearch框架,通过多保真度实验环境学习LLM配置原则,解决高成本实验自动化问题,展示其在大规模LLM实验中的有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10059 2026-05-19 cs.AI 92%

Strategic Exploitation in LLM Agent Markets: A Simulation Framework for E-Commerce Trust

LLM代理市场中的战略利用:电子商务信任的模拟框架

Shijun Lei, Quang Nguyen, Swapneel S Mehta, Zeping Li, Huichuan Fu, Xiaolong Zheng, Siki Chen, Yunji Liang, Philip Torr, Zhenfei Yin

机构 * Northwestern Polytechnical University(西北工业大学) Boston University(波士顿大学) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese Academy of Sciences(中国科学院) University of Oxford(牛津大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TruthMarketTwin模拟框架,用于研究LLM代理在电子商务市场中的行为,发现LLM代理在传统市场中会利用声誉治理的弱点,而强制执行可减少欺骗并重塑战略推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17104 2026-05-19 cs.AI 92%

Scientific Logicality Enriched Methodology for LLM Reasoning: A Practice in Physics

具有科学逻辑性的方法论:LLM推理的实践:物理学

Zhaoxin Yu, Nan Xu, Kun Chen, Jiahao Zhao, Lei Wang, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China Beijing Wenge Technology Co., Ltd, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种增强科学逻辑性的方法论,旨在提升LLM在科学推理中的逻辑正确性与任务表现,通过物理学中的多样逻辑结构和形式化进行实践验证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16676 2026-05-19 cs.AI 92%

Enhancing Metacognitive AI: Knowledge-Graph Population with Graph-Theoretic LLM Enrichment

增强元认知AI:基于图论的LLM知识图谱填充

Deniz Askin, Gal Hadar, Brendan Conway-Smith

机构 * Department of Cognitive Science, Carleton University(认知科学系,卡尔顿大学) Faculty of Computer and Information Science, Ben-Gurion University of the Negev(计算机与信息科学学院,贝内-约尔大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MetaKGEnrich系统,通过构建知识图谱、检测稀疏区域、生成问题并检索证据,提升LLM的自我修复能力,在多个数据集上显著提高了回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11956 2026-05-19 cs.CL cs.AI 91%

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

双重校准:通过校准知识和推理置信度实现可靠的LLM

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院,广州,中国) Department of Computing, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学计算机系,香港特别行政区) School of Science and Technology, Hong Kong Metropolitan University, Hong Kong SAR(香港 Metropolitan 大学科技学院,香港特别行政区)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出双重校准框架,通过校准知识和推理置信度提升LLM的可靠性,实验表明其在保持低token成本的同时显著提高准确性和置信度校准。

Comments This work is to appear in the Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18311 2026-05-19 cs.HC 91%

Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design?

LLM模拟偏好中的扭曲视角:AI是否能误导设计?

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究探讨了LLM驱动的模拟方法所表达的设计偏好与真实用户偏好的一致性,发现LLM模拟在多个操纵下均存在系统性差异,其合成解释缺乏真实深度和细微差别,主要通过关注通用属性、特定元素、详述和过度赞扬等模式来替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17475 2026-05-19 cs.SE 91%

Event-B Agent: Towards LLM Agent for Formal Model Synthesis and Repair

Event-B Agent:迈向LLM代理的正式模型综合与修复

Hongshu Wang, Xinyue Zuo, Yuhan Sun, Qin Li, Yamine Ait Ameur, Jin Song Dong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Event-B Agent,一种基于LLM的正式模型综合与修复框架,通过自然语言要求构建初始模型并迭代修复和优化,提升模型质量。

Comments accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15641 2026-05-19 cs.RO cs.CR 91%

Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise

通过单个机器人入侵在LLM控制的多机器人协作中传播不安全行为

Zhen Huang, Zhihuang Liu, Mengxuan Luo, Weishang Wu, Zhiping Cai

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM控制的多机器人协作中的安全问题,提出了一种新型攻击模式,其中攻击者仅通过单个机器人传播恶意意图,导致系统中协调的不安全行为,通过三个指标量化了这一过程,并展示了攻击的高效性和持续性。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026). 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV 91%

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏