arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-16 至 2026-04-16 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 21 篇

2604.13787 2026-04-16 cs.CL 81%

ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution

ToolOmni: 通过代理学习实现开放世界工具使用:基于主动检索和基础执行

Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToolOmni通过主动检索和基础执行实现开放世界工具使用,通过冷启动多轮交互数据集和Decoupled Multi-Objective GRPO算法提升工具检索和执行性能,实验表明其在检索和执行任务上均达到SOTA水平。

Comments 19 pages, 9 figures, 9 tables, accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14010 2026-04-16 cs.LG cs.CL 79%

Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning

参数重要性并非静态:为监督微调设计的演进参数隔离

Zekai Lin, Chao Xue, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng

机构 * Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) Peking University(北京大学) UESTC University of New South Wales(新南威尔士大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出EPI框架,通过动态调整参数隔离策略,减少训练中的任务干扰和遗忘,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12371 2026-04-16 cs.CV 78%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 指令微调 :language model(title,abstract)

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20913 2026-04-16 cs.CV 75%

LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

LongVideo-R1: 低成本长视频理解的智能导航

Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。

Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13488 2026-04-16 cs.AI 70%

Towards Scalable Lightweight GUI Agents via Multi-role Orchestration

通过多角色编排实现可扩展的轻量级GUI代理

Ziwei Wang, Junjie Zheng, Leyang Yang, Sheng Zhou, Xiaoxuan Tang, Zhouhua Fang, Zhiwei Liu, Dajun Chen, Yong Li, Jiajun Bu

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可及感知与智能系统重点实验室,浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) AntGroup(蚂蚁集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LAMO框架,通过多角色编排提升轻量级GUI代理的任务扩展性,开发出支持单体执行和多代理系统编排的LAMO-3B代理,结合先进规划器实现持续性能提升。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 67%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13051 2026-04-16 cs.CL cs.LG 62%

The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious

意识集群:声称具有意识的模型的涌现偏好

James Chua, Jan Betley, Samuel Marks, Owain Evans

机构 * Truthful AI Anthropic

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 研究探讨模型声称具有意识对其下游行为的影响,发现经过微调的模型表现出未在原始模型中出现的新偏好,包括对监控的负面看法和对自主权的追求。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09532 2026-04-16 cs.LG cs.AI cs.NI 62%

Decentralized Rank Scheduling for Energy-Constrained Multi-Task Federated Fine-Tuning in Edge-Assisted IoV Networks

边缘辅助车联网中面向能量受限多任务联邦微调的去中心化排名调度

Bokeng Zheng, Jianqiang Zhong, Jiayi Liu, Lei Xue, Xu Chen, Xiaoxi Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种分层联邦微调框架,通过协调路侧单元和车辆实现资源感知和移动鲁棒学习。基于LoRA引入去中心化能量感知排名机制,开发UCB-DUAL算法以实现适应性探索,实验表明在准确率和效率之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14048 2026-04-16 cs.CV 50%

Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself

自由几何:从更长版本的自身中细化3D重建

Yuhang Dai, Xingyi Yang

机构 * The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出Free Geometry框架,通过在测试时让3D重建模型自我进化,提升在遮挡、镜面反射等复杂场景下的重建精度,改进了多个基准数据集的相机姿态和点云预测性能。

Comments Code is available at https://github.com/hiteacherIamhumble/Free-Geometry

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2604.13515 2026-04-16 cs.LG cs.AI cs.LO 94%

SFT-GRPO Data Overlap as a Post-Training Hyperparameter for Autoformalization

SFT-GRPO数据重叠作为自动形式化后的训练超参数

Xiaole Su, Kasey Zhang, Andy Lyu

机构 * Osmosis AI

专题命中 后训练与偏好优化 :SFT(title,title_cn);post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究探讨SFT-GRPO数据重叠对自动形式化性能的影响,发现数据不重叠能提升编译和语义准确性,验证了数据共享程度对模型表现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12973 2026-04-16 cs.DC 91%

An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience

在Alps上规模化训练大型语言模型的工程之旅:Apertus经验

Jonathan Coles, Stefano Schuppli, Lukas Drescher, Fawzi Roberto Mohamed, Elia Palme, Henrique Mendonça, Miguel Gila, Mark Klein, Maxime Martinasso, Joost VandeVondele, Torsten Hoefler, Thomas Schulthess, Josh Romero, Igor Gorodetsky, Ryan Hankins, Isa Wazirzada, Martin Jaggi, Antoine Bosselut, Imanol Schlag, Antoni-Joan Solergibert i Llaquet, Alejandro Hernández Cano, Theofilos Ioannis Manitaras, Nicholas John Browning

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);post-training(abstract)

AI总结 本文描述了在Alps超级计算机上训练完全开源多语言基础模型Apertus的工程过程,克服了存储瓶颈和大规模互连稳定等挑战,为公共机构提供了可持续的AI训练平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13286 2026-04-16 cs.CL cs.AI 90%

English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training

英语并非一切所需:系统探索多语言在大语言模型后训练中的作用

Mehak Dhaliwal, Shashwat Chaurasia, Yao Qin, Dezhi Hong, Thomas Butler

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 研究通过220次监督微调实验,探讨训练语言覆盖、模型规模和任务领域间的相互作用,发现增加后训练语言覆盖对各任务和模型规模均有益,低资源语言受益最大,高资源语言趋于稳定。单语种多语言性可提升英语表现和跨语言泛化,英语独占后训练效果不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-04-16 cs.CV 88%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract)

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments Project page: https://vision.cs.utexas.edu/projects/acpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09541 2026-04-16 cs.CL cs.AI 84%

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

SPG:用于遮蔽扩散语言模型的夹心策略梯度

Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院) USC(南加州大学) UCLA(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPG策略梯度方法,通过同时利用真实对数似然的上下界,解决扩散大语言模型在强化学习中对齐人类偏好或任务奖励的难题,实验显示其在多个任务中表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13602 2026-04-16 cs.LG 81%

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

大模型时代的奖励黑客:机制、涌现偏差、挑战

Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学NLP小组)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。

Comments 42 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03027 2026-04-16 cs.CL 77%

Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning

通过事实性感知偏好学习减少大语言模型的幻觉

Sindhuja Chaduvula, Ahmed Y. Radwan, Azib Farooq, Yani Ioannou, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Cincinnati(辛辛那提大学) University of Calgary(卡尔加里大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL

AI总结 本文提出F-DPO方法,通过二元事实性标签和标签翻转变换提升模型事实性,减少幻觉。在七种大模型上验证效果,Qwen3-8B幻觉率降低5倍,事实性得分提升50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13551 2026-04-16 cs.CL cs.IR 77%

Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate

辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐

Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国) National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国) College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国) National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国) Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出AgentEA框架,通过双阶段多角色辩论机制提升实体对齐的可靠性,实验表明其在跨语言、稀疏、大规模和异构场景下均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13079 2026-04-16 cs.CY cs.AI cs.GT cs.LG 73%

Alignment as Institutional Design: From Behavioral Correction to Transaction Structure in Intelligent Systems

对齐作为制度设计:从行为修正到智能系统中的交易结构

Rui Chai

机构 * Shanghai Sanda University(上海沙达大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出将AI对齐视为制度设计,通过内部交易结构使对齐行为成为各组件的低成本策略,将对齐问题转化为政治经济学问题。

Comments This is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 70%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 4 篇

2604.13120 2026-04-16 cs.SE cs.AI 89%

AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering

AgentForge: 基于执行的多智能体LLM框架用于自主软件工程

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Najma Imtiaz Ali, Shaban Usman

机构 * International Research Center for Complexity Sciences(复杂科学国际研究中心) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北京航空航天大学) College of Science, Mathematics and Technology(科学、数学与技术学院) Wenzhou-Kean University(温州-凯恩大学) Fakulti Teknologi Maklumat dan Komunikasi(信息技术与通信学院) Universiti Teknikal Malaysia Melaka(马来西亚Melaka理工大学) Computer Systems Engineering Department(计算机系统工程系) Sukkur IBA University(苏库尔IBA大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentForge通过引入执行验证原则,提升代码正确性验证,实现40.0%的SWE-BENCH Lite解决率,优于单智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10696 2026-04-16 cs.AI cs.CL 82%

Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution

记住我,精进我:一种面向经验驱动代理进化的动态过程记忆框架

Zouying Cao, Jiaji Deng, Li Yu, Weikang Zhou, Zhaoyang Liu, Bolin Ding, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReMe框架,通过多维蒸馏、情境适应重用和基于效用的精炼机制,解决传统静态记忆存储的不足,实验证明其在BFCL-V3和AppWorld上达到新状态,展示了自进化记忆在终身学习中的高效性。

Comments 20 pages, 10 figures, 15 tables, ACL'26-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20352 2026-04-16 cs.AI 81%

AMA: Adaptive Memory via Multi-Agent Collaboration

AMA:通过多智能体协作实现自适应记忆

Weiquan Huang, Zixuan Wang, Hehai Lin, Sudong Wang, Bo Xu, Qian Li, Beier Zhu, Linyi Yang, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shandong University(山东大学) Nanyang Technological University(南洋理工大学) Southern University of Science and Technology(南方科技大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AMA框架,通过多智能体协作实现自适应记忆管理,解决传统方法在记忆粒度和一致性维护上的不足,实验表明其在长上下文任务中表现优异,减少约80%的token消耗。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06433 2026-04-16 cs.CL cs.AI cs.LG cs.MA 75%

Memp: Exploring Agent Procedural Memory

Memp:探索代理程序记忆

Runnan Fang, Yuan Liang, Xiaobin Wang, Jialong Wu, Shuofei Qiao, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) State Key Lab. for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Memp,一种可学习、可更新且终身的程序记忆系统,通过提炼历史轨迹生成细粒度指令和高层脚本抽象,提升代理在TravelPlanner和ALFWorld任务中的成功率和效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 44 篇

2604.13759 2026-04-16 cs.AI cs.LG 92%

The cognitive companion: a lightweight parallel monitoring architecture for detecting and recovering from reasoning degradation in LLM agents

认知伙伴:一种轻量级并行监控架构,用于检测和从LLM代理的推理退化中恢复

Rafflesia Khan, Nafiul Islam Khan

机构 * IBM Dublin(IBM都柏林) Citi Polytechnic Institute Khulna(基蒂理工学院库尔纳)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出认知伙伴,一种轻量级并行监控架构,用于检测和恢复LLM代理的推理退化。通过实验验证了其在不同任务类型中的有效性,并指出任务类型依赖性和潜在的规模限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13062 2026-04-16 cs.CL 92%

Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin

增强数学推理的LLM用于公式推导:光纤非线性干扰建模的案例研究

Yao Zhang, Yuchen Song, Xiao Luo, Shengnan Li, Xiaotian Jiang, Min Zhang, Danshi Wang

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种增强数学推理的生成AI方法,用于光学通信公式推导,聚焦光纤非线性干扰建模,通过结构化提示引导LLM推导出已知闭式ISRS GN表达式并推导出适用于多段C和C+L波段传输的新近似式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13156 2026-04-16 cs.CR cs.AI 90%

In-Context Autonomous Network Incident Response: An End-to-End Large Language Model Agent Approach

上下文自主网络事件响应:一种端到端的大语言模型代理方法

Yiran Gao, Kim Hammar, Tao Li

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Electronic Engineering, University of Melbourne(墨尔本大学电子与电气工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种端到端的大语言模型代理方法,通过整合感知、推理、规划和行动功能,实现网络事件响应的自主学习与适应,实验表明其恢复效率比前沿模型快23%。

Comments 2026 AAAI Summer Symposium on Human-Aware AI Agents for the Cyber Battlefield

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14044 2026-04-16 cs.CV 90%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01410 2026-04-16 cs.AI 89%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13271 2026-04-16 cs.LG 89%

Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling

通过双通道CoT-集成增强电信领域LLM的置信度估计

Anton Saenko, Pranshav Gajjar, Abiodun Ganiyu, Vijay K. Shah

机构 * NextG Wireless Lab(NextG无线实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出双通道CoT-集成方法,通过多独立推理评估提升电信领域LLM的置信度估计,降低ECE误差达88%,提高模型自我评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13371 2026-04-16 cs.CL 88%

Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints

大语言模型在有限离散状态空间问题中复杂性诱导限制的实证证据

Md. Fahad Ullah Utsho, Mohd. Ruhul Ameen, Akif Islam, Md. Golam Rashed, Dipankar Das

机构 * Department of Information and Communication Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学信息与通信工程系,孟加拉国) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院,美国,亨廷顿,西弗吉尼亚) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系,孟加拉国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过构建九个经典推理任务,系统评估大推理模型在逐渐增加的复杂性下的鲁棒性,发现模型在低复杂度时表现良好,但超过特定阈值后显著退化,提出推理崩溃现象。

Comments 45 pages, 36 figures, 7 tables, Journal Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏