arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-20 至 2026-07-20 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2510.00182 2026-07-20 cs.RO cs.AI 版本更新 92%

A Systematic Study of Large Language Models for Task and Motion Planning With PDDLStream

基于PDDLStream的任务与运动规划大语言模型的系统研究

Jorge Mendez-Mendez

机构 * Stony Brook University(石溪大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大语言模型在机器人任务与运动规划中的应用,开发16种用LLMs替代关键TAMP组件的算法,通过实验发现基于LLM的规划器成功率低、规划时间长,提供几何细节会增加任务规划错误,多数情况下直接LLM变体表现更好。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20039 2026-07-20 cs.AI cs.LG 88%

Separable Pathways for Causal Reasoning: How Architectural Scaffolding Enables Hypothesis-Space Restructuring in LLM Agents

因果推理的可分离路径:建筑框架如何使LLM代理重构假设空间

John Alderete, Sebastian Benthall, Connie Xu, John Xing

机构 * Simon Fraser University(西蒙弗雷泽大学) International Computer Science Institute(国际计算机科学研究所) Amigo AI

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出通过建筑框架使LLM代理重构假设空间,通过实验发现上下文图和动态行为在因果推理中分别提升推理质量和有效性。

Comments 24 pages, 11 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15957 2026-07-20 cs.CL 新提交 87%

From Plausible to Actionable: A Position on LLM Self-Explanations

从似是而非到可付诸行动:关于大语言模型自我解释的立场

Elize Herrewijnen, Benedetta Muscato, Gizem Gezici, Fosca Giannotti

机构 * Utrecht University(乌得勒支大学) Scuola Normale Superiore(高等师范学校) University of Pisa(比萨大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 探讨大语言模型自我解释,指出其虽看似合理但忠实性存疑。从传统可解释人工智能角度识别评估局限,提出评估合理性与忠实性的指南,并强调评估应拓展到可操作性及相关应用,以支持不同利益相关者的明智决策和适当行动。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03651 2026-07-20 cs.LG math.OC 版本更新 87%

LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs

基于文本业务输入的大语言模型引导的交通枢纽容量规划

Xiaoyue Liu, Zheng Dong

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究提出用大语言模型代理依自然语言业务描述迭代提出枢纽容量决策的框架,核心机制是思维链推理协议,经反馈回路验证决策,在实际货运网络中表现优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19464 2026-07-20 cs.RO 版本更新 86%

Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification

大语言模型能否证明机器人路径规划的最优性?一种用于研究级算法验证的基准测试

Zhengbang Yang, Md. Tasin Tazwar, Minghan Wei, Zhuangdi Zhu

机构 * George Mason University(乔治梅森大学) Florida Atlantic University(佛罗里达大西洋大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出首个评估大语言模型在机器人路径规划算法近似比证明能力的基准测试,包含34个研究级证明任务,揭示了LLM在缺乏领域知识时的局限性,并通过上下文补充分析改进推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15778 2026-07-20 cs.CV cs.AI 新提交 85%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12483 2026-07-20 cs.SE 版本更新 85%

MoT: Modularization-of-Thought Prompting for Effective Code Generation

MoT:用于有效代码生成的思维模块化提示

Ruwei Pan, Hongyu Zhang

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15660 2026-07-20 cs.AI 新提交 81%

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

ToolVerse:为智能强化学习解锁大规模环境和长时任务

Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) Peking University(北京大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15280 2026-07-20 cs.AI 新提交 81%

GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis

GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架

Shaoting Tan, Ning Liu, Yuntao Du, Shuyue Wei, Wu Shuai, Qian Li, Yanyu Xu, Wei Zhang, Lizhen Cui, Haitao Yuan

机构 * Shandong University(山东大学) Nankai University(南开大学) East China Normal University(华东师范大学) National Technological University(国立科技大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16107 2026-07-20 eess.AS cs.CV 新提交 80%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15367 2026-07-20 cs.AI 新提交 79%

AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery

AnovaX:一个具有大语言模型规划、类型化执行器和自适应恢复功能的本地多智能体语音助手

Raunak B Sinha

机构 * BITS Pilani(贝拉理工学院皮拉尼分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究桌面语音助手局限,提出AnovaX本地多智能体语音助手,通过Python进程连接多组件,含规划器、安全层等,各工具对应专用智能体类,有递归元智能体及自适应恢复循环,还介绍配套服务器功能,展示其独特优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12711 2026-07-20 cs.AI cs.LO 版本更新 79%

MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

基于最大可满足性的反馈在数独中引导视觉语言模型

Pedro Orvalho, Guillem Alenyà, Felip Manyà

机构 * Artificial Intelligence Research Institute (IIIA), Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA),西班牙科学研究高级理事会(CSIC)) Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(工业机器人与信息学研究所(IRI-CSIC-UPC))

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究在数独中引导视觉语言模型的问题,提出通过MaxSAT预言机将形式约束推理集成到VLM求解过程的神经符号方法,经实验验证该方法能提高逻辑一致性和解决实例数量,增强视觉语言推理可靠性。

Comments Accepted at the 25th EPIA Conference on Artificial Intelligence, EPIA 2026. 16 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10383 2026-07-20 cs.CV cs.AI cs.RO 版本更新 79%

ABot-N1: Toward a General Visual Language Navigation Foundation Model

ABot-N1:迈向通用视觉语言导航基础模型

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Yang Cai, Jingjing Ma, Shihui Su, Zixiao Tang, Linbo Zheng, Zedong Chu, Xiaolong Wu, Wenbin Tang, Mu Xu

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15736 2026-07-20 cs.CL 新提交 77%

Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning

更好的开始,更好的结束:用于压缩推理的自引导迭代自推理蒸馏

Leichao Dong, Dongxu Zhang, Yiding Sun, Qirui Wang, Yuhan Wang, Lin Chen, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究大型推理模型冗余计算问题,提出BIRD两阶段自推理蒸馏方法,先在简洁指令下采样简洁解并学习,再用简洁自教师进行策略内蒸馏,在Qwen3系列模型上提升精度并降低响应长度,凸显前缀支持对高效推理蒸馏的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15281 2026-07-20 cs.AI 新提交 77%

Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction

因果审计:通过目标感知因果链构建进行显式且可审计的基于图的推理

Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对无上下文干预问答,提出因果审计框架,通过目标感知因果图构建和路径级因果证据聚合机制,将因果推理结构化,实验证明该框架优于现有方法,能提供可解释且可审计的推理痕迹。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16165 2026-07-20 cs.CV cs.AI cs.CL cs.LG 新提交 75%

An Exam for Active Observers

主动观察者的测试

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多模态大语言模型是否具备主动观察能力,引入ActiveVision基准测试,发现前沿模型表现不佳,即便能编写视觉代码差距仍存,表明当前模型缺乏主动视觉观察,呼吁构建闭合感知 - 推理循环的架构和训练目标。

Comments 17 pages, 8 figures, 4 tables. Project page: https://activevision.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12630 2026-07-20 cs.RO cs.CV 版本更新 75%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22402 2026-07-20 cs.CL cs.FL cs.LG 版本更新 73%

Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization

双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化

Kanishk Awadhiya

机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。

Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 70%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 70%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06006 2026-07-20 cs.CL 版本更新 70%

From Articles to Premises: Building PrimeFacts, an Extraction Methodology and Resource for Fact-Checking Evidence

从文章到前提:构建PrimeFacts,一种提取事实核查证据的方法和资源

Premtim Sahitaj, Jawan Kolanowski, Ariana Sahitaj, Veronika Solopova, Max Upravitelev, Daniel Röder, Iffat Maab, Junichi Yamagishi, Sebastian Möller, Vera Schmitt

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PrimeFacts方法,通过提取事实核查文章中的细粒度证据,提升自动化验证系统的性能,其在证据检索和声明验证中表现出显著优势。

Comments Accepted at LREC 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22204 2026-07-20 cs.RO cs.AI 版本更新 70%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16181 2026-07-20 cs.CV 新提交 67%

Vision-Language Assistant for Emotional Reactions to Risky Driving

用于对危险驾驶产生情感反应的视觉语言助手

Harine Choi, Eun Hak Lee, Zhengzhong Tu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究针对现有自动驾驶视觉语言模型忽视情感维度与用户体验的问题,提出KYA系统。它由视觉模块(用YOLOv8变体检测危险行为并提取指标生成日志)和语言模块(依情感基调设置生成回应)组成,经实验评估表现良好,为车载人工智能带来新范式。

Comments Transportation Research Record. Advance online publication (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15674 2026-07-20 cs.RO 新提交 67%

A Generative Partially Specified Finite State Machine Approach to Complex Behaviour Planning

一种用于复杂行为规划的生成式部分指定有限状态机方法

Kalana Ratnayake, Michael Pritchard, David Hinwood, Maleen Jayasuriya, Damith Herath

机构 * University of Canberra(堪培拉大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究为自主机器人在动态环境中的行为规划,提出生成式部分指定有限状态机(GPSFSM)神经符号架构,利用Fabric等组件实现标准化语义能力描述,实验表明该方法计划生成成功率高、延迟低,还能生成复杂行为,且开源堆栈使其实用可重复。

Comments Accepted for publication in the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 9 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15283 2026-07-20 cs.IR 新提交 67%

Adaptive Retrieval Strategies for Biomedical Question Answering

生物医学问答的自适应检索策略

Han Yue, Eric Zhou, Alex Hu, Xueshen Li, Yuan Zhang, Jinfeng Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究生物医学问答中不同问题类型的有效检索策略,提出自适应检索框架,依问题类型选检索和证据聚合策略,结合多种技术,经实验验证该策略能提升证据相关性和答案质量,为增强相关问答系统提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新 67%

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15286 2026-07-20 cs.CR cs.CL cs.LG 新提交 62%

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

隐藏在思维中:可转移的思维链工件引发有害行为

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15178 2026-07-20 cs.CL cs.AI 版本更新 62%

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

T^2MLR:具有时间中层循环的Transformer

Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26772 2026-07-20 cs.AI cs.LG 交叉投稿 62%

Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal

超越单一方向:思维链破坏简单的拒绝引导

Kia-Jüng Yang, Dominik Meier, Jiachen Zhao, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(哥廷根大学,德国) Northeastern University, Boston, MA, USA(东北大学,波士顿,马萨诸塞州,美国)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究大型推理模型(LRM)中拒绝行为的机制,发现思维链(CoT)与激活共同编码拒绝信号,使得仅通过激活引导难以逆转拒绝,但通过两阶段干预(激活引导下重新生成CoT)可显著提高逆转率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15647 2026-07-20 cs.AI 新提交 57%

Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害

Aritro De, Juliana Felkner

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏