arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 348 篇

2607.16388 2026-07-21 cs.MA cs.AI cs.SE 新提交 57%

Automated Hardware Validation Test Plan Generation for Large Scale AI Datacenter Platforms Using a Generative AI Multi-Agents Architecture

使用生成式人工智能多智能体架构为大规模人工智能数据中心平台生成自动化硬件验证测试计划

Mohammed-Khalil Ghali, Saurabh Kulkarni, Prathamesh Kulkarni, Rohan Kulkarni, Sangwon Yoon, Daehan Won

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学布林茅尔分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对大规模人工智能数据中心平台硬件验证测试计划手动编写的问题,提出基于生成式人工智能多智能体架构,依据自愈验证文档和物料清单自动生成测试计划,提高了覆盖范围、编写效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14641 2026-07-17 cs.AI 新提交 57%

Analytic Abduction: Causal Decomposition and Governed Commitment for Human--AI Coordination

分析性溯因:用于人机协作的因果分解与受控承诺

Remo Pareschi

机构 * Stake Lab, University of Molise(莫利塞大学斯塔克实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究分析性溯因推理,核心方法是κ - τ 机制及因果簇,贡献在于将未确定分解作为共享协调对象,用于人机协作,为决策者提供竞争解释场景及证据,助力合理行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 57%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14416 2026-07-17 cs.AI 新提交 57%

CausalGraphX: A Counterfactual Graph Neural Network Framework for Explainable Systemic Risk Assessment

因果图X:用于可解释系统性风险评估的反事实图神经网络框架

Rabimba Karanjai, Hemanth Madhavarao, Lei Xu, Weidong Shi

机构 * University of Houston(休斯顿大学) Kent State University(肯特州立大学) PayPal Inc.(贝宝公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对传统风险模型无法捕捉金融网络复杂动态及图神经网络缺乏因果解释的问题,提出因果图X框架,结合图神经网络与反事实推理,能有效评估系统性风险并提供可解释的反事实解释,优于传统和深度学习基线。

Comments Accepted in AAAI'26 Workshop, Agentic AI in Financial Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 57%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14303 2026-07-17 physics.ed-ph cs.AI 新提交 57%

Assessing AI in Introductory Physics Problem Solving

评估人工智能在基础物理问题解决中的能力

Amir Bralin, N. Sanjay Rebello

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究评估OpenAI的o4-mini模型解决基础物理问题的能力,通过解决《费曼物理学讲义》章节末尾问题展开,发现模型总体准确率约90%,性能受问题模态和难度影响,表明先进大语言模型虽能解决不少基础物理问题,但表现不均衡。

Comments Working paper, submitted as a placeholder

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 57%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12634 2026-07-15 cs.AI 新提交 57%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11890 2026-07-15 cs.CY cs.AI 新提交 57%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交 57%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08255 2026-07-10 cs.AI 新提交 57%

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

竞争然后合作:前沿人工智能教师构建可验证课程以提升编码学生超越模仿

Miseong Shawn Kim

机构 * Genesis Cortex AI Inc.(创世纪皮层人工智能公司)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 研究探讨大型语言模型作教师时的教学问题,提出竞争然后合作框架,让四个前沿人工智能教师先对决排名,再合作构建课程提升学生。发现执行验证下教师解决标准问题情况,模仿不一定提升学生,合作课程能提升学生,强调合作构建可验证环境的价值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 57%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06807 2026-07-09 cs.CR cs.AI 新提交 57%

When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems

当智能体行为异常时:基于激活的多智能体系统恶意行为检测

Haowen Xu, Xue Tan, Lei Ma, Zhihao Zhang, Chao Wang, Qingze Wang, Ping Chen, Jun Dai, Xiaoyan Sun

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多智能体系统面临的安全挑战,提出基于激活的框架AcMAS,通过分析智能体激活空间中的推理状态检测隐蔽攻击,不依赖交互图,还能恢复受损智能体功能,在检测隐蔽攻击上显著优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 57%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 57%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05185 2026-07-07 cs.AI cs.SC 新提交 57%

ClassicLogic: A Knowledge-Driven Benchmark of Classic Puzzle Games for Evaluating Compositional Generalization

ClassicLogic:用于评估组合泛化能力的经典益智游戏知识驱动基准集

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有组合泛化基准缺乏复杂显式结构的问题,构建含4类经典逻辑谜题的新基准,可细粒度评估智能体从基础规则学习到多步组合推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02376 2026-07-03 cs.AI cs.MA 新提交 57%

Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems

面向安全关键实时自主系统的硬件强制语义协调

Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

机构 * Department of Computer Science University of the Bundeswehr Munich Neubiberg, Germany Department of Computer Science Sapienza University of Rome Rome, Italy STAKE Lab University of Molise Campobasso, Italy

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对异构组件并发运行下的协调问题,提出基于FPGA的硬件强制语义协调架构,将TB-CSPN协调机制映射到硬件原语,实现确定性协调和安全保障。

Comments 1 figure, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02118 2026-07-03 cs.AI 新提交 57%

Enhancing Fitness Intelligence through Domain-Specific LLM Post-Training

通过领域特定的大语言模型后训练增强健身智能

Xingtao Zhao, Tian Yang, Han Jiang

机构 * School of Cyber Science and Technology(网络科学与技术学院) Beihang University(北京航空航天大学) School of Information(信息学院) Renmin University of China(中国人民大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对通用大语言模型在科学健身教练中领域知识不足的问题,提出FitOne系列模型,通过三阶段后训练(持续预训练、监督微调、强化学习)提升专业能力,在ACSM-EP和NSCA-CSCS考试中平均提升最高12.73%。

Comments 8 pages, 6 tables, 2 figures. Accepted by the 12th International Conference on Big Data Computing and Communications (BigCom 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01661 2026-07-03 cs.AI 新提交 57%

Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry

多样证据,更好预测:信息不对称下的多智能体商议

Yuante Li, Yicheng Tao, Kate Zhang, Taozhi Wang, Gefei Gu, Yaxin Zhou

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) College of Engineering, Carnegie Mellon University(卡内基梅隆大学工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多智能体系统中信息同质化导致商议效果不佳的问题,提出通过设计信息不对称(共享公开证据与私有证据)降低智能体间误差相关性,并构建InfoDelphi框架,在预测任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01152 2026-07-03 cs.CL 新提交 57%

AGC-Bench: Measuring Artificial General Creativity

AGC-Bench:衡量人工通用创造力

Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) Dartmouth College(达特茅斯学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出AGC-Bench基准,通过系统文献综述和标准化框架评估LLM创造力,发现单一创造力因子'c',并验证提示'要有创造力'比推理更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01131 2026-07-02 cs.CV cs.AI 新提交 57%

Autonomous Scientific Discovery via Iterative Meta-Reflection

通过迭代元反射实现自主科学发现

Bingchen Zhao, Sara Beery, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出DiscoPER框架,利用大语言模型进行开放式的自主科学发现,通过动态代码生成、统计检验和二阶推理机制,在iNatDisco基准上以72.7%假设支持率恢复8/9已知模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00908 2026-07-02 cs.LG 新提交 57%

Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

超越激活对齐:任务感知的大语言模型量化中的对齐-多样性权衡

Fei Wang, Chao Xue, Taoran Liu, Li Shen, Ye Liu, ChangXing Ding

机构 * South China University of Technology(华南理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Ocean University of China(中国海洋大学) Center for AI Theoretical Foundation and Systems, Shenzhen Loop Area Institute(深圳环区研究所人工智能理论基础与系统中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文揭示混合精度量化中的困惑度幻觉和对齐-多样性权衡,提出TASA框架联合优化校准数据组成和比特分配,在3.5比特平均精度下匹配或超越4比特基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 57%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30840 2026-07-01 cs.AI 新提交 57%

Contrastive Reflection for Iterative Prompt Optimization

对比反思:迭代提示优化

Derek Koh, Jinghui Mo, Benjamin H. Le, Jiening Zhan, Baofen Zheng, Kevin Bevis, Nathaniel C. Owen, Lauren Elizabeth Charney, Wenqiong Liu, Jingwei Wu

机构 * LinkedIn(领英)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出对比反思框架,通过对比失败与成功行为,迭代优化检索增强生成代理的提示,在HotpotQA上准确率从51.4%提升至60.4%。

Comments 6 pages, 1 figure. To appear at Agent4IR @ KDD 2026 (KDD 2026 Workshop on AI Agents for Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30682 2026-07-01 cs.SD cs.AI eess.AS 新提交 57%

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入

Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25034 2026-06-29 cs.CV cs.AI 新提交 57%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26488 2026-06-26 cs.LG 新提交 57%

What Survives When You Compress a Recursive Reasoner for the Edge?

当压缩边缘端递归推理器时,什么得以幸存?

Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye, Glory Bagai, Virginia Smith

机构 * ML Collective Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 研究递归推理模型在边缘设备压缩中的表现,发现激进压缩破坏全局推理但保留局部预测,提出每通道校准INT4和轨迹保真度指标实现无损部署。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24626 2026-06-24 cs.AI 新提交 57%

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

SAFARI: 通过主动调查扩展长时域智能体故障归因

Chenyang Zhu, Jiayu Yao, Kushal Chawla, Youbing Yin, Nathan Wolfe, Pengshan Cai, Jingyu Wu, Spencer Hong, Sangwoo Cho, Shi-Xiong Zhang, Daben Liu, Sambit Sahu, Erin Babinsky

机构 * Department of Engineering Sciences(工程科学系) Applied Mathematics, Northwestern University(应用数学,西北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23759 2026-06-24 cs.AR cs.AI cs.SE 新提交 57%

VeriPilot: An LLM-Powered Verilog Debugging Framework

VeriPilot:一个基于LLM的Verilog调试框架

Yihan Wang, Cheng Liu, Jiazheng Zhang, Lei Zhang, Long Cheng, Xiaowei Li, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所国家专用集成电路设计实验室) University of Chinese Academy of Sciences(中国科学院大学) North China Electric Power University(华北电力大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VeriPilot框架,利用黄金参考模型和LLM实现细粒度Verilog调试,通过内部变量语义对齐和CDFG信号追踪定位并修复错误,在CVDP基准上将GPT-4o修复成功率从54.3%提升至85.71%。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23107 2026-06-23 cs.CL 新提交 57%

A Dual-Track Framework for Template-Constrained LaTeX Conversion

双轨框架:模板约束下的LaTeX转换

Chung Cheuk Hei, Liu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出双轨框架,通过离线提取模板约束与在线混合执行,将LLM用于推理密集型任务、规则引擎处理确定性任务,在7个模板和56篇论文上实现更高结构保真度和编译成功率。

Comments 6 pages (excluding references), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏