arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 348 篇

2608.09779 2026-08-11 cs.CL cs.AI 新提交 62%

KGCaRe: Explainable Complex Conditional Question Answering using Automatic Knowledge Graph Construction and Context Retrieval with LLMs

KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法

Ghanshyam Verma, Simanta Sarkar, Devishree Pillai, Hotaka Shiokawa, Yourong Xu, Fiona Veazey, Peter Hubbert, Hui Su, Paul Buitelaar

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09542 2026-08-11 cs.LG cs.AI cs.CR 新提交 62%

Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解

Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Stony Brook University(石溪大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07952 2026-08-11 cs.LG cs.AI cs.CR cs.SE 新提交 62%

Persistent Semantic Entities in Tool-Augmented LLM Systems

工具增强型大语言模型系统中的持久语义实体

Zhaohui Wang

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8&noteId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06713 2026-08-10 cs.AI cs.LG 新提交 62%

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中

Yiming Zhang, Hikaru Shindo, Shuan Chen, Kaushalya Madhawa, Jun Jin Choong, Yuna Oikawa, Takashi Fujiwara, Keisuke Ozawa

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06366 2026-08-07 cs.AI cs.LG 新提交 62%

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

追踪核心:一种用于心力衰竭特征工程的证据关联管道

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

机构 * Nimblemind(宁敏德(音译)) Singapore University of Technology and Design(新加坡科技设计大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校) Rutgers University Newark(罗格斯大学纽瓦克分校) Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) Rutgers Health(罗格斯医疗)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03569 2026-08-05 cs.AI cs.CY cs.LG cs.MA 新提交 62%

Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities

对抗性快速变化的真实世界领域:用于基准测试AI科学家能力的测试床

William Bolton, Philip Torr

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出以F1、MTG等对抗性快速变化的真实世界领域为测试床,发现AI科学家的核心能力差距是想法过滤、优先级排序而非生成。

Comments Accepted at the AI for Science workshop at ICML 2026. 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28638 2026-08-03 cs.CL cs.LG 新提交 62%

Learning Stateful Predictive Knowledge From Experience

从经验中学习有状态的预测知识

Yan Song, Xidong Feng, Bo Liu, Xinyu Cui, Haotian Fu, Zichen Liu, Mengyue Yang, Cheng Deng, Jian Zhao, Jun Wang

机构 * University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Brown University(布朗大学) University of Bristol(布里斯托尔大学) University of Edinburgh(爱丁堡大学) Zhongguancun Academy(中关村科学院) The Yangtze River Delta(长三角)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM智能体现有轨迹级反思学习的缺陷,提出SKL方法,通过两种算法训练智能体学习有状态预测知识,在多任务上性能优于现有范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27790 2026-07-31 cs.CL cs.AI 新提交 62%

Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis

面向多模态情感分析的语义对齐结构抽象

Wei Chen, Junkai Li, Tongguan Wang, Hui Liu, Feiyue Xue, Chuanxiang Ma, Ying Sha

机构 * Huazhong Agricultural University(华中农业大学) Hubei University(湖北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有多模态情感分析方法无法建模情感语义的局限,提出SentiLLM框架,通过双流显著性-上下文校准机制实现语义对齐结构抽象,在四个数据集上取得优异性能。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25090 2026-07-29 cs.AI cs.LG 新提交 62%

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering

套娃智能体:展开子智能体以进行长期机器学习工程

Rushi Qiang, Changhao Li, Haotian Sun, Yuchen Zhuang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对机器学习工程长期决策难题,提出套娃智能体框架,将问题解决分解为协调层次结构,高级协调器发指令,低级子智能体执行,开发有效训练范式,实验证明该方法有效且可扩展,能提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22610 2026-07-28 cs.AI cs.CL 新提交 62%

Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

Tokengeist:智能对话中的多轮归因追踪

Jessica Tang, Shraddha Barke, Sharad Agarwal

机构 * University of Toronto(多伦多大学) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮对话中语言模型响应的归因问题,提出多轮上下文归因及 Tokengeist 框架,通过有向无环图递归遍历恢复依赖路径,发布基准 MTCABench,实验表明 Tokengeist 能有效解决现有方法多跳依赖恢复不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18754 2026-07-22 cs.AI cs.CL 新提交 62%

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包

Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li, Weijia Zhang, Muxin Tian, Xiangru Tang, Pan Lu, James Zou, Jiaxuan You, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Google(谷歌公司) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18316 2026-07-22 cs.SE cs.AI cs.CL 新提交 62%

Binding Drift in Multi-Step Tool-Augmented Agents

多步工具增强智能体中的绑定漂移

Rahul Suresh Babu, Shashank Indukuri

专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究多步工具增强智能体中实体绑定随时间的变化,区分绑定漂移与错误传播。通过实验发现实体锁定会放大错误操作,实用的重新验证器可减少错误,自然设置下基线智能体有漂移现象,且持久性和重新验证不可互换。

Comments 14 pages, 5 tables, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/binding-drift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 62%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16133 2026-07-20 cs.LG cs.AI 新提交 62%

When Do Multi-Agent Systems Help? An Information Bottleneck Perspective

多智能体系统何时发挥作用?信息瓶颈视角

Wendi Yu, Lianhao Zhou, Xiangjue Dong, Sai Sudarshan Barath, Declan Staunton, Byung-Jun Yoon, Xiaoning Qian, James Caverlee, Shuiwang Ji

机构 * Texas A&M University(德克萨斯A&M大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究从信息瓶颈视角探讨多智能体系统(MAS)与单智能体系统(SAS)差异,指出MAS优势在有限中继时因压缩权衡产生,由参数β控制,通过实验验证,解释了有限智能体间通信何时有利有害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11683 2026-07-14 cs.CL cs.AI 新提交 62%

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

RAGU:一个具有紧凑域适应语言模型的多步图检索增强生成引擎

Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin

机构 * ITMO University(圣彼得堡国立信息技术机械与光学大学) Novosibirsk State University(新西伯利亚国立大学) Far Eastern Federal University(远东联邦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有GraphRAG系统问题,提出RAGU引擎,通过分离提取与合并多步处理知识图。核心方法包括两阶段提取等。贡献在于训练的Meno-Lite-0.1模型表现出色,在多方面超越其他模型,且RAGU安装简单、运行要求低并开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08331 2026-07-10 cs.LG cs.AI 新提交 62%

ArtMine: Discovering and Formalizing Artistic Processes

ArtMine:发现并形式化艺术创作过程

Kaustubh Kumar, Ashutosh Ranjan, Vivek Srivastava, Blessin Varkey, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从异构历史证据发现并形式化艺术创作过程,核心方法是将证据合成存储库,由溯因智能体推断生产步骤并优化,主要贡献是迈向以过程为中心的人机协同创作系统,支持多方面研究。

Comments 47 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07989 2026-07-10 cs.CR cs.AI cs.IR cs.LG cs.MA 新提交 62%

Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems

谁破坏了系统?基于大语言模型的多智能体系统中的故障定位

Yufei Xia, Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(得克萨斯大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的多智能体系统故障定位问题,提出AgentLocate框架,结合基于LLM的判断与多视角验证,通过置信感知策略聚合评估结果并微调判断,实验表明该框架在识别责任智能体和故障步骤上优于现有方法且高效。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07858 2026-07-10 cs.AI cs.LG 新提交 62%

Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting

直通式承保中的智能体人工智能与检索增强模型

Robert Richardson, Josh Meyers, Brian Hartman, David Sandberg

机构 * Brigham Young University

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能在精算实践中的应用,开发用于小型商业企业主保单直通式承保的智能体人工智能框架,通过构建实验环境比较三条承保管道,发现智能体系统总体表现最佳,在特定场景中优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07321 2026-07-09 cs.AI cs.CL cs.MA 新提交 62%

From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents

从原子动作到标准操作程序:自进化语言模型智能体的迭代工具优化

Haipeng Ding, Yuexiang Xie, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM智能体框架问题,提出将原子动作合成SOP实现自进化,介绍EvoSOP框架,经实验验证该框架能显著提升任务成功率、减少交互轮数,为自进化智能体开发提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06544 2026-07-08 cs.AI cs.CL 新提交 62%

Rethinking Indic AI from a Lens of Cultural Heritage Preservation

从文化遗产保护视角重新思考印度人工智能

Aparna Madva, Sharath Srivatsa, Srinath Srinivasa, Tulika Saha

机构 * International Institute of Information Technology, Bengaluru(班加罗尔国际信息技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从文化遗产保护角度探讨人工智能对印度语言文化的影响,通过纵向调查自然语言处理技术演变、分析印度语言特征及基础模型作用,提出‘文化感知’方向,为印度自然语言处理下一阶段研究及基础模型发展提供指引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03093 2026-07-07 cs.CL cs.AI 新提交 62%

Don't Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking

不要等待回复:通过主动思考实现响应迅速且深思熟虑的对话

Ante Wang, Jiaqi Fu, Xuanyi Chen, Ruotian Ma, Zhaopeng Tu, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型被动思考导致对话延迟问题,提出主动思考框架,介绍无训练基线,通过模拟实时对话流基准测试,证明该方法提升交互效率且不损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02396 2026-07-03 cs.AI cs.LG 新提交 62%

Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

通过RFM-AGOP的快速多维拒绝子空间

Thomas Winninger

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出利用RFM-AGOP算法快速提取大型语言模型中的多维拒绝子空间,在推理和非推理模型上均实现秒级识别,且性能优于现有方法。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01480 2026-07-03 cs.AI cs.LG 新提交 62%

Procedural Memory Distillation: Online Reflection for Self-Improving Language Models

程序记忆蒸馏:用于自我改进语言模型的在线反思

Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz

专题命中 复杂问题求解 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出程序记忆蒸馏(PMD),通过在线提取跨回合信号(轨迹、反思策略、行为模式)并蒸馏到策略权重中,使语言模型在推理时无需额外记忆,相比SDPO在SCIKNOWEVAL和LIVECODEBENCH上分别提升3.8-5.5%和7.9-13.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 62%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27617 2026-06-29 cs.CL cs.LG 新提交 62%

Masked Language Flow Models

掩码语言流模型

Iskander Azangulov, Kianoosh Ashouritaklimi, Leo Zhang, Simon Vary, Patrick Rebeschini

机构 * CC BY 4.0(知识共享署名4.0国际许可)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出掩码语言流模型(MLFM),通过连续随机插值将掩码机制融入流语言模型,实现并行生成与多步推理的平衡,首次将流模型扩展到推理和指令跟随任务。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09774 2026-06-29 cs.AI cs.CL 新提交 62%

Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

SIGA: 用于科学模拟的自演化编码智能体适配器

Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27233 2026-06-26 cs.CL cs.AI 新提交 62%

Bridging Talk and Thought: Understanding Dialogue Dynamics Across Collaborative Problem-Solving Contexts

桥接对话与思维:理解协作问题解决情境中的对话动态

Zhengyuan Liu, Stella Xin Yin, Min-Yen Kan, Nancy F. Chen

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出一个双层编码框架,整合认知与非认知问题解决及元认知调节机制,分析人机与多智能体协作对话,发现元认知调节是深度协作的关键区分因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26103 2026-06-26 cs.CL cs.AI 新提交 62%

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

探究大语言模型的问题解决能力——基于静力学问题的研究

Tanner Culleton, Hung-Fu Chang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过模型蒸馏方法评估LLM在静力学问题上的表现,发现引入图表和多步推理时准确率下降,主要源于多步推理和视觉信息应用困难。

Comments 9 pages, Engineering and Technology Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19168 2026-06-18 cs.AI cs.LG 新提交 62%

Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

超越安全数据:具有正则安全反射的预训练阶段对齐

Jinhan Li, Kexian Tang, Yihan Xu, Zhuorui Ye, Kaifeng Lyu

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15288 2026-06-16 cs.LG cs.AI physics.ao-ph 新提交 62%

Hybrid NARX-LLM for Greenland Iceberg Discharge: Prompt-Driven Residual Correction

混合NARX-LLM用于格陵兰冰山排放:提示驱动的残差校正

Yiquan Gao, Duohui Xu

机构 * Heriot-Watt University(赫瑞瓦特大学) StudioYG

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出混合NARX-LLM框架,结合非线性自回归模型与大型语言模型进行残差校正,并引入物理信息提示方法,用于建模格陵兰冰山排放的复杂非线性动态,提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏