arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 946 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 946 篇

2508.21380 2026-06-11 cs.LG cs.AI 版本更新 62%

The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network

算法并非行为:学得的先验知识在弈棋神经网络中覆盖前瞻

Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer HHI(弗劳恩霍夫人工智能研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,国际象棋神经网络Leela Chess Zero在中间层能正确计算解法,但最终输出被安全优先的先验知识覆盖,导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11995 2026-06-10 cs.CV cs.AI cs.LG 版本更新 62%

V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions

V-REX: 通过问题链进行探索性视觉推理的基准测试

Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院市分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12666 2026-06-09 cs.LG cs.AI 版本更新 62%

RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction

RetroReasoner:一种用于战略 retrosynthesis 预测的推理 LLM

Hanbum Ko, Chanhui Lee, Ye Rin Kim, Rodrigo Hormazabal, Sehui Han, Sungbin Lim, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Statistics, Korea University(韩国大学统计系) Materials Intelligence Lab, LG AI Research(LG人工智能研究实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RetroReasoner 通过监督微调和强化学习,捕捉化学家基于断键策略的推理过程,提升 retrosynthesis 预测的准确性和多样性。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06077 2026-06-09 cs.IT cs.AI cs.LG math.IT math.OC 版本更新 62%

One if by Land, Two if by Sea, Three if by Four Seas, and More to Come -- Values of Perception, Prediction, Communication, and Common Sense in Decision Making

一陆二海三四海,更多将至——感知、预测、通信与常识在决策中的价值

Aolin Xu

机构 * Aolin Xu(徐傲林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文严格定义决策中感知、预测、通信和常识的价值,发现无预测的感知价值可能为负,而预测价值非负,并应用于自主决策系统设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04812 2026-06-08 cs.LG cs.AI 版本更新 62%

Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Safe Guarantees

面向风险感知强化学习的情景生成与近似安全保证

Mohit Prashant, Arvind Easwaran

机构 * Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习策略对转移扰动敏感导致不安全行为的问题,提出使用变分自编码器近似状态空间分布,通过构造上下界屏障证书并采样非鲁棒区域状态来收紧概率安全保证。

Comments 8 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09041 2026-06-08 cs.LG cs.AI 版本更新 62%

Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach

自动驾驶鲁棒控制:一种智能一般和约束对抗强化学习方法

Junchao Fan, Qi Wei, Ruichen Zhang, Yang Lu, Jianhua Wang, Xiaolin Chang, Bo Ai

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室) Beijing Jiaotong University(北京交通大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对深度强化学习在自动驾驶中易受对抗攻击的问题,提出智能一般和约束对抗强化学习(IGCARL),通过战略性目标对手和鲁棒驾驶代理的交互训练,在约束优化下提升策略稳定性,实验表明成功率比现有方法提高至少27.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09025 2026-08-18 cs.AI cs.CR stat.ML 版本更新 57%

Context Is Not Authority: Structured Runtime Governance for Financial Market Agents

上下文并非权威:面向金融市场智能体的结构化运行时治理

Rui Tang, Qiangqiang Liu, Yichi Zhang, Youwei Yang, Xi Chen, Chen Dong

机构 * OpenAsk Binance(币安) New York University(纽约大学) Xiamen University(厦门大学) Bank of Hebei(河北银行)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 针对金融智能体可能将正确上下文转化为未经授权影响的问题,提出SAGE-Fin金融领域权限交接合约,通过运行时控制影响保障合规,经测试和实际部署验证了其有效性。

Comments 15 pages, 1 figure, 9 tables. Qiangqiang Liu and Yichi Zhang are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新 57%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 57%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 规划决策 :AI agent(abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20753 2026-08-18 physics.chem-ph cs.AI 版本更新 57%

Empowering Polymeric Materials Discovery by Artificial Intelligence

人工智能赋能高分子材料发现

Chenyao Ma, Linda Zhang, Yuheng Chen, Wei Du, Shangwen Fang, Zihao Jiang, Chuanyu Liu, Xinyu Ma, Rui Su, Gang Wang, Muyao Yu, Dong Zhong, Jie Zhu, Weibo Gong, Huan Gu, Limin Li, Chen Shen, Rui Wu, Zhenghao Wu, Kan Xu, Min Zhou, Donglin He, Xiayun Huang, Shan Jiang, Pengfei Ou, Jiayu Peng, Yuwei Zhang, Jie Zhao, Di Zhang, Piao Ma, Zhenghao Li, Hao Li

机构 * Suzhou MatSource Technology Co., Ltd.(苏州MatSource科技有限公司) Gusu Laboratory of Materials(材料Gusu实验室) Advanced Institute for Materials Research (WPI-AIMR)(先进材料研究所(WPI-AIMR)) Frontier Research Institute for Interdisciplinary Sciences (FRIS)(交叉学科前沿研究所(FRIS)) State Key Laboratory of Advanced Environmental Technology, Department of Environmental Science and Engineering, University of Science and Technology of China(先进技术国家实验室,环境科学与工程系,中国科学技术大学) Jiangsu Key Laboratory of New Power Batteries, Jiangsu Collaborative Innovation Centre of Biomedical Functional Materials, School of Chemistry and Materials Science, Nanjing Normal University(新型动力电池江苏省重点实验室,生物医学功能材料协同创新中心,化学与材料科学学院,南京师范大学) Department of Chemistry, National University of Singapore(新加坡国立大学化学系) Thrust of Sustainable Energy and Environment, The Hong Kong University of Science and Technology (Guangzhou)(可持续能源与环境方向,香港科技大学(广州)) Department of Materials Design and Innovation, University at Buffalo(材料设计与创新系,布法罗大学) College of Smart Materials and Future Energy, State Key Laboratory of Molecular Engineering of Polymers, Fudan University(智能材料与未来能源学院,聚合物分子工程国家重点实验室,复旦大学) School of Physical Science and Technology, Shanghai tech University(物理科学与技术学院,上海科技大学) The State Key Laboratory of Molecular Engineering of Polymers and Department of Macromolecular Science, Fudan University(聚合物分子工程国家重点实验室和大分子科学系,复旦大学) Department of Chemistry and Materials Science, Xi'an J Liverpool University(化学与材料科学系,西安J Liverpool大学)

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本文综述了数据基础设施、机器学习、大模型和实验室自动化如何融合成自主发现生态系统,通过自改进反馈循环实现高分子材料的预测性、可重复和可扩展创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08780 2026-08-18 cs.RO cs.LG 版本更新 57%

Morphology-Conditioned World Model for Cross-Embodiment Quadrupedal Locomotion

迈向基于形态条件的四足世界模型

Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于形态条件的四足世界模型,通过整合物理形态编码器和奖励归一化器,实现跨形态的零样本泛化,解决传统隐式系统识别的适应滞后问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18518 2026-08-18 cs.LG stat.ME stat.ML 版本更新 57%

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

利用机器学习辅助抽样和大语言模型标注测量违规内容的普及率

Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

机构 * Pinterest

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于机器学习和大语言模型的系统,用于高效测量违反政策内容的普及率,通过概率抽样和多模态标注提升测量准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 57%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11535 2026-08-18 cs.LG cs.HC math.OC 版本更新 57%

Balancing Optimality and Diversity: Human-Centered Decision Making through Generative Curation

平衡最优性与多样性:通过生成式策展实现以人为中心的决策

Michael Lingzhi Li, Shixiang Zhu

机构 * Technology and Operations Management, Harvard Business School(哈佛商学院技术与运营管理系) Heinz College of Information Systems and Public Policy, Carnegie Mellon University(卡内基梅隆大学海因兹学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究提出生成式策展框架,通过分解组合合意度、开发适配多行动空间的方法,在决策支持场景下大幅降低遗憾值,适用于警区重划等复杂运营规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11195 2026-08-17 cs.AI cs.CC cs.HC math.FA 版本更新 57%

Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration

格罗滕迪克常数的长周期AI研究:人机数学协作的案例研究

Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过案例探究AI在数学研究中的有效应用,利用AI研究系统将格罗滕迪克常数的最优界收紧,同时分析了AI用于数学研究的优劣势及相关经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01035 2026-08-17 cs.RO cs.AI cs.CV 版本更新 57%

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

WAM-Diff2:面向高效自动驾驶视觉-语言-动作(VLA)的分层自回归到扩散蒸馏

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 WAM-Diff2通过三阶段分层蒸馏策略,将预训练自回归VLA模型转化为高效扩散模型,缓解暴露偏差、实现与基线相当性能,解码速度提升2.8倍,结合系统级优化后达15.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 57%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08491 2026-08-17 cs.RO cs.AI cs.SY eess.SY 版本更新 57%

Edge Case Detection in Automated Driving: Methods, Challenges, and Future Directions

自动驾驶中的边缘案例检测:方法、挑战与未来方向

Saeed Rahmani, Sabine Rieder, Erwin de Gelder, Marcel Sonntag, Jorge Lorente Mallada, Sytze Kalisvaart, Vahid Hashemi, Bart van Arem, Simeon C. Calvert

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对自动驾驶边缘案例检测缺乏全面综述的问题,对相关方法分层分类,引入知识驱动方法,评估检测技术指标,指出数据、验证等挑战,为自动驾驶测试提供框架与实际测试支持。

Comments This article has been accepted for inclusion in a future issue of this journal. Content is final as presented, with the exception of pagination. doi: https://doi.org/10.1109/TITS.2026.3715674

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11110 2026-08-14 cs.CL 版本更新 57%

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

行动胜于言语:测量使用工具的智能体的跨语言策略保留率

Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

机构 * Microsoft Research India(微软研究院印度分部)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 该研究测量使用工具的智能体的跨语言行动策略保留率,发现前沿模型在贪心解码下保留71%-73%策略,参数低于100亿时保留率崩溃,且存在影响测量的混淆因素。

Comments Accepted in COLM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20781 2026-08-13 cs.AI cs.CY econ.GN q-fin.EC 版本更新 57%

The Human-AI Substitution Principle: When will you be replaced by AI in your organization?

人类-人工智能替代原则:在你的组织中,你何时会被人工智能取代?

Bonny Banerjee, Shreya Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究人类员工何时被人工智能取代,提出HAT分析模型,编码人类技能与人工智能能力的经济不对称,推导多因素对人机替代的影响,得出替代原则,揭示其引发的组织变化及中层管理与高技能工人的脆弱性,统一相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21112 2026-08-13 cs.CV cs.AI cs.RO 版本更新 57%

LiDAR-based 3D Change Detection at City Scale

基于LiDAR的城市级三维变化检测

Hezam Albaqami, Haitian Wang, Xinyu Wang, Muhammad Ibrahim, Zainy M. Malakan, Abdullah M. Algamdi, Mohammed H. Alghamdi, Ajmal Mian

机构 * Department of Computer Science and Artificial Intelligence, University of Jeddah(计算机科学与人工智能系,朱德亚大学) Department of Computer Science and Software Engineering, University of Western Australia(计算机科学与软件工程系,西澳大学) Department of Data Science, Umm Al-Qura University(数据科学系,乌姆·阿勒·卡拉大学) Department of Information and Technology Systems, College of Computer Science and Engineering, University of Jeddah(信息与技术系统系,计算机科学与工程学院,朱德亚大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于LiDAR的城市级三维变化检测方法,通过多分辨率NDT和ICP对齐数据,结合语义分割和双分匹配优化,实现了高精度的变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00945 2026-08-12 cs.LG cs.CY 版本更新 57%

TS-Mob: Social and Geographical-Aware Time Series Foundation-Model Framework for Human Mobility Prediction

TS-Mob:面向人类移动性预测的社交与地理感知时间序列基础模型框架

Massimiliano Luca, Ciro Beneduce, Bruno Lepri

机构 * MobS Lab, Bruno Kessler Foundation(布鲁诺·凯瑟林基金会移动实验室) Department of Computer Science, University of Trento(特伦托大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 TS-Mob框架通过结合地理社交信号与天气协变量微调TimesFM模型,在多类移动性预测基准上显著优于各类基线,且在不同时间区间表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00868 2026-08-11 physics.app-ph cond-mat.mtrl-sci cs.LG cs.SY eess.SY 版本更新 57%

Autonomous Reliability Qualification of Ga$_2$O$_3$-based diode sensors via Safe Active Learning

基于Ga₂O₃二极管传感器的自主可靠性认证:通过安全主动学习

Davi Febba, William A. Callahan, Anna Sacchi, Andriy Zakutayev

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究提出安全主动学习(SAL)框架,用于Ga₂O₃二极管传感器的自主可靠性表征,经仿真与实验验证后,其生成的数据集可支撑高斯过程模型实现长时退化预测,且该框架适用于其他器件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23290 2026-08-11 cs.AI 版本更新 57%

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理

Xi Chen, Hongru Zhou, Shiyu Feng, Hanyu Zhou, Huahui Yi, Rongsheng Wang, Tiancheng He, Kun Wang, Pingping Liu, Qiankun Li, Sicheng Lin, Huiying Ou, Xiaohong Zheng, Tianying Zang, Zhuohang Wu, Leheng Jiang, Kexin Cao, Wenhan Zhang, ChengYi Li, Zhiyang Wang, Songlin Li, Benyou Wang, Ningbei Yin, Shaoting Zhang, Weili Fu, Jian Li, Kang Li

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。

Comments 100 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18262 2026-08-11 cs.AI 版本更新 57%

ProbSPARQL: Querying Knowledge Graphs with Multi-dimensional, Uncertain Numeric Data

ProbSPARQL:使用多维不确定数值数据查询知识图谱

Jingcheng Wu, Ratan Bahadur Thapa, Daniel Hernandez, Hongkuan Zhou, Steffen Staab

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Bosch Corporate Research(博世企业研究部) Web and Internet Science Research Group, University of Southampton(南安普顿大学网络与互联网科学研究组)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对循环工厂中含多维不确定数值数据的知识图谱查询问题,提出ProbSPARQL,它将不确定数值建模为随机变量,支持相关表达式、过滤器和连接。通过实现和评估,展示了其在引擎内执行的可行性及相关性能优势。

Comments 18 pages, 5 figures, 1 table. Accepted at ISWC 2026, camera-ready version. Supplementary material and reproducibility artifacts are available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00941 2026-08-11 cs.LG cs.CV 版本更新 57%

Uncertainty in a Single Pass: A Closed-Form Identity for One-Step Flow Matching

散度即不确定性:流匹配的闭式后验协方差

Jiarui Xing, Song Wang, Jian Wang

机构 * Yale University(耶鲁大学) Shanxi University(山西大学) Harvard Medical School(哈佛医学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文通过扩展Tweedie公式到流匹配插值,推导出生成轨迹上每一点后验协方差的精确闭式表达式,该表达式仅依赖于学习速度场的散度,可在预训练模型上事后计算,无需重新训练或修改架构。

Comments 9 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03538 2026-08-11 cs.LG 版本更新 57%

Online Learnability of Chain-of-Thought Verifiers: Soundness and Completeness Trade-offs

链式思维验证器的在线可学习性:正确性与完备性的权衡

Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia, Zhiyuan Li, Dravyansh Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Northwestern University(西北大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种在线学习框架,用于学习链式思维验证器,通过检查解决方案的正确性,解决生成器与验证器之间的反馈循环导致的分布偏移问题,并引入新的Littlestone维度扩展以优化验证器的学习。

Comments The abstract has been abridged due to arXiv length constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08910 2026-08-11 cs.CL 版本更新 57%

SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation

SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Koehn

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。

Comments COLM 2026 (Conference on Language Modeling). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏