arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2604.08958 2026-06-12 cs.LG cs.AI cs.RO 版本更新 62%

WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning

WOMBET:基于世界模型的经验迁移实现鲁棒且样本高效的强化学习

Mintae Kim, Koushil Sreenath

机构 * Hybrid Robotics, UC Berkeley(混合机器人技术,伯克利大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出WOMBET框架,通过源任务中学习世界模型并生成不确定性惩罚的离线数据,再结合自适应采样进行在线微调,实现鲁棒且样本高效的强化学习迁移。

Comments 13 pages, 6 figures, 8th Annual Learning for Dynamics & Control Conference (L4DC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 62%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14867 2026-06-11 cs.LG cs.AI cs.GT cs.MA 版本更新 62%

Sample-Efficient Hypergradient Estimation for Decentralized Bi-Level Reinforcement Learning

用于去中心化双层强化学习的样本高效超梯度估计

Mikoto Kudo, Takumi Tanabe, Akifumi Wachi, Youhei Akimoto

机构 * University of Tokyo(东京大学) National Institute of Information and Communications Technology(日本信息与通信技术研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化双层强化学习中领导者无法干预跟随者优化过程的问题,提出基于玻尔兹曼协方差技巧的超梯度估计方法,实现高维决策空间下的样本高效优化,并首次应用于双人马尔可夫博弈。

Comments 29 pages. Extended version of the paper accepted to ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21380 2026-06-11 cs.LG cs.AI 版本更新 62%

The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network

算法并非行为:学得的先验知识在弈棋神经网络中覆盖前瞻

Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer HHI(弗劳恩霍夫人工智能研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,国际象棋神经网络Leela Chess Zero在中间层能正确计算解法,但最终输出被安全优先的先验知识覆盖,导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11995 2026-06-10 cs.CV cs.AI cs.LG 版本更新 62%

V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions

V-REX: 通过问题链进行探索性视觉推理的基准测试

Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院市分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12666 2026-06-09 cs.LG cs.AI 版本更新 62%

RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction

RetroReasoner:一种用于战略 retrosynthesis 预测的推理 LLM

Hanbum Ko, Chanhui Lee, Ye Rin Kim, Rodrigo Hormazabal, Sehui Han, Sungbin Lim, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Statistics, Korea University(韩国大学统计系) Materials Intelligence Lab, LG AI Research(LG人工智能研究实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RetroReasoner 通过监督微调和强化学习,捕捉化学家基于断键策略的推理过程,提升 retrosynthesis 预测的准确性和多样性。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06077 2026-06-09 cs.IT cs.AI cs.LG math.IT math.OC 版本更新 62%

One if by Land, Two if by Sea, Three if by Four Seas, and More to Come -- Values of Perception, Prediction, Communication, and Common Sense in Decision Making

一陆二海三四海,更多将至——感知、预测、通信与常识在决策中的价值

Aolin Xu

机构 * Aolin Xu(徐傲林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文严格定义决策中感知、预测、通信和常识的价值,发现无预测的感知价值可能为负,而预测价值非负,并应用于自主决策系统设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04812 2026-06-08 cs.LG cs.AI 版本更新 62%

Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Safe Guarantees

面向风险感知强化学习的情景生成与近似安全保证

Mohit Prashant, Arvind Easwaran

机构 * Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习策略对转移扰动敏感导致不安全行为的问题,提出使用变分自编码器近似状态空间分布,通过构造上下界屏障证书并采样非鲁棒区域状态来收紧概率安全保证。

Comments 8 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09041 2026-06-08 cs.LG cs.AI 版本更新 62%

Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach

自动驾驶鲁棒控制:一种智能一般和约束对抗强化学习方法

Junchao Fan, Qi Wei, Ruichen Zhang, Yang Lu, Jianhua Wang, Xiaolin Chang, Bo Ai

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室) Beijing Jiaotong University(北京交通大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对深度强化学习在自动驾驶中易受对抗攻击的问题,提出智能一般和约束对抗强化学习(IGCARL),通过战略性目标对手和鲁棒驾驶代理的交互训练,在约束优化下提升策略稳定性,实验表明成功率比现有方法提高至少27.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11195 2026-08-17 cs.AI cs.CC cs.HC math.FA 版本更新 57%

Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration

格罗滕迪克常数的长周期AI研究:人机数学协作的案例研究

Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过案例探究AI在数学研究中的有效应用,利用AI研究系统将格罗滕迪克常数的最优界收紧,同时分析了AI用于数学研究的优劣势及相关经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01035 2026-08-17 cs.RO cs.AI cs.CV 版本更新 57%

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

WAM-Diff2:面向高效自动驾驶视觉-语言-动作(VLA)的分层自回归到扩散蒸馏

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 WAM-Diff2通过三阶段分层蒸馏策略,将预训练自回归VLA模型转化为高效扩散模型,缓解暴露偏差、实现与基线相当性能,解码速度提升2.8倍,结合系统级优化后达15.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 57%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08491 2026-08-17 cs.RO cs.AI eess.SY 版本更新 57%

Edge Case Detection in Automated Driving: Methods, Challenges, and Future Directions

自动驾驶中的边缘案例检测:方法、挑战与未来方向

Saeed Rahmani, Sabine Rieder, Erwin de Gelder, Marcel Sonntag, Jorge Lorente Mallada, Sytze Kalisvaart, Vahid Hashemi, Bart van Arem, Simeon C. Calvert

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对自动驾驶边缘案例检测缺乏全面综述的问题,对相关方法分层分类,引入知识驱动方法,评估检测技术指标,指出数据、验证等挑战,为自动驾驶测试提供框架与实际测试支持。

Comments This article has been accepted for inclusion in a future issue of this journal. Content is final as presented, with the exception of pagination. doi: this https URL (https://doi.org/10.1109/TITS.2026.3715674)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11110 2026-08-14 cs.CL 版本更新 57%

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

行动胜于言语:测量使用工具的智能体的跨语言策略保留率

Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

机构 * Microsoft Research India(微软研究院印度分部)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 该研究测量使用工具的智能体的跨语言行动策略保留率,发现前沿模型在贪心解码下保留71%-73%策略,参数低于100亿时保留率崩溃,且存在影响测量的混淆因素。

Comments Accepted in COLM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20781 2026-08-13 cs.AI cs.CY econ.GN q-fin.EC 版本更新 57%

The Human-AI Substitution Principle: When will you be replaced by AI in your organization?

人类-人工智能替代原则:在你的组织中,你何时会被人工智能取代?

Bonny Banerjee, Shreya Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究人类员工何时被人工智能取代,提出HAT分析模型,编码人类技能与人工智能能力的经济不对称,推导多因素对人机替代的影响,得出替代原则,揭示其引发的组织变化及中层管理与高技能工人的脆弱性,统一相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21112 2026-08-13 cs.CV cs.AI cs.RO 版本更新 57%

LiDAR-based 3D Change Detection at City Scale

基于LiDAR的城市级三维变化检测

Hezam Albaqami, Haitian Wang, Xinyu Wang, Muhammad Ibrahim, Zainy M. Malakan, Abdullah M. Algamdi, Mohammed H. Alghamdi, Ajmal Mian

机构 * Department of Computer Science and Artificial Intelligence, University of Jeddah(计算机科学与人工智能系,朱德亚大学) Department of Computer Science and Software Engineering, University of Western Australia(计算机科学与软件工程系,西澳大学) Department of Data Science, Umm Al-Qura University(数据科学系,乌姆·阿勒·卡拉大学) Department of Information and Technology Systems, College of Computer Science and Engineering, University of Jeddah(信息与技术系统系,计算机科学与工程学院,朱德亚大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于LiDAR的城市级三维变化检测方法,通过多分辨率NDT和ICP对齐数据,结合语义分割和双分匹配优化,实现了高精度的变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00945 2026-08-12 cs.LG cs.CY 版本更新 57%

TS-Mob: Social and Geographical-Aware Time Series Foundation-Model Framework for Human Mobility Prediction

TS-Mob:面向人类移动性预测的社交与地理感知时间序列基础模型框架

Massimiliano Luca, Ciro Beneduce, Bruno Lepri

机构 * MobS Lab, Bruno Kessler Foundation(布鲁诺·凯瑟林基金会移动实验室) Department of Computer Science, University of Trento(特伦托大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 TS-Mob框架通过结合地理社交信号与天气协变量微调TimesFM模型,在多类移动性预测基准上显著优于各类基线,且在不同时间区间表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00868 2026-08-11 physics.app-ph cond-mat.mtrl-sci cs.LG cs.SY eess.SY 版本更新 57%

Autonomous Reliability Qualification of Ga$_2$O$_3$-based diode sensors via Safe Active Learning

基于Ga₂O₃二极管传感器的自主可靠性认证:通过安全主动学习

Davi Febba, William A. Callahan, Anna Sacchi, Andriy Zakutayev

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究提出安全主动学习(SAL)框架,用于Ga₂O₃二极管传感器的自主可靠性表征,经仿真与实验验证后,其生成的数据集可支撑高斯过程模型实现长时退化预测,且该框架适用于其他器件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23290 2026-08-11 cs.AI 版本更新 57%

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理

Xi Chen, Hongru Zhou, Shiyu Feng, Hanyu Zhou, Huahui Yi, Rongsheng Wang, Tiancheng He, Kun Wang, Pingping Liu, Qiankun Li, Sicheng Lin, Huiying Ou, Xiaohong Zheng, Tianying Zang, Zhuohang Wu, Leheng Jiang, Kexin Cao, Wenhan Zhang, ChengYi Li, Zhiyang Wang, Songlin Li, Benyou Wang, Ningbei Yin, Shaoting Zhang, Weili Fu, Jian Li, Kang Li

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。

Comments 100 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18262 2026-08-11 cs.AI 版本更新 57%

ProbSPARQL: Querying Knowledge Graphs with Multi-dimensional, Uncertain Numeric Data

ProbSPARQL:使用多维不确定数值数据查询知识图谱

Jingcheng Wu, Ratan Bahadur Thapa, Daniel Hernandez, Hongkuan Zhou, Steffen Staab

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Bosch Corporate Research(博世企业研究部) Web and Internet Science Research Group, University of Southampton(南安普顿大学网络与互联网科学研究组)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对循环工厂中含多维不确定数值数据的知识图谱查询问题,提出ProbSPARQL,它将不确定数值建模为随机变量,支持相关表达式、过滤器和连接。通过实现和评估,展示了其在引擎内执行的可行性及相关性能优势。

Comments 18 pages, 5 figures, 1 table. Accepted at ISWC 2026, camera-ready version. Supplementary material and reproducibility artifacts are available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00941 2026-08-11 cs.LG cs.CV 版本更新 57%

Uncertainty in a Single Pass: A Closed-Form Identity for One-Step Flow Matching

散度即不确定性:流匹配的闭式后验协方差

Jiarui Xing, Song Wang, Jian Wang

机构 * Yale University(耶鲁大学) Shanxi University(山西大学) Harvard Medical School(哈佛医学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文通过扩展Tweedie公式到流匹配插值,推导出生成轨迹上每一点后验协方差的精确闭式表达式,该表达式仅依赖于学习速度场的散度,可在预训练模型上事后计算,无需重新训练或修改架构。

Comments 9 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03538 2026-08-11 cs.LG 版本更新 57%

Online Learnability of Chain-of-Thought Verifiers: Soundness and Completeness Trade-offs

链式思维验证器的在线可学习性:正确性与完备性的权衡

Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia, Zhiyuan Li, Dravyansh Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Northwestern University(西北大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种在线学习框架,用于学习链式思维验证器,通过检查解决方案的正确性,解决生成器与验证器之间的反馈循环导致的分布偏移问题,并引入新的Littlestone维度扩展以优化验证器的学习。

Comments The abstract has been abridged due to arXiv length constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08910 2026-08-11 cs.CL 版本更新 57%

SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation

SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Koehn

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。

Comments COLM 2026 (Conference on Language Modeling). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06473 2026-08-11 physics.soc-ph cs.AI cs.SI 版本更新 57%

Deep Generative Model for Human Mobility Behavior

人类移动行为的深度生成模型

Ye Hong, Yatao Zhang, Konrad Schindler, Martin Raubal

机构 * Institute of Cartography and Geoinformation, ETH Zurich(测绘与地理信息研究所,苏黎世联邦理工学院) Department of Human Geography, Lund University(人类地理学系,吕勒奥大学) Future Resilient Systems, Singapore-ETH Centre, ETH Zurich(未来韧性系统,新加坡-苏黎世联邦理工学院,苏黎世联邦理工学院) Photogrammetry and Remote Sensing, ETH Zurich(摄影测量与遥感,苏黎世联邦理工学院) Department of Geography, University College London(地理系,伦敦大学学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出基于扩散的生成框架MobilityGen,模拟多属性活动-出行序列,复现标度律、时间分配等关键模式,支持城市空间可达性和社会暴露分析。

Comments Accepted at TRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22966 2026-08-11 cs.CL 版本更新 57%

Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks

提示工程并不能普遍提升大型语言模型在临床决策任务中的性能

Mengdi Chai, Ali R. Zomorrodi

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 本研究发现提示工程对LLMs在临床决策任务中的性能提升具有高度依赖模型和任务的特性,强调了定制化策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09636 2026-08-11 cs.CL 版本更新 57%

MiraMind: Benchmarking Reliable Mental Health Reasoning beyond Answer Accuracy

MentraSuite:面向心理健康推理与评估的训练后大语言模型

Mengxi Xiao, Kailai Yang, Pengde Zhao, Enze Zhang, Ziyan Kuang, Zhiwei Liu, Weiguang Han, Shu Liao, Lianting Huang, Guojun Xiong, Victor Gutierrez Basulto, Jinpeng Hu, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心) The University of Manchester(曼彻斯特大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Mount Holyoke College(马歇尔学院) Hefei University of Technology(合肥工业大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 MentraSuite通过训练后模型Mindora,提升心理健康推理的可靠性与一致性,适用于复杂的心理健康评估与诊断场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27544 2026-08-11 cs.AI cs.FL 版本更新 57%

TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation

TempoBench:评估大语言模型中的时间因果推理

Nikolaus Holzer, William Fishell, Baishakhi Ray, Mark Santolucito

机构 * Columbia University(哥伦比亚大学) Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 57%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏