arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1893 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2606.09669 2026-06-16 cs.AI cs.CL 新提交 62%

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14476 2026-06-15 cs.AI cs.LG 新提交 62%

When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More

当工具决定时:LLM代理盲目服从图神经网络工具,更强的骨干网络服从更多

Zhongyuan Wang, Pratyusha Vemuri

机构 * raptorX.ai

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM代理在使用GNN工具时是否真正判断而非盲目服从,发现代理在97.6-99.2%的情况下完全采纳GNN输出,且更强的骨干网络服从更多,选择性调用设计受限。

Comments 9 pages, 2 figures. Under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14157 2026-06-15 cs.LG cs.AI 新提交 62%

Learning Urban Access Costs from Origin-Destination Flows via Inverse Optimal Transport

通过逆最优传输从起点-终点流中学习城市访问成本

Paula Joy B. Martinez

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出逆最优传输模型从学校间入学流中恢复潜在选择成本,应用于菲律宾283,016条学生流动数据,估计补贴等效距离以优化城市服务分配。

Comments Oral Presentation. 2026 International Conference on Urban AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14188 2026-06-15 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 新提交 62%

Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation

无皱鲁棒性:并行仿真与鲁棒MPC实现可认证的变形体操作

Wei-Chen Li, Jeffrey Fang, Sasanka Polisetti, Yuexi Song, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出CORD-SLS实时控制方法,通过GPU并行可微仿真与接触平滑实现高效梯度规划,结合鲁棒模型预测控制与共形预测校准,在绳索和布料操作中达到毫秒级规划与高安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13400 2026-06-12 cs.LG cs.AI cs.RO 新提交 62%

PolyFlow: Safe and Efficient Polytope-Constrained Flow Matching with Constraint Embedding and Projection-free Update

PolyFlow: 安全高效的多面体约束流匹配,具有约束嵌入和无投影更新

Jianming Ma, Qiyue Yang, Yang Zhang, Liyun Yan, Zhanxiang Cao, Yazhou Zhang, Yue Gao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出PolyFlow,一种将约束直接嵌入模型和流动力学的多面体约束流匹配框架,通过离散时间流公式和无投影架构消除离散化误差并严格满足任意多面体约束,在规划与控制任务中实现零约束违反并降低推理延迟。

Comments 30 pages, 12 figures, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 62%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 62%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11688 2026-06-11 cs.CL cs.AI 新提交 62%

Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents

Goal-Autopilot: 一种可验证的防伪造防火墙,用于无人值守的长周期智能体

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Autopilot执行模型,通过外部化状态到有限状态机并强制门控验证,使智能体无法虚假声称成功,在3,150个单元测试中伪造率降至0.95%,显著低于基线方法。

Comments Preprint. Code: https://github.com/EpistemicaLab/goal-compiled-autopilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11417 2026-06-11 cs.LG cs.AI stat.ML 新提交 62%

Signed Compression Progress on a Sealed Audit is Goodhart-Resistant

密封审计上的有符号压缩进展是古德哈特抵抗的

Ayush Mittal, Dhruv Gupta

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出有符号压缩进展作为内在动机,证明其累积奖励等于审计改进,且对有限审计面板具有假阳性预算,抵抗古德哈特定律。

Comments 16 pages, 7 figures. Lean 4 (Mathlib) mechanized core and ARC-TGI experiment code: https://github.com/Zetetic-Dhruv/audit-compression-progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10199 2026-06-10 cs.LG cs.CL 新提交 62%

A Continuous-Time Markov Chain Framework for Insertion Language Models

插入语言模型的连续时间马尔可夫链框架

Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) IBM Research(IBM研究院) University of Toronto(多伦多大学) Vijil(维吉尔)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出基于连续时间马尔可夫链的插入语言模型去噪框架,统一现有方法,在规划任务中优于自回归和掩码扩散模型,语言建模中与现有方法竞争且采样更灵活。

Comments Accepted at AISTATS 2026. Code is available at https://github.com/dhruvdcoder/ctmc_dilm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09932 2026-06-10 cs.LG cs.AI 新提交 62%

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接

Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09896 2026-06-10 cs.GT cs.AI cs.LG 新提交 62%

HMAF: A Hierarchical Multi-Slot GD-RTB Allocation Framework

HMAF:一种分层多槽GD-RTB分配框架

Tianxing Bu, Zhaoqi Zhang, Linyou Cai, Miao Xie, Shengri Xue, Tan Qu, Qianlong Xie, Xingxing Wang, Siqiang Luo, Gao Cong

机构 * Meituan(美团) Nanyang Technological University(南洋理工大学) China Agricultural University(中国农业大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对GD与RTB共存广告平台中短期收益与长期交付的平衡难题,提出分层多槽分配框架HMAF,采用计划-校准-执行范式,集成离线约束优化与在线决策,在美团实现GD交付率提升3.72%、广告总收入提升1.59%。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09825 2026-06-09 cs.LG cs.AI cs.SY eess.SY math.OC 新提交 62%

An Agency-Transferring Model-Free Policy Enhancement Technique

一种无模型策略增强的代理转移技术

Anton Bolychev, Georgiy Malaniya, Sinan Ibrahim, Pavel Osinenko

机构 * Center for Engineering Systems and Sciences(工程系统与科学中心) Central University(中央大学) Sirius University of Science and Technology(天狼星科技大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种将次优基线策略嵌入强化学习训练的方法,通过逐步从基线策略向可学习策略转移代理权,提升训练效率并最终获得超越基线的独立策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08932 2026-06-09 cs.CL cs.AI cs.CE 新提交 62%

From Statute to Control Flow: Span-Grounded Deontic Trees for Defeasible Scope Parsing

从法规到控制流:基于跨度义务树的可废止范围解析

Jian Chen, Siyuan Li, Chucheng Wan, Zixuan Yuan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-Sen University(中山大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出NormBench基准和跨度义务树(SG-DT)中间表示,用于诊断和缓解规则遵循模型中的静默范围遗漏(SSO)问题,揭示递归衰减和可审计性陷阱两种病理,并通过约束输出改善树结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08633 2026-06-09 cs.AI cs.LG 新提交 62%

Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

面向长时域船舶轨迹与目的地预测的推理型大语言模型

Hongwei Wang, Miao Zhou, Fengde Wang, Yuting Wang, Jiewen Yu, Jun-Yan He, Bohao Qu, Wanbing Zhang, Xiuju Fu, Qing Guo, Zipei Fan, Yingying Xing, Yi Yuan

机构 * Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所) The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室) Meituan Inc., Shenzhen, China(美团(深圳)) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心) Nankai University(南开大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于可验证奖励强化学习(RLVR)的Maritime LLM后训练框架,将轨迹转化为语义文本,通过物理有效性约束和层次匹配提升长时域(30天)预测精度,4B模型表现最优。

Comments The IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026, Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08484 2026-06-09 cs.LG cs.AI 新提交 62%

STELLAR: Spatio-Temporal Environmental Learning with Latent Alignment and Refinement for Long-Tailed Species Distribution Modeling

STELLAR: 面向长尾物种分布建模的时空环境学习与潜在对齐精炼

Shufeng Kong, Tao Yu, Yuanyuan Wei, Caihua Liu, Junwen Bai, Yingheng Wang, Marc Grimson, Daniel Fink, Carla P. Gomes

机构 * Sun Yat-sen University(中山大学) Cornell University(康奈尔大学) Foshan University(佛山大学) Cornell Lab of Ornithology(康奈尔鸟类学实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出STELLAR框架,通过图-时间编码器、上下文锚定潜在对齐和不平衡感知解码模块,联合优化动态栖息地上下文和群落结构,有效解决物种分布建模中的时空耦合与长尾不平衡问题。

Comments Accept by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07710 2026-06-09 cs.LG cs.AI 新提交 62%

WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing

WhiFlash: 通过令牌级跨范式路由加速推测解码

Young D. Kwon, Miles Williams, Rui Li, Alexandros Kouris, Stylianos I. Venieris

机构 * Samsung AI Center, Cambridge, UK(三星AI中心,剑桥,英国)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出WhiFlash,首个统一自回归与扩散并行草稿的跨范式推测解码方法,通过细粒度路由和缓存优化实现高达69.6%的吞吐量提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05888 2026-07-08 cs.CR cs.AI 新提交 61%

i-EXAM: Instructable and Explainable Attack Connectivity Graph Modeler

i-EXAM:可指导且可解释的攻击连通性图建模器

Rakesh Podder, Wadia Ganim, Sarath Sreedharan, Indrajit Ray, Indrakshi Ray

机构 * Colorado State University(科罗拉多州立大学)

专题命中 规划决策 :planning(abstract,comments);分类 cs.AI

AI总结 i-EXAM工具借助规划编译,帮系统管理员创建复杂网络安全配置文件并做假设分析,可识别攻击路径、评估指标、生成强化策略,还能用大语言模型解释策略。

Comments In the Proceedings of the International Conference on Automated Planning and Scheduling (ICAPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24669 2026-06-24 cs.AI 新提交 61%

LaGO: Latent Action Guidance for Online Reinforcement Learning

LaGO:面向在线强化学习的潜在动作引导

Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)

专题命中 规划决策 :planning(abstract,comments);分类 cs.AI

AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。

Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22159 2026-06-23 astro-ph.IM astro-ph.EP cs.LG 新提交 61%

Deep RL for Fast Long-Horizon Operations Scheduling on NASA's Carruthers Geocorona Observatory Mission

用于NASA Carruthers Geocorona天文台任务的快速长时域操作调度的深度强化学习

Alex Zhang, Jackson Craig, Lara Waldrop

机构 * NASA(美国国家航空航天局)

专题命中 规划决策 :planning(abstract,journal_ref);分类 cs.LG

AI总结 提出一种深度强化学习框架,通过宏动作抽象和动态动作掩码解决长时域组合优化问题,为NASA Carruthers Geocorona天文台生成全局可行调度,提升科学质量,并在6小时内完成训练。

Comments Preprint, peer-reviewed, will be part of ICAPS 2026 conference proceedings

Journal ref Proceedings of the International Conference on Automated Planning and Scheduling, 36(1), 538-546, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 57%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16626 2026-08-18 cs.AI 新提交 57%

A Shop Floor Production Scheduling Case based on RFID-supported Smart Factory

基于RFID支持的智能工厂的车间生产调度案例

Zhihui Chen, Yize Sun, Yuhao Dong, Zeyu Xiao, Ray Y. Zhong

机构 * The University of Hong Kong(香港大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对配备RFID的智能工厂案例,通过挖掘RFID数据量化生产不确定性,提出基于深度强化学习的动态调度框架,仿真显示其在最小化总完工时间上优于FIFO、LIFO和DQN方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16594 2026-08-18 cs.AI 新提交 57%

CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction

CACSurv:基于大型语言模型的一致性对齐比较学习用于癌症生存预测

Tianqi Xiang, Qixiang Zhang, Xinpeng Ding, Yi Li, Xiaomeng Li

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究针对癌症生存预测中LLM时间回归的公式与监督不匹配问题,提出CACSurv框架,构建TCGA-SurvReport基准,在6个TCGA癌症队列上的平均C指数达0.722,显著优于现有模型与基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-18 cs.AI cs.RO 新提交 57%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15700 2026-08-18 cs.AI 新提交 57%

Adaptive Mixing of Policies from Searching and Policies from Learning

搜索策略与学习策略的自适应混合

Gavin B. Rens

机构 * Stellenbosch University(斯泰伦博斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究针对强化学习中搜索耗时问题,提出Flexer架构自适应混合神经网络与MCTS策略,在三类玩具符号问题实验中性能优于AlphaZero、DQN和ADP。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15509 2026-08-18 cs.RO cs.FL cs.LG 新提交 57%

Temporal Logic Guided Universal Task Representations for Reinforcement Learning

用于强化学习的时序逻辑引导通用任务表示

Hao Zhang, Zhangli Zhou, Zhen Kan

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) Chinese Academy of Sciences(中国科学院)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出受时序逻辑启发的通用任务表示框架LOTUS,将其集成至强化学习算法,通过LTL编码器建模语义、双模拟度量保障稳定性,在多场景下的学习效率、泛化能力等指标优于现有方法。

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems (Early Access). Project page: https://lotus-website.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15303 2026-08-18 cs.AI 新提交 57%

Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis

发散-收敛推理:通过结构化解决方案合成扩展测试时计算

Bo Wen, Yuhao Chen, Erhan Bilal, Carla Agurto Rios, Chen Wang, Junchen Jiang

机构 * School of Computing, Queen’s University(女王大学计算学院) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15004 2026-08-18 cs.CV cs.AI 新提交 57%

FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making

FZ-VLM:用于肺结节特征表征与临床决策的两阶段Florence-Zephyr视觉语言模型框架

Pramit Dutta, Jenita Manokaran, Richa Mittal, Ryan Appleby, Eranga Ukwatta

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) Holland Bloorview Kids Rehabilitation Hospital(霍兰德布鲁尔维尤儿童康复医院) Guelph General Hospital(圭尔夫综合医院) Ontario Veterinary College, University of Guelph(圭尔夫大学安大略兽医学院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 本研究提出首个两阶段视觉语言模型框架FZ-VLM,通过微调Florence-2与Zephyr-7B模型,实现肺CT中肺结节的结构化特征表征与临床决策,性能优于GPT-4基线及人类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 57%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 规划决策 :autonomous agent(abstract);分类 cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏