arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 32 篇

2604.27267 2026-05-01 cs.CR cs.AI cs.RO 92%

From Prompt to Physical Actuation: Holistic Threat Modeling of LLM-Enabled Robotic Systems

从提示到物理执行:LLM赋能机器人系统的整体威胁建模

Neha Nagaraja, Hayretdin Bahsi, Carlo R. da Cunha

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(信息学、计算与网络系统学院,北亚利桑那大学) Department of Software Science, Tallinn University of Technology(软件科学系,塔林技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于数据流图的LLM赋能机器人系统威胁分析方法,揭示了传统威胁、对抗威胁和对话威胁在感知-规划-执行流程中的交互与传播,首次完整分析了三个威胁类别在全系统中的跨边界攻击链。

Comments Submitted to 23rd Annual International Conference on Privacy, Security, and Trust (PST2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24329 2026-05-01 cs.CL 90%

World model inspired sarcasm reasoning with large language model agents

受世界模型启发的大型语言模型代理 sarcasm 推理

Keito Inoshita, Shinnosuke Mizuno

机构 * Faculty of Business and Commerce, Kansai University(大阪 kansai 大学 商业与文理学院) Faculty of Medicine, The University of Tokyo(东京大学 医学部)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出 WM-SAR 模型,通过分解语义不一致性和意图进行 sarcasm 推理,实现高可解释性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27713 2026-05-01 cs.AI 90%

Knowledge Graph Representations for LLM-Based Policy Compliance Reasoning

基于LLM的政策合规推理的知识图谱表示

Wilder Baldwin, Sepideh Ghanavati

机构 * University of Maine(缅因大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一个框架,通过构建知识图谱从AI政策文档中检索相关信息,评估五种LLM在42个政策问答任务上的表现,证明知识图谱增强提升了模型性能,且开放的LLM发现模式达到或超越了正式本体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26954 2026-05-01 cs.CY cs.AI 89%

The Impact of LLM Self-Consistency and Reasoning Effort on Automated Scoring Accuracy and Cost

大型语言模型自我一致性与推理努力对自动化评分准确性和成本的影响

Scott Frohn

机构 * Khan Academy(可汗学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了LLM自我一致性和推理努力对自动化评分准确性和成本的影响,发现策略性模型选择和推理设置比集成更有效,且推理努力与评分准确性呈正相关。

Comments 14 pages, 10 tables, 2 figures. Presented at the 2026 National Council on Measurement in Education (NCME) Annual Meeting, April 11, 2026, Los Angeles, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11908 2026-05-01 cs.CL 89%

PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning

PPA-Plan: 长上下文LLM推理中的前瞻性坑洞避免规划

Byeongjin Kim, Gyuwan Kim, Seo Yeon Park

机构 * Hanyang University(翰阳大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对长上下文推理中计划生成不可靠的问题,PPA-Plan通过前瞻性策略预防逻辑错误,提升计划执行效果。

Comments Accepted to the Main Conference of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19044 2026-05-01 cs.CL 88%

MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models

MoRI: 在大语言模型中学习基于动机的推理以进行科学构想

Chenyang Gu, Jiahao Cheng, Meicong Zhang, Pujun Zheng, Jinquan Zheng, Guoxiu He

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 MoRI通过强化学习奖励机制提升大语言模型在科学构想中的推理能力,优于现有方法,在新颖性、技术严谨性和可行性方面表现突出。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17435 2026-05-01 cs.RO 88%

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器

Teng Wang, Xinxin Zhao, Wenzhe Cai, Changyin Sun

机构 * School of Automation, Southeast University(东南大学自动化学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(title);large language model(abstract)

AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。

Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27616 2026-05-01 cs.CL cs.MA 86%

RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems

RoadMapper: 一个用于解决复杂研究问题的路线图生成的多智能体系统

Jiacheng Liu, Zichen Tang, Zhongjun Yang, Xinyi Hu, Xueyuan Lin, Linwei Jia, Ruofei Bai, Rongjin Li, Shiyao Peng, Haocheng Gao, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) Hithink RoyalFlush Information Network Co., Ltd.(Hithink RoyalFlush信息网络有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RoadMapper,一个基于LLM的多智能体系统,通过分解任务生成高质量路线图,提升LLM在复杂问题解决中的性能,效率提升84%。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27311 2026-05-01 cs.SE cs.AI 86%

Pragmos: A Process Agentic Modeling System

Pragmos:一个过程代理建模系统

Pedro-Aarón Hernández-Ávalos, Luciano García-Bañuelos

机构 * Tecnologico de Monterrey(墨西哥技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Pragmos系统,通过人机协作的交互流程,利用LLM与领域专家共同构建可解释的过程模型,解决复杂过程建模问题。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28196 2026-05-01 cs.CV 86%

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

HERMES++:迈向统一的驾驶世界模型用于3D场景理解和生成

Xin Zhou, Dingkang Liang, Xiwu Chen, Feiyang Tan, Dingyuan Zhang, Hengshuang Zhao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Mach Drive University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HERMES++,一种统一的驾驶世界模型,整合3D场景理解和未来几何预测。通过BEV表示、LLM增强世界查询和当前到未来链接等设计,提升驾驶场景的生成与理解能力。

Comments Extended version of ICCV 25 paper HERMES, Code: https://github.com/H-EmbodVis/HERMESV2, Project page: https://h-embodvis.github.io/HERMESV2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27228 2026-05-01 cs.AI cs.CL cs.CY cs.MA 84%

When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis

当角色失效时:基于大语言模型的政治声明分析中的知识约束与倡导角色一致性

Juergen Dietrich

机构 * TRUST Project(TRUST项目)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中倡导角色一致性的知识约束,通过TRUST管道测试发现两种失效模式,并揭示模型选择和事实核查提供商对角色一致性的影响。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28043 2026-05-01 cs.AI 81%

Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

协同智能体推理工程(CARE):一种三方设计方法论,用于系统性地工程化AI智能体,涉及领域专家、开发者和辅助智能体

Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CARE提出一种系统化方法论,通过可重用的artifacts和阶段化流程,结合领域专家、开发者和辅助智能体,提升AI智能体的开发效率和复杂查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI 81%

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27264 2026-05-01 cs.SE cs.AI 81%

Self-Evolving Software Agents

自演化软件代理

Marco Robol, Paolo Giorgini

机构 * University of Trento(特伦托大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出自演化软件代理,结合BDI推理与大语言模型,使代理能自主进化目标、推理和可执行代码。实验显示代理可自主发现新目标并生成行为,验证了LLM驱动进化的可行性与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22228 2026-05-01 cs.CV cs.AI cs.CL 81%

Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation

迷失在空间中?视觉-语言模型在相对相机姿态估计中挣扎

Ken Deng, Yifu Qiu, Yoni Kasten, Shay B. Cohen, Yftah Ziser

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) NVIDIA Research(NVIDIA研究) University of Groningen(格罗宁根大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究视觉-语言模型在相对相机姿态估计中的表现,发现其在多视角空间推理中存在显著不足,尽管人类和专用几何方法表现良好,但VLMs仍处于初级水平,揭示了跨视角对应和投影相机运动理解等关键能力缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02515 2026-05-01 cs.CL cs.AI cs.LG 80%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 79%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27414 2026-05-01 cs.CV cs.CR cs.LG 79%

Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

理解视觉语言模型在自动驾驶中的对抗转移性:跨架构分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Mert D. Pese

机构 * School of Computing, Clemson University, USA(克莱姆森大学计算机学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 本文通过跨架构研究探讨视觉语言模型在自动驾驶中的对抗转移性,评估了三种架构在不同场景下的对抗效果,发现高跨架构有效性。

Comments 9 pages, 2 figures. Accepted at SAE WCX 2026

Journal ref SAE Technical Paper 2026-01-0170, SAE WCX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23744 2026-05-01 cs.CL cs.AI 79%

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

组合与融合:重新审视多模态推理中的基础瓶颈

Yucheng Wang, Yifan Hou, Aydin Javadov, Mubashara Akhtar, Mrinmaya Sachan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过逻辑基础评估框架,发现多模态推理中模态交互的六个模式影响推理效果,指出任务组合和融合是主要瓶颈,提出通过分步提示和早融控制提升推理性能。

Comments Our code (https://github.com/DELTA-DoubleWise/OmniReason) and data (https://huggingface.co/datasets/ycwang11/OmniReason) are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27472 2026-05-01 cs.AI cs.LG cs.RO 73%

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS:通过对比表示实现的原始推理与任务系统

Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27850 2026-05-01 cs.CL 70%

Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems

基于物体描述的推理提高了基于任务的对话系统中的指代消解

Oier Ijurco, Oier Lopez de Lacalle

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种单模态测试时推理方法,通过详细物体元数据和对话历史推理提升指代消解,实验表明在SIMMC 2.1数据集上效果显著,且在少样本设置下能有效泛化到新场景和物体。

Comments To be published in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27763 2026-05-01 cs.AI 70%

Intent2Tx: Benchmarking LLMs for Translating Natural Language Intents into Ethereum Transactions

Intent2Tx:评估大语言模型将自然语言意图转换为以太坊交易的基准测试

Zhuoran Pan, Yue Li, Zhi Guan, Jianbin Hu, Zhong Chen

机构 * Taiyuan University of Technology(太原科技大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Intent2Tx基准测试,基于真实以太坊链上数据,评估大语言模型将自然语言意图转换为功能正确、状态依赖的链上交易的能力,发现现有模型在多步规划和泛化能力上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07408 2026-05-01 cs.AI cs.MA 70%

Progressive Multi-Agent Reasoning for Biological Perturbation Prediction

逐步多智能体推理用于生物扰动预测

Hyomin Kim, Sang-Yeon Hwang, Jaechang Lim, Yinhua Piao, Yunhak Oh, Woo Youn Kim, Chanyoung Park, Sungsoo Ahn, Junhyeok Jeon

机构 * KAIST(韩国国立科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LINCSQA基准和PBio-Agent框架,通过整合难度感知任务序列与迭代知识细化,提升复杂化学扰动下基因调控预测的准确性与解释性。

Comments 17 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00376 2026-05-01 cs.SE cs.AI 70%

In Line with Context: Repository-Level Code Generation via Context Inlining

与上下文一致:通过上下文内联实现仓库级代码生成

Chao Hu, Wenhao Zeng, Yuling Shi, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出InlineCoder框架,通过内联未完成函数到调用图中,将仓库理解转化为更易处理的函数级编码任务,提升仓库级代码生成能力。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27586 2026-05-01 cs.AI cs.LG 62%

Trace-Level Analysis of Information Contamination in Multi-Agent Systems

多智能体系统中信息污染的跟踪级分析

Anna Mazhar, Huzaifa Suri, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) University of Illinois(伊利诺伊大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体系统中信息污染现象,通过跟踪差异量化污染影响,提出污染表现类型分类及测量框架,揭示验证防护失效原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28147 2026-05-01 cs.CL 57%

On the Proper Treatment of Units in Surprisal Theory

关于在惊奇理论中正确处理单位的探讨

Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文探讨了在惊奇理论中正确处理语言单位的重要性,提出应明确区分单位定义与预测区域选择,并统一框架处理任意单位库。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27132 2026-05-01 cs.AI 57%

TRUST: A Framework for Decentralized AI Service v.0.1

TRUST:一种去中心化AI服务框架v.0.1

Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 57%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12656 2026-05-01 cs.RO cs.LG 57%

FeaXDrive: Feasibility-aware Trajectory-Centric Diffusion Planning for End-to-End Autonomous Driving

FeaXDrive: 为端到端自动驾驶的可行性感知轨迹导向扩散规划

Baoyun Wang, Zhuoren Li, Ran Yu, Yu Che, Xinrui Zhang, Ming Liu, Jia Hu, Chen Lv, Bo Leng

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) College of Transportation Engineering, Tongji University(同济大学交通工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.LG

AI总结 FeaXDrive通过轨迹导向的扩散规划方法,提升自动驾驶中轨迹空间的可行性建模,改进轨迹几何和运动学可行性,增强可行驶区域一致性,实验表明其在NAVSIM基准上表现优异。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28078 2026-05-01 cs.CV 50%

AesRM: Improving Video Aesthetics with Expert-Level Feedback

AesRM:通过专家级反馈提升视频美学

Yujin Han, Yujie Wei, Yefei He, Xinyu Liu, Tianle Li, Zichao Yu, Andi Han, Shiwei Zhang, Tingyu Weng, Difan Zou

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Sydney(悉尼大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文提出AesRM框架,通过分解视频美学为视觉美学、视觉保真度和视觉合理性三个维度,构建了专家标注的AesVideo-Bench基准,并开发了AesRM-Base和AesRM-CoT模型,提升了视频美学评估的准确性和可解释性。

Comments 37 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏