arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 69 篇

2604.04561 2026-04-07 cs.CR cs.AI cs.CL 81%

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

映射利用表面:一种10000次试验的分类,揭示使LLM代理利用漏洞的因素

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(OPIT——开放理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过10000次试验分析系统提示特征对LLM代理利用漏洞的影响,发现目标重构是唯一可靠触发因素,其他维度在特定条件下未产生显著利用。

Comments 18 pages, 8 tables, code and data at https://github.com/Cmouzouni/exploitation-surface

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03809 2026-04-07 cs.LG cs.AI cs.MA 81%

Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus

多智能体大语言模型委员会中的表征坍塌:测量与多样性感知共识

Dipkumar Patel

机构 * LLMs Research Inc.(LLMs研究公司)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨多智能体大语言模型委员会中表征坍塌现象,通过测量和多样性感知共识方法提升共识质量,实验表明表征坍塌可测量且影响任务难度。

Comments 11 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05012 2026-04-07 cs.DB cs.AI cs.CL 81%

Making Prompts First-Class Citizens for Adaptive LLM Pipelines

使提示成为自适应大语言模型流水线中的第一公民

Ugur Cetintemel, Shu Chen, Alexander W. Lee, Deepti Raghavan, Duo Lu, Andrew Crotty

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPEAR框架,通过结构化提示管理、动态提示细化和策略驱动控制,解决提示在流水线中的脆弱性和不透明性问题,提升重用性和运行时适应性。

Comments 6 pages, 2 figures, appears in CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04324 2026-04-07 cs.AI cs.SE 79%

RESCORE: LLM-Driven Simulation Recovery in Control Systems Research Papers

RESCORE:基于大语言模型的控制系统研究论文仿真恢复

Vineet Bhat, Shiqing Wei, Ali Umut Kaypak, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University(纽约大学) Tandon School of Engineering(坦登工程学院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出RESCORE框架,通过迭代执行反馈和视觉比较提升论文仿真恢复精度,实现40.7%的仿真恢复率,比单次生成方法更高效,节省验证时间与成本。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03232 2026-04-07 cs.AI 79%

IC3-Evolve: Proof-/Witness-Gated Offline LLM-Driven Heuristic Evolution for IC3 Hardware Model Checking

IC3-Evolve: 用于IC3硬件模型检查的自动离线LLM驱动启发式进化

Mingkai Miao, Guangyu Hu, Ziyi Yang, Hongce Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 IC3-Evolve通过离线LLM提出小范围修正,实现IC3硬件模型检查的自动优化,确保正确性验证下的启发式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08388 2026-04-07 cs.AI 79%

A Hierarchical Error-Corrective Graph Framework for Autonomous Agents with LLM-Based Action Generation

一种用于自主代理的分层错误校正图框架:基于大语言模型的动作生成

Cong Cao, Jingyao Zhang, Kun Tong

机构 * Independent Researcher(独立研究者) Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出HECG框架,通过多维可转移策略、误差矩阵分类和因果-上下文图检索三大创新,提升自主代理在动态任务中的策略选择、错误分析和情境适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03912 2026-04-07 cs.CR cs.AI cs.DC cs.LG 79%

Automating Cloud Security and Forensics Through a Secure-by-Design Generative AI Framework

通过安全设计的生成AI框架实现云安全与取证自动化

Dalal Alharthi, Ivan Roberto Kawaminami Garcia

机构 * University of Arizona(亚利桑那大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个安全设计的生成AI框架,结合PromptShield和CIAF,提升云环境中的安全性和取证准确性,通过实验证明在攻击条件下分类性能和勒索软件检测精度显著提升。

Comments arXiv admin note: substantial text overlap with arXiv:2510.00452

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04238 2026-04-07 cs.PL 78%

Agentic Code Optimization via Compiler-LLM Cooperation

通过编译器-LLM协作实现代理代码优化

Benjamin Mikek, Danylo Vashchilenko, Bryan Lu, Panpan Xu

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出编译器-LLM协作方法,结合传统编译优化与LLM生成,提升代码性能,实验显示比现有方法快1.25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16978 2026-04-07 cs.MA 78%

Lark: Biologically Inspired Neuroevolution for Multi-Stakeholder LLM Agents

Lark:生物启发的多利益相关者大语言模型代理神经进化

Rikhil Tanugula, Dheeraj Chintapalli, Sunkalp Chandra

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03561 2026-04-07 cs.SE 78%

From UI to Code: Mobile Ads Detection via LLM-Unified Static-Dynamic Analysis

从UI到代码:通过LLM统一的静态-动态分析进行移动广告检测

Shang Ma, Wei Cheng, Yanfang Ye, Xusheng Xiao

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出ADWISE框架,通过结合静态分析和LLM引导的UI结构、应用语义及检索类比,有效检测移动广告。实验表明,ADWISE在广告widget检测上优于现有方法25.60%,并发现更多广告违规情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09573 2026-04-07 cs.CV 78%

More than the Sum: Panorama-Language Models for Adverse Omni-Scenes

全景语言模型:超越拼接的全景场景理解

Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Shenzhen University(深圳大学) UCL(伦敦大学学院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出全景语言模型PLM,通过全景图像实现超越单目视角的综合推理,同时构建包含恶劣全景场景的PanoVQA数据集,开发可插拔的稀疏注意力模块以提升模型处理全景图像的能力。

Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04749 2026-04-07 cs.AI 77%

AI Trust OS -- A Continuous Governance Framework for Autonomous AI Observability and Zero-Trust Compliance in Enterprise Environments

AI信任操作系统——面向企业环境的连续治理框架:自主AI可观测性和零信任合规性

Eranga Bandara, Asanga Gunaratna, Ross Gore, Abdul Rahman, Ravi Mukkamala, Sachin Shetty, Sachini Rajapakse, Isurunima Kularathna, Peter Foytik, Safdar H. Bouk, Xueping Liang, Amin Hass, Ng Wee Keong, Kasun De Zoysa

机构 * Old Dominion University(欧道明大学) AI Motion Labs(AI Motion实验室) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Accenture Technology Labs(埃森哲技术实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AI Trust OS,通过持续自主AI可观测性和零信任合规性框架,解决企业环境中AI系统治理问题,基于 telemetry 驱动的架构实现持续合规验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04562 2026-04-07 cs.DL cs.AI 77%

Paper Espresso: From Paper Overload to Research Insight

Paper Espresso:从论文过载到研究洞察

Mingzhe Du, Luu Anh Tuan, Dong Huang, See-kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Paper Espresso通过大规模语言模型自动发现、总结和分析arXiv热点论文,揭示AI研究动态,包括强化学习的爆发、非饱和主题涌现及新颖性与社区参与度的正相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04767 2026-04-07 cs.LG cs.AI cs.CL 75%

Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems

Cog-DRIFT:通过适应性重新表述实例的探索实现从困难推理问题的学习

Justin Chih-Yao Chen, Archiki Prasad, Zaid Khan, Joykirat Singh, Runchu Tian, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Cog-DRIFT通过任务重述和自适应课程学习,提升大模型在推理任务中的表现,解决传统方法无法学习困难问题的限制。

Comments 22 pages, 4 figures. Code: https://github.com/dinobby/Cog-DRIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03790 2026-04-07 cs.CR 75%

Systematic Integration of Digital Twins and Constrained LLMs for Interpretable Cyber-Physical Anomaly Detection

数字孪生与约束性大语言模型的系统整合用于可解释的网络物理异常检测

Konstantinos E. Kampourakis, Vasileios Gkioulos, Sokratis Katsikas

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合确定性启发法与约束性大语言模型的混合检测方法,用于实时检测工业控制系统中的异常,通过数字孪生保持过程同步并生成行为描述,验证了该方法在四个典型攻击场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01891 2026-04-07 cs.CV 75%

Agentic AI in Remote Sensing: Foundations, Taxonomy, and Emerging Systems

遥感中的代理AI:基础、分类与新兴系统

Niloufar Alipour Talemi, Julia Boone, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文探讨遥感中代理AI的基础、分类及新兴系统,提出统一的分类框架,分析规划机制、检索增强生成和记忆结构,并评估轨迹感知推理的准确性。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, GeoCV Workshop

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 786-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04565 2026-04-07 cs.CL cs.AI 73%

PassiveQA: A Three-Action Framework for Epistemically Calibrated Question Answering via Supervised Finetuning

PassiveQA: 一个基于监督微调的三动作框架,用于通过监督微调进行知识校准的问题回答

Madhav S Baidya

机构 * Indian Institute of Technology (BHU) Varanasi(印度理工学院(巴纳拉斯印度教大学)瓦拉纳西分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PassiveQA框架,通过监督微调解决信息不全时的问题回答,提升宏F1和退避召回率,减少幻觉。

Comments 32 pages, 4 figures. Includes experiments on four QA datasets and a knowledge graph-based finetuning pipeline. Code available at: https://github.com/MadsDoodle/PassiveQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03754 2026-04-07 cs.CL cs.AI 73%

Testing the Limits of Truth Directions in LLMs

检验大型语言模型中真理方向的极限

Angelos Poulis, Mark Crovella, Evimaria Terzi

机构 * Boston University(波士顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了大型语言模型中真理方向的普遍性存在局限,指出其依赖于层数、任务类型和复杂性,并受指令影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14336 2026-04-07 cs.CV 71%

ArchMap: Arch-Flattening and Knowledge-Guided Vision Language Model for Tooth Counting and Structured Dental Understanding

ArchMap:用于牙齿计数和结构牙科理解的拱形扁平化和知识引导的视觉语言模型

Bohan Zhang, Yiyi Miao, Taoyu Wu, Tong Chen, Ji Jiang, Zhuoxiao Li, Zhe Tang, Limin Yu, Jionglong Su

机构 * Xi'an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Zhejiang University of Technology(浙江工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :language model(title)

AI总结 本文提出ArchMap,一种无需训练的知识引导框架,通过几何归一化和本体引导的多模态推理,提升3D口腔扫描的结构化分析能力,实现牙齿计数、解剖分区、牙列阶段分类及临床状况识别。

Journal ref In Proceedings of the 2025 IEEE International Conference on Big Data (BigData), pp. 7529-7538, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04852 2026-04-07 cs.CR cs.AI 70%

Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework

通过结构化提示框架强化LLMs中以人为中心的链式推理完整性

Jiling Zhou, Aisvarya Adeseye, Seppo Virtanen, Antti Hakkala, Jouni Isoaho

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出结构化提示框架以提升LLMs链式推理的可靠性及安全威胁检测能力,通过16个核心维度因素优化推理过程,实验证明在DDoS攻击检测中推理能力提升达40%,并获得高人评一致性。

Comments This paper has been accepted at the 12th Intelligent Systems Conference (IntelliSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04664 2026-04-07 cs.RO cs.AI cs.MA 70%

ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration

ROSClaw:一种用于异构多智能体协作的分层语义-物理框架

Rongfeng Zhao, Xuanhao Zhang, Zhaochen Guo, Xiang Shao, Zhongpan Zhu, Bin He, Jie Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) National Key Laboratory of Autonomous Intelligent Unmanned Systems (Tongji University)(自主智能无人系统全国重点实验室(同济大学)) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Tongji University(同济大学) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ROSClaw通过统一视觉语言模型控制器整合策略学习与任务执行,构建仿真到现实的拓扑映射,实现多智能体协作中的语义连续性和动态任务分配,提升多策略执行的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04443 2026-04-07 cs.CL 70%

DeonticBench: A Benchmark for Reasoning over Rules

DeonticBench: 一个用于规则推理的基准

Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DeonticBench,包含6232个任务,涵盖美国联邦税收、航空行李政策等真实领域,研究复杂规则推理问题,结合语言推理与符号计算,评估LLM在非符号和符号环境下的规则推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 70%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22095 2026-04-07 cs.CL 70%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03664 2026-04-07 cs.CL 70%

Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports

跨单表和多表的财务报告中数字推理

Yi-Cheng Wang, Wei-An Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学资讯工程学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FinLongDocQA数据集,解决长文档中跨表数字推理问题,发现LLM在长文本中定位和多步计算时存在瓶颈,提出FinLongDocAgent多智能体方法提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03631 2026-04-07 cs.AI 70%

Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors

单 agent 与多 agent 在自动视频分析上的协作学习行为研究

Likai Peng, Shihui Feng

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Institute of Data Science, The University of Hong Kong(香港大学数据科学研究所)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文比较了单 agent 和多 agent 框架在自动编码协作学习场景视频中的性能,提出两种多 agent 方法,分别在场景检测和动作检测任务中表现优异。

Comments 15 pages, 4 figures. To be published in the 27th International Conference on Artificial Intelligence in Education (AIED2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03616 2026-04-07 cs.CL 70%

The Format Tax

格式税

Ivan Yee Lee, Loris D'Antoni, Taylor Berg-Kirkpatrick

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文发现要求大语言模型以JSON等结构化形式输出会显著降低推理和写作性能,提出分离推理与格式生成的方法可恢复大部分损失的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03587 2026-04-07 cs.CR cs.AI 70%

SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization

SecPI: 通过安全推理内化实现安全代码生成

Hao Wang, Niels Mündler, Mark Vero, Jingxuan He, Dawn Song, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03356 2026-04-07 cs.AI 70%

Evaluating Artificial Intelligence Through a Christian Understanding of Human Flourishing

通过基督教对人类繁荣的理解评估人工智能

Nicholas Skytland, Lauren Parsons, Alicia Llewellyn, Steele Billings, Peter Larson, John Anderson, Sean Boisen, Steve Runge

机构 * Gloo WinShape Foundation(WinShape基金会) Biblica

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基督教单轮Flourishing AI基准,评估前沿模型在七个维度上的人类繁荣表现,发现AI默认采用世俗主义,导致道德和神学推理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08392 2026-04-07 cs.RO cs.AI cs.CV 70%

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏