arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-02 至 2026-07-02 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 28 篇

2511.17731 2026-07-02 cs.CV cs.LG 版本更新 90%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00531 2026-07-02 cs.LG cs.AI q-bio.BM stat.ML 新提交 84%

Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong

机构 * School of Medicine, Stanford University(斯坦福大学医学院) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24661 2026-07-02 cs.AI cs.CL 版本更新 81%

Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework

衡量LLM中的推理质量:一个多维行为框架

Ali Şenol, Garima Agrawal, Huan Liu

机构 * Department of Computer Engineering, Tarsus University(塔鲁斯大学计算机工程系) School of Computing and Augmented Intelligence (SCAI), Arizona State University (ASU)(计算与增强智能学院(SCAI),亚利桑那州立大学(ASU)) HumaConn AI Consulting(HumaConn AI咨询)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一个基于行为的多维框架,从正确性、一致性、鲁棒性、逻辑连贯性、效率和稳定性六个维度评估LLM推理质量,揭示仅靠准确率无法观察到的行为,并支持部署决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21013 2026-07-02 cs.LG cs.AI 版本更新 81%

Predicting LLM Reasoning Performance with Small Proxy Model

用小代理模型预测LLM推理性能

Woosung Koh, Juyoung Suk, Sungjun Han, Se-Young Yun, Jamin Shin

机构 * Trillion Labs KAIST AI(韩国科学技术院人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00115 2026-07-02 cs.CV 新提交 78%

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

PixelEyes: 解耦感知与推理以实现精准视觉证据查找

Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) UC Merced(加州大学默塞德分校) UTS(UTS大学) NUS(新加坡国立大学) NTU(南洋理工大学) CASIA(中国科学院自动化所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。

Comments 22pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 78%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 78%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00276 2026-07-02 cs.LG cs.AI cs.CL 新提交 67%

Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds

测试前沿大语言模型在平行物理世界中的物理素养

Dong Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出四阶段诊断方法评估LLM在陌生物理框架中的推理能力,在三个平行世界测试发现定性-定量不对称及自我审查薄弱。

Comments 37 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31529 2026-07-02 cs.CV 版本更新 67%

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

SVI-Bench: 一个用于战略视频智能的动态微世界

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出SVI-Bench,一个基于团队体育动态微世界的大规模基准,通过四个层级(动态场景理解、因果推理、战略模拟、智能体合成)的9个任务评估视频智能从感知到战略规划的能力,发现模型在感知任务上表现良好但在认知层级上性能急剧下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00465 2026-07-02 cs.CV cs.CL cs.LG 新提交 62%

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

StochasT:基于随机轮次深度的视觉指令微调学习

Yuan Qing, Chengzhi Mao, Boqing Gong

机构 * Boston University(波士顿大学) Rutgers University(罗格斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00464 2026-07-02 cs.LG cs.CL 新提交 62%

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00009 2026-07-02 cs.CL cs.AI 新提交 62%

Controllable Narrative Rendering for Enhanced Assisted Writing

可控叙事渲染以增强辅助写作

Mingzhe Lu, Yanbing Liu, Jiayue Wu, Jiarui Zhang, Qihao Wang, Yue Hu, Yunpeng Li, Yangyan Xu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) HiThink Research(海天瑞声)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在创意写作中安全编辑与无控制情节扩展的二元失败问题,提出基于叙事学故事/话语区分的Loom框架,通过三层流水线和意图中心符号链实现叙事意图与渲染密度的精确控制,在保持事实完整性的同时提升描述强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01086 2026-07-02 cs.CV cs.AI 新提交 57%

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

LongVQUBench:评估视觉语言模型的长期视频质量理解能力

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出LongVQUBench基准,包含1200+长视频和1500个问题,通过三级评估(局部、跨事件、全局)和针孔失真问答范式,揭示现有LVLMs在长视频质量理解上的局限性。

Comments Accepted at European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 57%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 57%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00049 2026-07-02 cs.SE cs.AI 新提交 57%

Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study

在Scrum认证问题上提示GPT-5:一项实证准确性研究

Mirko Perkusich, Danyllo Albuquerque, João Paiva, Robson Vilar, Emanuel Dantas, Ademar França de Sousa Neto, Rohit Gheyi, Kyller Gorgônio, Angelo Perkusich

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本研究通过三种提示技术(零样本、思维链、带源引用)测试GPT-5在993个PSM认证问题上的准确性,发现所有提示均达到85%以上准确率,其中带源引用最佳(89.1%),并分析了错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00041 2026-07-02 cs.SE cs.AI 新提交 57%

ATM: CID-Brokered Pre-Write Admission for Multi-Agent Code Co-Synthesis

ATM:基于CID的预写准入机制用于多智能体代码协同合成

Eagl Huang

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。

Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交 57%

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00139 2026-07-02 cs.CL 新提交 57%

Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth

前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:基于人类专家真实标注的交叉评估框架

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Clayton W. Taylor, Ahmed Rashad

机构 * Perle AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出一个交叉评估框架,通过人类专家标注的103个提示-评分标准对,评估前沿LLM在埃及和伊拉克阿拉伯语文化与社会语言学知识上的表现,发现GPT-5.4是最可靠的自动评判者,文化任务比语言任务更难评分,且模型在埃及提示上表现优于伊拉克提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17041 2026-07-02 cs.CL cs.IR 新提交 57%

MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio

对Nature Portfolio元分析文章进行LLM代理基准测试

Anzhe Xie, Weihang Su, Yujia Zhou, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。

Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03137 2026-07-02 cs.AI 版本更新 57%

Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation

Think-Before-Speak: 从内部评估到多智能体社会模拟中的公开表达

Kaiqi Yang, Tai-Quan Peng, Sanguk Lee, Hui Liu

机构 * Michigan State University(密歇根州立大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出TBS框架,通过分离智能体的内部推理与公开话语生成,模拟从内部评估到公开表达的路径,并在气候政策讨论中验证其机制敏感性。

Comments 8 pages of main content, 14 pages including references and appendices, 3 figures. Accepted to the KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16432 2026-07-02 cs.CV cs.LG 版本更新 57%

IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video

IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准

Rasul Khanbayov, Mohamed Rayan Barhdadi, Erchin Serpedin, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10540 2026-07-02 cs.LG 版本更新 57%

FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

FusionFactory: 融合多LLM日志数据中的大语言模型能力

Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 变现人工智能) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。

Journal ref TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 50%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 推理评测 :reasoning(abstract)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00711 2026-07-02 cs.SE 新提交 50%

ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation

ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力

Zheng Fang, Dongming Jin, Yihong dong, Yongmin Li, Kechi Zhang, Zhi Jin, Ge Li

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00696 2026-07-02 cs.CV 新提交 50%

Imprint: Online Memory Compression for Long-Horizon Egocentric QA

Imprint: 面向长程自我中心问答的在线记忆压缩

Kousik Das, Debaditya Roy

机构 * IIT, Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出交互中心记忆框架Imprint,将长程自我中心记忆建模为在线压缩问题,利用人类记忆巩固信号选择性保留和压缩交互,在7天基准上提升QA准确率并大幅降低存储和检索开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 50%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 推理评测 :reasoning(abstract)

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31037 2026-07-02 cs.RO 新提交 50%

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Labimus: 化学实验室中类人灵巧操作的仿真与基准

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Jian Tang, Zhengping Che, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。

Comments Project page: https://labimus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏