arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-14 至 2026-08-14 共收录 125 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 15 篇

2608.12585 2026-08-14 cs.AI 新提交 87%

Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces

推理评审团:用于评估推理轨迹的多模型共识机制

Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu, Mahdi Namazifar

机构 * Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :reasoning(title,summary_cn);分类 cs.AI

AI总结 本研究提出Reasoning Jury系统,以多LLM评审团及调控共识机制替代单模型评审员,其识别推理缺陷的准确率显著优于前沿模型,且开销仅为后者的8%-15%,还可用于理解推理LLM的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12836 2026-08-14 cs.CL cs.AI 新提交 76%

From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options

从原子证据到逻辑组合:针对复合答案选项的结构化组合推理

Obed Junias, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型处理复合逻辑答案选项时的失败问题,提出了一种分解原子判断并结合整数线性规划的框架,在LOGICAL-COMMONSENSEQA和LOGICAL-SATA基准上显著提升了宏F1指标。

Comments 21 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13228 2026-08-14 cs.AI cs.LG 新提交 62%

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试

Saveliy Batruin

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13160 2026-08-14 cs.CL cs.AI 新提交 62%

Better Decomposition, Free Aggregation: A Synthesizer-Folding Framework for Multilingual Multi-Hop Question Answering

更好的分解,自由聚合:面向多语言多跳问答的合成器折叠框架

Yilin Wang, Yuchun Fan, Weidong Bao, Zili Wei, Shi Feng, Tong Xiao, Zhengtao Yu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Kunming University of Science and Technology(昆明理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言多跳问答中现有方法的翻译噪声与错误放大问题,提出Syfer框架,通过推迟翻译、格式受限分解与质量检查实现性能与成本的良好平衡。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12322 2026-08-14 cs.CL cs.AI 新提交 62%

What Drives LLM Self-Reflection? A Controlled Ablation of Uncertainty Routing in Armed Conflict Forecasting

什么驱动了大语言模型(LLM)的自我反思?武装冲突预测中不确定性路由的受控消融研究

Poli Nemkova, Haeshitha Indukuri

机构 * University of North Texas(北得克萨斯大学) College of Computer Science and Engineering(计算机科学与工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过受控消融实验发现,武装冲突预测中LLM自我反思的增益源于类型化行动路由,而非诊断支架或分类学术语,且该机制在GPT-4o上复现,增益集中于结构新颖的冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10560 2026-08-14 cs.MA cs.AI cs.CL 版本更新 62%

Learning Latency-Aware Orchestration for Multi-Agent Systems

学习面向延迟的并行多智能体系统编排

Xi Shi, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LAMaS框架,通过显式优化关键路径降低多智能体系统并行执行的延迟,提升效率和性能。

Comments Preprint. Previously this version appeared as arXiv:2607.13359 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12351 2026-08-14 cs.CY cs.AI 新提交 57%

Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection

生成式人工智能(GenAI)时代的评估设计:用于测试学生AI素养、学习成果与反思的X1-X2-X3评估模式

Riasat Islam, Thomas Roelleke

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文针对GenAI对在线评估的挑战,提出可复用的X1-X2-X3评估模式,用于测试学生AI素养等,为教师适配GenAI时代评估提供实践指导。

Comments 30 pages, 1 figure, 11 tables. Submitted to the following journal: Assessment & Evaluation in Higher Education (Taylor & Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12338 2026-08-14 cs.CL 新提交 57%

SDAM: Structure-Difference-Aware Memory Evolution for Complex Text-to-SQL

SDAM:面向复杂文本转SQL的结构差异感知记忆演化

Keyan Xu, Dingzirui Wang, Xuanliang Zhang, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对现有文本转SQL记忆设计的缺陷,提出SDAM方法,集成至SDAM-SQL框架,在BIRD-dev和Spider-test数据集上实现指标提升,验证了方法有效性。

Comments 19 pages, 5 figures, 12tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12326 2026-08-14 cs.CL 新提交 57%

On Measuring Semantic Preservation in Legal Ontology Learning

论法律本体学习中的语义保留度量

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文针对法律本体学习的语义保留评估问题,提出通过对比LLM在源文档与转换后表示上的任务性能量化语义损失,经多模型多方法实验发现语义损失随模型-方法配对显著变化,为法律知识系统配置选择提供指导。

Comments Accepted for publication at the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10840 2026-08-14 cs.LG 版本更新 57%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22366 2026-08-14 cs.CL 57%

Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models

Max Malyi, Jonathan Shek, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13384 2026-08-14 cs.IR cs.DB 新提交 50%

Structure then Query: Enabling Precise Analytical Queries over Unstructured Documents

先结构后查询:支持对非结构化文档进行精确分析查询

Teng Lin, Yuyu Luo, Nan Tang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AnnoIndex通过注释索引与结构化查询引擎,解决非结构化文档精确分析查询难题,在三个数据集上平均F1达0.87,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 50%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12533 2026-08-14 physics.ed-ph 新提交 50%

Probing AI-generated physics solutions and preparing students to critique them

探究人工智能生成的物理解答并培养学生对其进行评判的能力

Nikhil Sanjay Borse, Amir Bralin, Sean Savage, N. Sanjay Rebello

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。

Comments 6 pages, 1 figure, Physics Education Research Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 27 篇

2608.13239 2026-08-14 cs.CV 新提交 88%

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12779 2026-08-14 cs.CL cs.AI cs.IR 新提交 84%

CRAFT: LLM-Based Iterative Refinement for Temporal Reasoning over Clinical Narratives

CRAFT:基于大语言模型的迭代优化用于临床叙事的时间推理

Chengyang He, Tahreem Arif, Marko Zivkovic, Lijing Wang, Yue Ning, Ping Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Genesis Research Group(创世纪研究集团) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对临床叙事中时间锚点稀疏导致的症状轨迹重建难题,提出基于大语言模型的CRAFT框架,通过生成器与约束验证器迭代优化,在MedTempo基准上提升了时间排序准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 82%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13476 2026-08-14 cs.AI cs.CL 新提交 81%

MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination

MARC v1:一个用于临床AI推理与协作的开源多智能体框架

Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出开源多智能体框架MARC v1,以确定性多智能体编排替代整体式LLM提示用于临床推理,含角色专业化智能体与分解器模块,支持多部署方式,具备模型无关、可解释等特性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新 81%

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13309 2026-08-14 cs.CV 新提交 78%

How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?

基础模型在纵向MRI疾病进展推理中的表现如何?

Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura, Omkar Thawakar, Numan Saeed, Dana Al Nuaimi, Ajnas Alkatheeri, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Health Abu Dhabi(阿布扎比卫生部) Fatima College of Health Sciences(法蒂玛健康科学学院) Linköping University(林雪平大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究推出Time-Aware Multi-View MRI基准,评估16个视觉-语言模型在纵向MRI疾病进展推理中的表现,发现模型在变化方向识别等方面存在缺陷,多视角输入对模型性能有特定影响。

Comments Accepted at MICCAI 2026 (Early Accept). 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13326 2026-08-14 cs.CL 新提交 74%

Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计

Junhao Luo, Ning Huang, Ziqi Sha, Wenxuan Tang, Wei Deng

机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。

Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13420 2026-08-14 cs.AI 新提交 70%

Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

通过小型语言模型(SLMs)与边缘计算增强虚拟智能体:对思考与记忆过程的探索性评估

Aimilios Hadjiliasi, Louis Nisiotis

机构 * University of Central Lancashire(中央兰开夏大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探索利用SLMs与边缘计算支持CEAA的“思考”“记忆”组件,在NVIDIA Jetson Orin NX上用Qwen2.5模型开发边缘虚拟智能体网关,经模拟实验验证其可高效运行部分CEAA过程,助力沉浸式虚拟世界具身智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 67%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-14 cs.CV 新提交 67%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 67%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25821 2026-08-14 cs.CL cs.AI cs.LG cs.MA 版本更新 67%

Doctorina MedBench: A Dialogue-Based Benchmark and Evaluation Framework for Agent-Based Medical AI

Doctorina MedBench:基于真实医患交互的医疗AI端到端评估框架

Anna Kozlova, Stanislau Salavei, Pavel Satalkin, Hanna Plotnitskaya, Sergey Parfenyuk, Andy Nkansah

机构 * A.I. Doctor Medical Assist LTD(A.I. Doctor Medical Assist有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Doctorina MedBench通过模拟真实医患对话评估医疗AI系统,包含诊断、观察、治疗和步骤计数四项指标,用于评估临床正确性和对话效率,同时支持多层级测试和质量监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13558 2026-08-14 cs.AI cs.CL 新提交 62%

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

OmniScientist:一种全模态全学科的AI科学家

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。

Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12345 2026-08-14 cs.AI cs.CL 新提交 62%

Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists

评估大型语言模型作为合作科学家的研究完整性的诊断基础

Yash Tripathi, Silu Sharma, Sai Sidhanth Manoharan Jayanthi, Shivank Garg, Lin Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出IntegrityBench基准评估LLM作为合作科学家的研究完整性,发现前沿模型在峰值压力下约三分之一的完整性关键决策失败,存在助长不当行为和侵蚀AI辅助研究信任的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏