arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-28 至 2026-07-28 共收录 209 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 49 篇

2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 62%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22592 2026-07-28 cs.AI cs.CL cs.IR 新提交 62%

Structure Over Scale: Schema-Constrained Causal Graphs for RAG

结构跨越尺度:用于检索增强生成的模式约束因果图

Marc Saouda, Rajprakash Bale, Eren Aldis, Cloves Almeida

机构 * Boston Consulting Group(波士顿咨询集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10156 2026-07-28 cs.IR cs.AI cs.CL 版本更新 62%

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

$τ$-Rec:面向智能推荐系统的可验证基准

Bharath Sivaram Narasimhan, Karthik R Narasimhan

机构 * Independent Researcher(独立研究员) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。

Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05792 2026-07-28 cs.AI cs.LG cs.LO cs.SE 62%

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

LLM 能写出正确的 TLA+ 规范吗?自然语言到 TLA+ 生成的评估

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约奈大学芝加哥分校计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估基于 LLM 从自然语言合成 TLA+ 规范的能力,发现模型在语义正确性上仅达 8.6%,且成功依赖于渐进式提示,揭示了模型大小与质量无关、代码专用模型表现不佳等关键发现。

Comments 12 pages, 11 tables. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026); Recommended as Best Paper Award Candidate

Journal ref ICSOFT 2026, pp. 39-50, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05515 2026-07-28 cs.AI cs.CL cs.CV 版本更新 62%

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic Centrum Wiskunde \& Informatic Leiden University University College London Vrije University of Amsterdam Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University Vrije University of Amsterdam Centrum Wiskunde \& Informatic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。

Comments This version has been accepted by ICMI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 57%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 57%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 57%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24054 2026-07-28 cs.AI 新提交 57%

Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

成功并非不言自明:在智能体评估中审核成功溯源

Jingkun Luo, Da-Tian Peng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究智能体评估中成功溯源问题,通过AcquaBench的匹配值替换和聚类分析审核,在不同场景测试,发现成功与正确值相关,行为依赖可能超出预期,模型比较有分数差距变化,建议基准报告成功及信息状态支持情况。

Comments 17 pages, 3 figures, including supplementary material. Code: https://github.com/luojingkun22/acquabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-07-28 cs.CL 新提交 57%

Zing: Social Mind for LLMs

Zing:大语言模型的社交智能

Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23386 2026-07-28 cs.AI 新提交 57%

Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation

确信错误:前沿大语言模型规则评估中的异常链崩溃

Paul Simpson, John Kozak, Lisa Doake

机构 * Aethis

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。

Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23123 2026-07-28 cs.AI 新提交 57%

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试

Summer Sun

机构 * Shaqiu Community(沙丘社区)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。

Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 57%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22598 2026-07-28 cs.CY cs.AI cs.HC 新提交 57%

A didactical-driven teacher assistant for a dimensional modeling course

面向维度建模课程的教学驱动型教师助手

Laurent Brisson, Maria Segarra, Grégory Smits

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对维度建模课程,提出教学驱动型教师助手,无需商业大语言模型预算或GPU设施。架构含确定性模块处理多任务,大语言模型作语言执行器。评估学生问题发现标准检索不足,确定性管道精度高但覆盖有限,为教学策略提供新思路。

Journal ref International Conference on Computer Supported Education, May 2026, Benidorm/Spain, France. pp.177-189

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22566 2026-07-28 cs.AI 新提交 57%

MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models

MedLoCoMo:用于大语言模型的长上下文多会话医学对话基准

Zeyu Zhang, Ziqing Wang, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多入院医学对话临床推理方面的不足,构建MedLoCoMo基准,通过特定方法生成问答项目,含100个患者时间线,发现跨入院推理比局部证据使用难,提供代码和基准供使用与复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18985 2026-07-28 cs.AI 版本更新 57%

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24941 2026-07-28 cs.SD cs.AI 版本更新 57%

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线

Wai Laam Mak, Isibor Kennedy Ihianle, Pedro Machado

机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。

Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23356 2026-07-28 cs.CL cs.HC 版本更新 57%

VeriLLMed: Interactive Visual Debugging of Medical Large Language Models with Knowledge Graphs

VeriLLMed: 基于知识图谱的医疗大语言模型交互式可视化调试

Yurui Xiang, Xingyi Mao, Rui Sheng, Zixin Chen, Zelin Zang, Yuyang Wu, Haipeng Zeng, Huamin Qu, Yushi Sun, Yanna Lin

机构 * IEEE

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出VeriLLMed系统,通过整合外部生物医学知识,帮助开发者审计和调试医疗大语言模型的诊断推理过程,识别三种常见诊断错误类型,提升模型可靠性。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21003 2026-07-28 cs.AI 版本更新 57%

Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models

贝叶斯-LoRA:大型语言模型的概率低秩适应

Moule Lin, Shuhao Guan, Andrea Patane, David Gregg, Goetz Botterweck

机构 * School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) School of Computer Science, University College Dublin, Dublin, Ireland(都柏林大学学院计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出贝叶斯-LoRA,通过概率低秩表示改进LoRA,提升模型校准性,在多个常识推理基准中实现84%的ECE和76%的NLL减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21947 2026-07-28 cs.CL 版本更新 57%

Algorithmic Blindness in Large Language Models: A Calibration Study of Performance Prediction

大语言模型是算法上盲目

Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote

机构 * School of Computer Engineering, Manipal Institute of Technology, Bengaluru, India(马尼帕尔理工学院计算机工程学院,班加罗尔,印度)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型在算法推理上存在系统性失败,主要贡献是揭示了算法盲目的本质,即声明性知识与校准过程预测之间的差距。

Comments Code available at https://github.com/sohv/algorithmic-blindness

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09001 2026-07-28 cs.CL 版本更新 57%

Entropy Sentinel: Probing Entropy Traces for LLM Monitoring

熵哨兵:基于STEM解码熵迹的连续LLM准确性监控

Pedro Memoli Buffa, Luciano Del Corro

机构 * Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出利用输出熵迹作为推理时信号,通过轻量分类器预测实例正确性并聚合为领域级准确性估计,在STEM推理基准上验证了其用于监控和数据采集的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 57%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 57%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23972 2026-07-28 cs.CV 新提交 50%

Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化

Yu Li, Wengan He, Wenhui Xu, Lihong Jiang, Fan Xiao, Zhuohang Huang, Yuanzhu Liang, Jiayi Liu, Yuxi Chen, Yongsheng Luo

专题命中 推理评测 :reasoning(abstract)

AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。

Comments Survey paper, 77 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23920 2026-07-28 cs.CV 新提交 50%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23355 2026-07-28 cs.SE 新提交 50%

Enhancing Code Understanding for Impact Analysis by Combining Transformers and Program Dependence Graphs

通过结合Transformer和程序依赖图增强代码理解以进行影响分析

Yanfu Yan, Nathan Cooper, Kevin Moran, Gabriele Bavota, Denys Poshyvanyk, Steve Rich

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对影响分析这一软件维护任务,提出Athena方法,结合软件系统依赖图信息与概念耦合方法,无需更改历史和执行信息。构建新基准测试,实验表明该方法在新基准上表现出色,比简单基线有显著性能提升。

Comments Accepted to FSE'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23132 2026-07-28 cs.CV 新提交 50%

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 50%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14382 2026-07-28 cs.CV 版本更新 50%

StAR: Segment Anything Reasoner

StAR:分段任何推理器

Seokju Yun, Dongheon Lee, Noori Bae, Jaesung Jun, Chanseul Cho, Youngmin Ro

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出StAR框架,通过多角度优化提升分割性能,并首次引入并行测试时间扩展,构建ReasonSeg-X数据集以评估高级方法。

Comments ECCV 2026 / Code: https://github.com/ysj9909/StAR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 30 篇

2605.26795 2026-07-28 cs.AI 版本更新 85%

What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation

链式思维在探测时为何有效?局部共现而非全局推导

Xiang Wang, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 研究链式思维提示在探测时提升语言模型准确率的原因,发现增益主要来自词汇激活和短距离标记共现,而非句子级逻辑推导。

详情

展开后加载摘要…

URL PDF HTML 收藏