arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2605.00116 2026-05-04 cs.CL cs.AI cs.LG 67%

ViLegalNLI: Natural Language Inference for Vietnamese Legal Texts

ViLegalNLI:越南法律文本的自然语言推理

Nhung Thi-Hong Duong, Mai Ngoc Ho, Tin Van Huynh, Kiet Van Nguyen

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ViLegalNLI,首个针对法律领域构建的越南语自然语言推理数据集,包含42,012个前提-假设对,涵盖多种法律领域,用于评估法律推理的结构逻辑与术语一致性。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO 67%

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16422 2026-04-21 cs.CL cs.AI cs.LG 67%

Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG

Jaafer Klila, Sondes Bannour Souihi, Rahma Boujelben, Nasredine Semmar, Lamia Hadrich Belguith

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过持续预训练和GraphRAG两种方法将结构化生物医学知识注入语言模型,提升其在生物医学领域的表现,实验显示BERTUMLS在知识密集型问答任务中表现优异,GraphRAG在PubMedQA和BioASQ上提升显著。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 67%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14216 2026-04-17 cs.MM cs.AI cs.CL cs.CV cs.GR cs.LG 67%

Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis

Neuro-Oracle:一种具有轨迹意识的代理RAG框架用于可解释性癫痫手术预后

Aizierjiang Aiersilan, Mohamad Koubeissi

机构 * The George Washington University(乔治华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Neuro-Oracle框架,通过三维Siamese对比编码器提取术前术后MRI变化,检索历史相似手术轨迹,并利用量化Llama-3-8B推理代理生成自然语言预后,验证了轨迹意识检索架构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 67%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14664 2026-04-17 cs.SD eess.AS 67%

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

SpeechLLM-as-Judges: 向通用和可解释的语音质量评估迈进

Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SpeechLLM-as-Judges框架,利用大语言模型进行结构化语音质量评估,构建了包含多语言语音片段的SpeechEval数据集,并开发了SQ-LLM模型,在多种任务和语言上表现出色。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11970 2026-04-15 cs.CV cs.AI cs.CL cs.LG 67%

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) Punjabi University(旁遮普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM 67%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 67%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13047 2026-04-14 cs.CL cs.AI cs.LG 67%

Multi-Model Synthetic Training for Mission-Critical Small Language Models

多模型合成训练用于关键任务小型语言模型

Nolan Platt, Pragyansmita Nayak

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用多模型生成技术,将AIS数据转化为问答对,训练出准确率达75%的低成本小型模型,为专业领域AI应用提供可复现的合成数据生成框架。

Comments 8 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03336 2026-04-14 cs.AI cs.CL cs.LG 67%

Disambiguation-Centric Finetuning Makes Enterprise Tool-Calling LLMs More Realistic and Less Risky

以消歧为核心的知识蒸馏使企业工具调用LLM更真实且更安全

Ashutosh Hathidara, Julien Yu, Sebastian Schreiber

机构 * SAP Labs(SAP实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DiaFORGE框架,通过三阶段流程提升企业工具调用LLM的准确性和安全性,实验显示其在工具调用成功率上优于GPT-4o和Claude-3.5-Sonnet。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18931 2026-04-14 cs.AI cs.CL cs.LG 67%

Can Large Language Models Infer Causal Relationships from Real-World Text?

大语言模型能否从现实文本中推断因果关系?

Ryan Saklad, Aman Chadha, Oleg Pavlov, Raha Moraffah

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大语言模型能否从现实文本中推断因果关系,构建了首个现实世界数据集,发现最佳模型在因果推断上的F1分数仅为0.535。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09554 2026-04-14 cs.AI cs.CL cs.LG 67%

LABBench2: An Improved Benchmark for AI Systems Performing Biology Research

LABBench2:一种改进的AI系统进行生物研究的基准测试

Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques

机构 * Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LABBench2,一个包含近1900个任务的改进基准,用于评估AI在真实世界中执行科学任务的能力,展示了当前前沿模型在不同子任务上的性能差异,并提供了数据集和评估工具以促进社区使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV 67%

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);CoT(abstract)

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07274 2026-04-09 cs.CL cs.AI cs.LG 67%

A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering

检索增强医疗问答中检索流程设计的系统研究

Nusrat Sultana, Abdullah Muhammad Moosa, Kazi Afzalur Rahman, Sajal Chandra Banik

机构 * Department of Mechatronics & Industrial Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机电与工业工程系) Department of Mechanical Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机械工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统评估了检索增强医疗问答的性能,发现检索增强显著提升了零样本医疗问答效果,最佳配置为密集检索加查询改写和重排序,准确率达60.49%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA 67%

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20983 2026-04-08 cs.CL cs.AI cs.LG 67%

Automatic Replication of LLM Mistakes in Medical Conversations

医疗对话中大语言模型错误的自动复制

Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko, Razvan Marinescu

机构 * Lumos AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedMistake自动管道,通过提取医疗对话中LLM的错误生成单次问答对,构建基准测试集,验证了GPT、Claude和Grok在医疗问答任务中的最佳性能。

Comments 48 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04456 2026-04-07 cs.AI cs.CL cs.LG 67%

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

基于受控扰动的理性稳定性经验表征

Abu Noman Md Sakib, Zhensen Wang, Merjulah Roby, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系) Department of Mechanical, Aerospace, and Industrial Engineering, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校机械、航空航天与工业工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新指标评估模型解释的一致性,通过BERT等预训练模型和SHAP计算特征重要性,检测模型在相似输入下是否保持一致的推理行为。

Comments 28th International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01259 2026-04-03 cs.RO 67%

Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models

Bench2Drive-VL: 用于基于视觉语言模型的闭环自动驾驶的基准测试

Xiaosong Jia, Yuqian Shao, Zhenjie Yang, Qifeng Li, Zhiyuan Zhang, Junchi Yan

机构 * Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身智能重点实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Bench2Drive-VL,通过闭环评估方法提升视觉语言模型在自动驾驶中的性能,包含DriveCommenter生成多样化问题对、统一协议接口、灵活推理框架及完整开发生态,开源代码和标注数据。

Comments All codes and annotated datasets are available at \url{https://github.com/Thinklab-SJTU/Bench2Drive-VL} and \url{https://huggingface.co/datasets/Telkwevr/Bench2Drive-VL-base}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18123 2026-04-03 cs.CV cs.AI cs.CL cs.LG 67%

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

偏差是子空间,而非坐标:视觉-语言模型中事后去偏的几何重思

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SPD框架,通过几何方法识别并去除线性可解码的偏子空间,提升视觉-语言模型的公平性与任务性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20836 2026-04-02 cs.CL cs.AI cs.LG 67%

Structured Prompts Improve Evaluation of Language Models

结构化提示提升语言模型评估

Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过结构化提示方法评估语言模型,发现其能显著提升性能并改变排名,首次系统整合结构化提示至评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV 67%

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV 67%

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21643 2026-03-31 cs.CV 67%

Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation

Omni-Weather: 一种统一的多模态模型用于天气雷达理解和生成

Zhiwang Zhou, Yuandong Pu, Xuming He, Yidi Liu, Yixin Chen, Junchao Gong, Xiang Zhuang, Wanghan Xu, Qinglong Cao, Shixiang Tang, Yihao Liu, Wenlong Zhang, Lei Bai

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) UCLA(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 Omni-Weather通过统一架构整合天气生成与理解,采用共享自注意力机制和因果推理数据集提升生成质量与可解释性,实验显示其在天气生成和理解上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26730 2026-03-31 cs.RO 67%

Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming

为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示

Sanjay Oruganti, Sergei Nirenburg, Marjorie McShane, Jesse English, Michael Roberts, Christian Arndt, Ramviyas Parasuraman, Luis Sentis

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV 67%

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23539 2026-03-26 cs.AI cs.CL cs.LG nlin.AO 67%

PLDR-LLMs Reason At Self-Organized Criticality

PLDR-LLMs 在自组织临界性中进行推理

Burc Gokden

机构 * Fromthesky Research Labs LLC(Fromthesky研究实验室 LLC)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PLDR-LLMs 在自组织临界状态下展现出推理能力,其推理输出与二级相变特征相似,通过全局统计参数量化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23125 2026-03-25 cs.IR 67%

From Questions to Trust Reports: A LLM-IR Framework for the TREC 2025 DRAGUN Track

从问题到信任报告:一种用于TREC 2025 DRAGUN赛道的LLM-IR框架

Ignacy Alwasiak, Kene Nnolim, Jaclyn Thi, Samy Ateia, Markus Bink, Gregor Donabauer, David Elsweiler, Udo Kruschwitz

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出一种结合LLM生成问题与语义过滤的框架,用于生成信任报告,通过改进检索和重排序提升相关性和可信度。

Comments TREC 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏