When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning
大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败
Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao
机构
*
Institute of Science Tokyo(东京科学大学)
;
Osaka University(大阪大学)
;
NII LLMC(日本信息学研究所语言、语言学与媒体中心)
;
Nara Institute of Science and Technology(奈良科学技术研究所)
;
Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)
MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
MedClaw:用于长程手术视频推理的启发式智能体框架
Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang
机构
*
School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院)
;
University of Maryland(马里兰大学)
;
Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)
Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen
机构
*
Fudan University(复旦大学)
;
College of Future Information Technology(未来信息技术学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
推理评测
:reasoning(title,abstract);分类 cs.AI
AI总结
本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点
Teaching agentic AI to learn expert reasoning for rare disease diagnosis
LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体
Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler, Kevin W. Byram, Chih-Ting Yang, Fan Ma, Hua Xu, Wu-Chen Su, Chao Yan, Wei-Qi Wei, Adam Wright, Lisa Bastarache, Josh Peterson, Lingyao Li, Siyuan Ma, Undiagnosed Diseases Network, Rizwan Hamid, Thomas A. Cassini, Cathy Shyr
机构
*
Vanderbilt University(范德堡大学)
;
Vanderbilt University Medical Center(范德堡大学医学中心)
;
University of South Florida(南佛罗里达大学)
Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences
顺序很重要:LVLMs作为图像序列时间推理的评判者
Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes
机构
*
University of Bologna(博洛尼亚大学)
;
NOVA School of Science and Technology(NOVA科技学院)
;
NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models
CORDA:面向大语言模型的以伤害为核心的分层道德推理基准
Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计
Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue
机构
*
Scale AI
;
Emory University(埃默里大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Vanderbilt University Medical Center(范德堡大学医学中心)
;
Stanford School of Medicine(斯坦福医学院)
;
Stanford Health Care(斯坦福医疗保健系统)
;
Clinical Excellence Research Center(临床卓越研究中心)
Comments50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis
机构
*
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
;
Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心)
;
The University of Manchester(曼彻斯特大学)
;
School of Computer Science, Wuhan University(武汉大学计算机科学学院)
;
Mount Holyoke College(马歇尔学院)
;
Hefei University of Technology(合肥工业大学)
I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
机构
*
Beijing Jiaotong University(北京交通大学)
;
HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团)
;
MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)