VehAnchor: Metadata-Free Metric Scale Recovery from Vehicle Cues in Aerial Imagery
VANGUARD:用于GPS受限环境下的无人机车辆锚定地面采样距离估计
Yifei Chen, Chenqian Le, Jiayi Cheng, Xupeng Chen
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所)
;
Tandon School of Engineering, New York University(纽约大学工学院)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
DR-Arena:深度研究智能体的自动化评估框架
Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang
机构
*
National University of Singapore(国立新加坡大学)
;
Nanyang Technological University(南洋理工大学)
;
Singapore Management University(新加坡管理学院)
;
Singapore University of Technology and Design(新加坡科技设计大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
机构
*
Monash University(墨尔本大学)
;
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
Griffith University(格里菲斯大学)
;
Princeton University(普林斯顿大学)
;
Allen Institute for Artificial Intelligence(人工智能研究院)
A Patient Simulation Framework for Risk Assessment of Conversational Healthcare AI: Evaluation of an Antidepressant Decision Aid
通过患者模拟推进AI可信度:对抗抑郁药物选择的对话代理风险评估
Md Tanvir Rouf Shawon, Mohammad Sabik Irbaz, Hadeel R. A. Elyazori, Keerti Reddy Resapu, Yili Lin, Vladimir Franzuela Cardenas, K. Pierre Eklou, Farrokh Alemi, Kevin Lybarger
Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing
解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译
Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang
机构
*
State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)
;
Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation
TeachObs:多模态教学观察与模型评估的人工验证基准
Yeil Jeong, Youngjin Yoo, Jiyoung Bae, Seobin Sohn, Hyejin Han, Jinseo Lee, Howard Scott, Unggi Lee
机构
*
Indiana University Bloomington(印第安纳大学布卢明顿分校)
;
Pai Chai University(培才大学)
;
Seoul National University(首尔国立大学)
;
Ewha Womans University(成均馆大学)
;
University of Wolverhampton(沃尔夫汉普顿大学)
;
Korea University Sejong Campus(韩国大学世宗校区)
TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking
TrendFact:自动事实核查中热点感知的基准
Xiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
National University of Defense Technology(国防科学技术大学)
;
Northeastern University(东北大学)
;
East China Normal University(华东师范大学)
;
Beihang University(北京航空航天大学)
;
Tsinghua University(清华大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG
AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准
Qijie You, Wenkai Yu, Wentao Zhang
机构
*
University of Science and Technology Beijing(北京科技大学)
;
Peking University(北京大学)
;
Zhongguancun Academy(中关村学院)
;
Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
这是一个陷阱!面向网络代理的任务重定向说服基准
Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi
机构
*
University of Cambridge(剑桥大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
SocialOmni: 全模态模型中音视频社交互动性的基准测试
Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji
机构
*
Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室)
;
Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所)
;
School of Informatics, Xiamen University(厦门大学信息学院)
;
Sichuan Agricultural University(四川农业大学)
;
Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Chongqing University(重庆大学)
;
The University of Tokyo(东京大学)
;
Beihang University(北航)
;
Northwestern Polytechnical University(西北工业大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG
CausalRAG2: 面向RAG的分层因果知识图谱设计
Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary
机构
*
Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA)
;
Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI