Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定
Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li
机构
*
Beijing Institute of Technology, Beijing, China(北京理工大学)
;
National University of Singapore, Singapore(新加坡国立大学)
;
Tsinghua University, Beijing, China(清华大学)
;
The Hong Kong Polytechnic University, Hong Kong(香港理工大学)
Multi-Fidelity Learning with Shallow Recurrent Decoders for Multi-Physics Applications
基于浅层循环解码器的多保真度学习在反应堆物理中的应用
Stefano Riva, Carolina Introini, J. Nathan Kutz, Antonio Cammi
机构
*
Autodesk Research(Autodesk研究院)
;
Department of Energy, Nuclear Engineering Division(能源部核工程系)
;
Politecnico di Milano(米兰理工大学)
;
Department of Mechanical and Nuclear Engineering and Emirates Nuclear Technology Center(机械与核工程系和阿联酋核技术中心)
Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents
智能体不仅会认同,还会记忆:对有状态个人智能体中持续谄媚行为的基准测试
Xutao Mao, Liangjie Zhao, Leyao Wang, Rui Qian, Qiang Huang, Wentao Wang, Bo Han, Xiang Zheng, Cong Wang
机构
*
City University of Hong Kong(香港城市大学)
;
ByteDance(字节跳动)
;
Yale University(耶鲁大学)
;
Fudan University(复旦大学)
;
Hong Kong Baptist University(香港浸会大学)
;
Dalian University of Technology(大连理工大学)
BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science
BioProBench: 一个全面的数据集和生物协议理解与推理基准
Yuyang Liu, Liuzhenghao Lv, Xiancheng Zhang, Jingya Wang Li Yuan, Yonghong Tian
机构
*
School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
;
School of Chemical Biology&Biotechnology, Peking University(北京大学化学生物学与生物技术学院)
When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation
超越表面判断:LLM生成虚假信息的人类基础风险评估
Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma
机构
*
Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)
;
Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)
;
City University of Hong Kong(香港城市大学)
;
Deakin University(迪肯大学)
Comments9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks
DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks
DSBench:用于评估外部和车内风险的综合基准测试
Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Xiaomi EV(小米电动车)
;
Fudan University(复旦大学)
;
Xidian University(西安电子科技大学)
;
South China University of Technology(华南理工大学)
;
The University of Hong Kong(香港大学)
Can We Trust Item Response Theory for AI Evaluation?
我们能信任项目反应理论进行人工智能评估吗?
Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang
机构
*
Johns Hopkins University(约翰·霍普金斯大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of California, Los Angeles(加利福尼亚大学洛杉矶分校)