Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling
从测试时缩放的视角理解在线策略蒸馏
Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao
机构
*
Hong Kong Baptist University(香港浸会大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Ant Group(蚂蚁集团)
The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
自我进化临床系统之路:将医疗智能体从辅助扩展到自主
Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin
机构
*
Hunan University(湖南大学)
;
ByteDance(字节跳动)
;
Duke University(杜克大学)
;
Westlake University(西湖大学)
;
The University of Hong Kong(香港大学)
;
Nanyang Technological University(南洋理工大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Macau(澳门大学)
;
The Ohio State University(俄亥俄州立大学)
Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs
强化步骤级推理以实现大语言模型的有效自校正
Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan
机构
*
Nanyang Technological University(南洋理工大学)
;
National University of Singapore(新加坡国立大学)
;
VinUniversity
;
Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
BiomedSQL: Text-to-SQL for Scientific Reasoning on Biomedical Knowledge Bases
BiomedSQL: 文本到SQL用于生物医学知识库上的科学推理
Mathew J. Koretsky, Maya Willey, Owen Bianchi, Chelsea X. Alvarado, Tanay Nayak, Nicole Kuznetsov, Sungwon Kim, Mike A. Nalls, Daniel Khashabi, Faraz Faghri
机构
*
Center for Alzheimer’s and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国立卫生研究院)
;
DataTecnica LLC(DataTecnica公司)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国立卫生研究院)
Comments17 pages, 10 figures. Includes an exact F-test for non-transportability with verified size and power, its precision-whitened generalisation, and a foreign-exchange case where the null hypothesis is known analytically rather than estimated
CommentsAn earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard
Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen
机构
*
Fudan University(复旦大学)
;
College of Future Information Technology(未来信息技术学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
推理评测
:reasoning(title,abstract);分类 cs.AI
AI总结
本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点
Teaching agentic AI to learn expert reasoning for rare disease diagnosis
LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体
Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler, Kevin W. Byram, Chih-Ting Yang, Fan Ma, Hua Xu, Wu-Chen Su, Chao Yan, Wei-Qi Wei, Adam Wright, Lisa Bastarache, Josh Peterson, Lingyao Li, Siyuan Ma, Undiagnosed Diseases Network, Rizwan Hamid, Thomas A. Cassini, Cathy Shyr
机构
*
Vanderbilt University(范德堡大学)
;
Vanderbilt University Medical Center(范德堡大学医学中心)
;
University of South Florida(南佛罗里达大学)
SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives
SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试
Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang
机构
*
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Washington University in St. Louis(华盛顿大学圣路易斯分校)
;
University of California, Berkeley(加州大学伯克利分校)