MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification
MiroThinker-1.7 与 H1:通过验证实现重型研究代理
MiroMind Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, L. Wang, L. Wang, S. Wang, X. Wang, Y. Zhang, Z. Zhang, G. Chen, L. Chen, Z. Cheng, Y. Deng, Z. Huang, D. Ng, J. Ni, Q. Ren, X. Tang, B. L. Wang, H. Wang, N. Wang, C. Wei, Q. Wu, J. Xia, Y. Xiao, H. Xu, X. Xu, C. Xue, Z. Yang, Z. Yang, F. Ye, H. Ye, J. Yu, C. Zhang, W. Zhang, H. Zhao, P. Zhu
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
结构化语义遮蔽用于大型语言模型的对抗攻击
Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen
机构
*
Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡)
;
Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)
机构
*
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院)
;
Yuanpei College, Peking University(北京大学元培学院)
;
Department of Psychology, Sun Yat-sen University(中山大学心理学系)
;
State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
;
Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)
Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos
多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试
Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu
机构
*
Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系)
;
Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系)
;
College of Chemistry, Beijing Normal University(北京师范大学化学学院)
;
Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系)
;
Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning
ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测
Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Eastern Institute of Technology, Ningbo(宁波东部技术研究院)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Zhongguancun Academy(中关村学院)
The PokeAgent Challenge: Competitive and Long-Context Learning at Scale
PokeAgent挑战:在大规模中实现竞争性和长上下文学习
Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin
机构
*
Princeton(普林斯顿大学)
;
UT-Austin(得克萨斯大学奥斯汀分校)
;
CMU(卡内基梅隆大学)
;
NYU(纽约大学)
;
Google DeepMind(谷歌DeepMind)
;
Team Heatz(团队Heatz)
;
Team PA-Agent(团队PA-Agent)
;
Team FoulPlay(团队FoulPlay)
;
Team 4thLesson(团队4thLesson)
;
Team Q(团队Q)
;
Team Anthonys(团队Anthonys)
;
Team Hamburg(团队Hamburg)
;
Team Porygon2AI(团队Porygon2AI)
;
Team Deepest(团队Deepest)
;
Team August(团队August)
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding
SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解
Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen
机构
*
University of Waterloo(滑铁卢大学)
;
University of Toronto(多伦多大学)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
McGill University & MILA(麦吉尔大学及MILA)
;
Verdent AI, Inc.(Verdent AI公司)
AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis
AOI: 将失败轨迹转化为自主云诊断的训练信号
Pei Yang, Wanyi Chen, Asuka Yuxi Zheng, Xueqian Li, Xiang Li, Haoqin Tu, Jie Xiao, Yifan Pang, Dongdong Zhang, Fuqiang Li, Alfred Long, Lynn Ai, Eric Yang, Bill Shi
机构
*
Gradient
;
Soochow University(苏州大学)
;
UC Santa Cruz
;
Georgia Institute of Technology(佐治亚理工学院)
;
University College London(伦敦大学学院)
;
WeJoy
;
ByteDance(字节跳动)
ReGAIN: Retrieval-Grounded AI Framework for Network Traffic Analysis
ReGAIN:基于检索的网络流量分析人工智能框架
Shaghayegh Shajarian, Kennedy Marsh, James Benson, Sajad Khorsandroo, Mahmoud Abdelsalam
机构
*
Computer Science(计算机科学)
;
North Carolina A\&T State University(北卡罗来纳A&T州立大学)
;
Institute for Cyber Security(网络安全研究所)
;
University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)