arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-05-12 至 2026-05-12 共收录 22
2605.10912 2026-05-12 cs.CL

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10748 2026-05-12 cs.LG cs.AI

Provable Sparse Inversion and Token Relabel Enhanced One-shot Federated Learning with ViTs

可证明的稀疏反向与令牌重标记增强的一次联邦学习与ViTs

Li Shen, Xiaolei Hao, Qinglun Li, Xiaochun Cao, Zhifeng Hao, Xun Yang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) University of Science and Technology of China(中国科学技术大学) Shantou University(汕头大学)

AI总结 本文提出FedMITR框架,通过稀疏模型反向和令牌重标记解决非IID数据下的联邦学习问题,提升模型泛化能力。

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10230 2026-05-12 cs.LG

FORGE: Fragment-Oriented Ranking and Generation for Context-Aware Molecular Optimization

FORGE:面向上下文的分子优化片段排序与生成

Qingchuan Zhang, He Cao, Hao Li, Yanjun Shao, Zhiyuan Liu, Shihang Wang, Shufang Xie, Shenghua Gao, Xinwu Ye

机构 * University of Science and Technology of China(中国科学技术大学) International Digital Economy Academy(国际数字经济学院) Peking University(北京大学) Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) Macao Polytechnic University(澳门理工学院) Zhongguancun Academy(中关村学院) University of Hong Kong(香港大学)

AI总结 FORGE通过上下文感知的局部编辑方法改进分子结构,在保持起始化合物相似性的同时,利用自动挖掘的低到高编辑对进行片段排序与生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10218 2026-05-12 cs.CL

Relative Score Policy Optimization for Diffusion Language Models

相对分数策略优化用于扩散语言模型

Zichao Yu, Shengze Xu, Bingqing Jiang, Wenyi Zhang, Difan Zou

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26680 2026-05-12 cs.CL cs.AI

AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment

AlpsBench: 一个面向真实对话记忆与偏好对齐的LLM个性化基准

Jianfei Xiao, Xiang Yu, Chengbing Wang, Wuqiang Zheng, Xinyu Lin, Kaining Liu, Hongxun Ding, Yang Zhang, Wenjie Wang, Fuli Feng, Xiangnan He

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 AlpsBench通过真实人类与LLM对话数据构建,包含2500个长期交互序列及验证的记忆,评估个性化信息提取、更新、检索与利用等核心任务,揭示LLM在记忆管理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07756 2026-05-12 cs.CV

Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation

随机性的确定性:提示残差种子塑形用于扩散生成

Song Yan, Wei Zhai, Chenfeng Wang, Xinliang Bi, Jian Yang, Yancheng Cai, Yusen Zhang, Yunwei Lan, Tao Zhang, GuanYe Xiong, Min Li, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) Li Auto Inc.(利亚自动化公司) Xi’an High-tech Research Institute(西安高新技术研究院) Wechat Vision(微信视觉) Cambridge University(剑桥大学) HUST(华中科技大学)

AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09993 2026-05-12 cs.LG

Learning Graph Foundation Models on Riemannian Graph-of-Graphs

在黎曼图-图上学习图基础模型

Haokun Liu, Zezhong Ding, Xike Xie

机构 * School of Biomedical Engineering, University of Science and Technology of China (USTC), Suzhou, Jiangsu, China(生物医学工程学院,中国科学技术大学(USTC),苏州,江苏,中国) Data Darkness Lab, Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu, China(Data Darkness实验室,苏州市先进研究院,USTC,苏州,江苏,中国) School of Artificial Intelligence and Data Science, USTC, Hefei, Anhui, China(人工智能与数据科学学院,USTC,合肥,安徽,中国)

AI总结 本文提出R-GFM,一种基于黎曼图-图的图基础模型,通过多尺度图-图结构建模,提升结构域泛化性能,在多个数据集上取得最佳表现,下游任务相对提升达49%。

Comments This paper has been accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09956 2026-05-12 cs.CV cs.AI

SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis

SDTalk: 结构化面部先验与双分支运动场用于通用化的高斯说话头合成

Peng Jia, Zhen Xiao, Jia Li, Xueliang Liu, Zhenzhen Hu, Lingyun Yu

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 SDTalk通过结构化面部先验和双分支运动场,实现无需个性化训练的通用高斯说话头合成,提升视觉质量和推理效率。

Comments 5 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09765 2026-05-12 cs.LG cs.AI

WISTERIA: Learning Clinical Representations from Noisy Supervision via Multi-View Consistency in Electronic Health Records

WISTERIA:通过电子健康记录中的多视图一致性学习临床表示

Ruan Dong, Yuanyun Zhang, Shi Li

机构 * University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学)

AI总结 WISTERIA通过多视图一致性学习电子健康记录中的临床表示,利用弱监督学习框架,改进预测性能并增强对标签噪声的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09539 2026-05-12 cs.CL

TacoMAS: Test-Time Co-Evolution of Topology and Capability in LLM-based Multi-Agent Systems

TacoMAS: 在基于大语言模型的多智能体系统中拓扑与能力的测试时间共演

Chen Xu, Yicheng Hu, Ruizi Wang, Xinyu Lin, Wenjie Wang, Dongrui Liu, Fuli Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 TacoMAS通过联合调整拓扑和能力,以不同时间尺度优化多智能体系统,实验表明其在四个基准测试中优于20个基线模型,平均提升13.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07357 2026-05-12 cs.AI

GraphReAct: Reasoning and Acting for Multi-step Graph Inference

GraphReAct:多步图推断中的推理与行动

Xingtong Yu, Zhongwei Kuai, Chang Zhou, Xuanting Xie, Renhe Jiang, Xikun Zhang, Hong Cheng, Xinming Zhang, Yuan Fang

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) The University of Tokyo(东京大学) RMIT University(皇家墨尔本理工大学) Singapore Management University(新加坡管理学院)

AI总结 GraphReAct通过结合推理与行动,提升图数据的多步推断能力,通过拓扑和语义检索及上下文精炼实现信息逐步扩展与压缩,实验表明其优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13131 2026-05-12 cs.AI

MineEvolve: Self-Evolution with Accumulated Knowledge for Long-Horizon Embodied Minecraft Agents

MineEvolve: 基于积累知识的长周期具身Minecraft智能体自进化

Zhengwei Xie, Zhisheng Chen, Ziyan Weng, Jinhan Li, Chenglong Li, Zikai Xiao, Jingwei Song, Jinhao Jing, Vireo Zhang, Kun Wang

机构 * USTC(中国科学技术大学) NTU(国立台湾大学) CityU-DG(城市大学-数据科学) THU(清华大学) ZJU(浙江大学) HKU(香港大学) CUHK-SZ(香港大学-深圳)

AI总结 本文提出MineEvolve框架,通过将执行反馈转化为可操作的行为知识,提升长周期具身智能体在Minecraft中的表现,实验表明其在高依赖任务组中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12708 2026-05-12 cs.CL

AgentReview: Exploring Peer Review Dynamics with LLM Agents

AgentReview: 探索基于LLM代理的同行评审动态

Yiqiao Jin, Qinlin Zhao, Yiyang Wang, Hao Chen, Kaijie Zhu, Yijia Xiao, Jindong Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Science and Technology of China(中国科学技术大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) University of California, Los Angeles(加州大学洛杉矶分校) William & Mary(威廉与玛丽学院)

AI总结 本文提出AgentReview框架,通过LLM模拟同行评审过程,揭示评审者偏见导致论文决策37.1%的变异,结合社会学理论提升评审机制设计。

Comments Accepted at EMNLP 2024 Main Track (Oral). https://agentreview.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08936 2026-05-12 cs.AI cs.LG

Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

Self-ReSET: 通过学习自我恢复来应对不安全推理轨迹

Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

AI总结 本文提出Self-ReSET框架,通过纯强化学习使大推理模型具备自我恢复能力,提升对抗攻击下的鲁棒性并高效利用数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08930 2026-05-12 cs.AI

Internalizing Safety Understanding in Large Reasoning Models via Verification

通过验证内部化安全理解以提升大推理模型

Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出Safety Internal框架,通过训练模型在安全验证任务中自我批判生成答案,提升模型对自身输出安全性的判断能力,增强对抗性突破的鲁棒性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08685 2026-05-12 cs.LG cs.AI

Event Fields: Learning Latent Event Structure for Waveform Foundation Models

事件场:学习隐式事件结构用于波形基础模型

Li Na, Yuanyun Zhang, Shi Li

机构 * University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学)

AI总结 本文提出一种新的波形基础模型,通过将生理时间序列建模为隐式事件过程的实现,而非传统序列表示。该方法通过自监督学习框架,促使波形的随机分割和时间频率投影之间的一致性,提升模型对信号扰动的鲁棒性并保持事件层面的组织结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04277 2026-05-12 cs.CV

Towards Lightest Low-Light Image Enhancement Architecture for Mobile Devices

面向移动设备的最轻量级低光照图像增强架构

Guangrui Bai, Hailong Yan, Wenhai Liu, Yahui Deng, Erbao Dong

机构 * Key Laboratory of Precision and Intelligent Chemistry, Department of Precision Machinery and Precision Instrumentation, University of Science and Technology of China(精密与智能化学重点实验室,精密机械与精密仪器系,中国科学技术大学) School of Information and Communication Engineering, University of Electronic Science and Technology of China(信息与通信工程学院,电子科学与技术大学)

AI总结 本文提出LiteIE框架,通过轻量级网络和无监督训练,实现低光照图像增强的高效解决方案,在资源受限设备上达到高PSNR和实时处理能力。

Comments Accepted by ESWA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08277 2026-05-12 cs.CR cs.AI

Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

通过一个单个演示缓解多示例劫持攻击

Kejia Chen, Jiawen Zhang, Boheng Li, Pengcheng Li, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文研究多示例劫持攻击为何随着演示数量增加而增强,提出通过添加固定单个安全演示来对抗该攻击,从而提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08237 2026-05-12 cs.LG stat.ML

Distributional Spectral Diagnostics for Localizing Grokking Transitions

分布谱诊断法用于定位Grokking转变

Ziyue Wang, Yufeng Ying, Takafumi Kanamori

机构 * Institute of Science Tokyo(东京科学研究所) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出通过分布谱诊断法定位Grokking转变,利用经验分布、Wasserstein坐标和Hankel DMD分析,实现对训练轨迹中转变的检测与定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08103 2026-05-12 physics.comp-ph cond-mat.mtrl-sci cs.AI

Crystal Fractional Graph Neural Network for Energy Prediction of High-Entropy Alloys

晶体分数图神经网络用于高熵合金的能量预测

Takanori Kotama, Yang Huang

机构 * School of Informatics, Nagoya University(名古屋大学信息学系) University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州市先进研究所)

AI总结 本文提出晶体分数图神经网络,结合局部原子环境与全局组成信息,预测高熵合金能量,实验表明其精度接近第一性原理计算,但需改进处理大晶胞的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏