arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2512.07770 2026-02-25 stat.ML cs.LG

Distribution-informed Online Conformal Prediction

基于分布的在线适配预测

Dongjian Hu, Junxi Wu, Shu-Tao Xia, Changliang Zou

机构 * School of Statistics and Data Science, LPMC, KLMDASR and LEBPS, Nankai University(南开大学统计与数据科学学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出了一种基于分布的在线适配预测算法COP,通过整合数据模式以生成更紧的预测集,同时保证覆盖率和减少后悔。

Comments ICLR2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25609 2026-02-25 cs.AI cs.CY

A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments

研究AI代理行为的框架:来自消费者选择实验的证据

Manuel Cherep, Chengtian Ma, Abigail Xu, Maya Shaked, Pattie Maes, Nikhil Singh

机构 * MIT(麻省理工学院) Tsinghua University(清华大学) Dartmouth College(达特茅斯学院)

AI总结 本文提出ABxLab框架,通过控制选项属性和说服性提示,研究AI代理在现实决策中的选择行为,揭示代理在无认知限制下仍存在强烈偏好偏见,为AI代理行为研究提供测试平台。

Comments ICLR, 31 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19975 2026-02-25 cs.LG

From Samples to Scenarios: A New Paradigm for Probabilistic Forecasting

从样本到场景:概率预测的新范式

Xilin Dai, Zhijian Xu, Wanxu Cai, Qiang Xu

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) School of Software, Tsinghua University(清华大学软件学院)

AI总结 本文提出概率场景范式,通过直接生成场景与概率对,改进概率预测模型,实现更高效和准确的预测效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14779 2026-02-25 cs.HC cs.AI

Exploring Collaborative GenAI Agents in Synchronous Group Settings: Eliciting Team Perceptions and Design Considerations for the Future of Work

探索同步小组环境中的协作生成式人工智能代理: eliciting团队感知和未来工作设计考虑

Janet G. Johnson, Macarena Peralta, Mansanjam Kaur, Ruijie Sophia Huang, Sheng Zhao, Ruijia Guan, Shwetha Rajaram, Michael Nebeling

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

AI总结 本文探讨了协作生成式人工智能代理在同步小组环境中的应用,通过实证研究揭示了团队感知和设计考虑,旨在提升团队协作与问题解决能力。

Comments To be published in ACM Conference on Computer-Supported Cooperative Work and Social Computing (CSCW 2025). 33 pages, 11 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20053 2026-02-24 cs.CV

Decoupling Defense Strategies for Robust Image Watermarking

解耦防御策略用于鲁棒图像水印

Jiahui Chen, Zehang Deng, Zeyu Zhang, Chaoyang Li, Lianchen Jia, Lifeng Sun

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本理工大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部感知计算重点实验室)

AI总结 AdvMark通过解耦防御策略,提升图像水印在对抗和再生攻击下的鲁棒性,实验显示其在多种攻击下均取得显著性能提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19574 2026-02-24 eess.AS cs.AI cs.SD

CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment

CTC-TTS: 基于大语言模型的双流文本到语音系统与CTC对齐

Hanwen Liu, Saierdaer Yusuyin, Hao Huang, Zhijian Ou

机构 * School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室)

AI总结 CTC-TTS提出了一种基于大语言模型的双流文本到语音系统,采用CTC对齐器和双词交错策略,提升了流式合成和零样本任务的性能。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19505 2026-02-24 cs.CV

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19289 2026-02-24 cs.LG

AdsorbFlow: energy-conditioned flow matching enables fast and realistic adsorbate placement

AdsorbFlow: 基于能量条件的流匹配实现快速且逼真的吸附质定位

Jiangjie Qiu, Wentao Li, Honghao Chen, Leyi Zhao, Xiaonan Wang

机构 * Beijing Key Laboratory of Artificial Intelligence for Advanced Chemical Engineering Materials, Department of Chemical Engineering, Tsinghua University(北京人工智能先进化工材料重点实验室,化学工程系,清华大学)

AI总结 AdsorbFlow通过能量条件流匹配实现快速准确的吸附质定位,优于现有方法并在效率和精度上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19225 2026-02-24 cs.AI

Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training

基于接近性的多轮优化:LLM代理训练中的实用信用分配

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chang Liu, Peilin Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学) Lanzhou University(兰州大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 ProxMO通过动态调整梯度强度和连续语义加权,提升LLM代理在多轮训练中的信用分配效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19208 2026-02-24 cs.LG cs.AI

How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization

如何分配,如何学习?动态回放分配与优势调节用于策略优化

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

AI总结 DynaMO通过动态回放分配和梯度感知优势调节,优化策略学习中的资源分配与梯度更新稳定性,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19170 2026-02-24 cs.CV

BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment

BriMA:基于多模态适应的持续动作质量评估

Kanglei Zhou, Chang Li, Qingyi Pan, Liyuan Wang

机构 * Department of Psychological and Cognitive Sciences, 2 Department of Statistics and Data Science, Tsinghua University(1 心理学与认知科学系,2 统计学与数据科学系,清华大学)

AI总结 BriMA通过桥接模态适应方法,在模态缺失条件下提升多模态持续动作质量评估的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19138 2026-02-24 q-bio.NC cs.AI

CRCC: Contrast-Based Robust Cross-Subject and Cross-Site Representation Learning for EEG

CRCC: 基于对比的跨受试者和跨站点表示学习

Xiaobin Wong, Zhonghua Zhao, Haoran Guo, Zhengyi Liu, Yu Wu, Feng Yan, Zhiren Wang, Sen Song

机构 * Tsinghua Laboratory of Brain(清华大学脑科学实验室) School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Weixian College, Tsinghua University(清华大学魏先学院) School of Artificial Intelligence, Beijing University of Posts(北京邮电大学人工智能学院) School of Computer Science(计算机科学学院) Technology, Northwestern Polytechnical University, Xi'an, China(技术,西北工业大学,西安,中国) Beijing Huilongguan Hospital, Capital Medical University(北京回龙观医院,首都医科大学) Peking University Huilongguan Clinical Medical School(北京大学回龙观临床医学院)

AI总结 CRCC通过对比学习和对抗优化提升跨站点EEG表示学习的泛化能力,实现10.7个百分点的准确率提升。

Comments First edition

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19091 2026-02-24 cs.CV

CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension

CREM: 为多模态检索与理解的压缩驱动表示增强

Lihao Liu, Yan Wang, Biao Yang, Da Li, Jiangxia Cao, Yuxiao Luo, Xiang Chen, Xiangyu Wu, Wei Yuan, Fan Yang, Guiguang Ding, Tingting Gao, Guorui Zhou

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 CREM通过压缩驱动的表示增强方法,在提升多模态检索性能的同时保持生成能力,实现生成与嵌入任务的统一优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21990 2026-02-24 cs.CV cs.SD

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00486 2026-02-24 cs.LG cs.AI stat.ML

It Takes a Good Model to Train a Good Model: Generalized Gaussian Priors for Optimized LLMs

要训练一个好的模型,需要一个好的模型:通用高斯先验用于优化的大型语言模型

Jun Wu, Patrick Huang, Jiangtao Wen, Yuxing Han

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) Computer Science, New York University Shanghai(纽约大学上海分校计算机科学系)

AI总结 本文提出基于广义高斯分布的初始化和训练方法,通过减少冗余和通信开销,提升大型语言模型的训练效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17543 2026-02-24 cs.SD cs.MM eess.AS

MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation

MEGADance:用于风格感知3D舞蹈生成的专家混合架构

Kaixing Yang, Xulong Tang, Ziqiao Peng, Yuxuan Hu, Jun He, Hongyan Liu

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Malou Tech Inc(马洛科技公司)

AI总结 MEGADance通过专家混合架构实现风格感知的3D舞蹈生成,提升舞蹈质量和风格可控性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12047 2026-02-24 cs.CV

PSGait: Gait Recognition using Parsing Skeleton

PSGait: 基于解析骨架的步态识别

Hangrui Xu, Zhengxian Wu, Chuanrui Zhang, Zhuohong Chen, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

AI总结 PSGait通过解析骨架与轮廓融合的方法提升步态识别的准确性和泛化能力,实现15.7%的精度提升。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18702 2026-02-24 cs.CV cs.AI

Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding

基于接地的思考:用于长视频理解的课程强化推理与视频接地

Houlun Chen, Xin Wang, Guangyao Li, Yuwei Zhou, Yihan Chen, Jia Jia, Wenwu Zhu

机构 * Tsinghua University(清华大学)

AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17048 2026-02-24 cs.CV

StructCore: Structure-Aware Image-Level Scoring for Training-Free Unsupervised Anomaly Detection

StructCore: 用于免训练 无监督异常检测的结构感知图像级评分

Joongwon Chae, Lihui Luo, Yang Liu, Runming Wang, Dongmei Yu, Zeming Liang, Xi Yuan, Dayan Zhang, Zhenglin Chen, Peiwu Qin, Ilmoon Chae

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) Ratel Soft Affiliated Fifth Hospital, Wenzhou Medical University(温州医科大学附属第五医院) Chinese Medicine Guangdong Laboratory(广东中医药实验室)

AI总结 StructCore通过结构感知的图像级评分方法,在无监督异常检测中实现了高鲁棒性的异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10471 2026-02-24 cs.SE cs.CL

TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation

TestExplora: 通过仓库级测试生成对LLMs进行主动bug发现的基准测试

Steven Liu, Jane Luo, Xin Zhang, Aofan Liu, Hao Liu, Jie Wu, Ziyang Huang, Yangyu Huang, Yu Kang, Scarlett Li

机构 * Microsoft(微软公司) School of ECE, Peking University(北京大学电子工程学院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院)

AI总结 TestExplora通过仓库级测试生成评估LLMs在主动bug发现中的能力,揭示了当前模型在复杂交互和代理探索方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07854 2026-02-24 cs.CV

Geometry-Aware Rotary Position Embedding for Consistent Video World Model

面向一致视频世界模型的几何感知旋转位置嵌入

Chendong Xiang, Jiajun Liu, Jintao Zhang, Xiao Yang, Zhengwei Fang, Shizun Wang, Zijun Wang, Yingtian Zou, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、BNRist中心、THBI实验室、清华-博世联合机器学习中心、清华大学) Gaoling School of Artificial Intelligence, Renmin University of China(北京人民大学人工智能学院) National University of Singapore(新加坡国立大学) Peking University(北京大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出ViewRope和几何感知帧稀疏注意力,通过引入相机射线方向提升视频世界模型的长期一致性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16670 2026-02-24 cs.CR cs.AI

BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models

BitHydra: 面向大语言模型的位翻转推理成本攻击

Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 BitHydra通过位翻转攻击针对大语言模型的推理成本进行攻击,利用ADMM方法高效实现无限生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18880 2026-02-24 cs.AI cond-mat.mtrl-sci cs.CL

Reshaping MOFs text mining with a dynamic multi-agents framework of large language model

用大语言模型的动态多智能体框架重塑MOFs文本挖掘

Zuhong Lin, Daoyuan Ren, Kai Ran, Jing Sun, Songlin Yu, Xuefeng Bai, Xiaotian Huang, Haiyang He, Pengxu Pan, Ying Fang, Zhanglin Li, Haipu Li, Jingjing Yao

机构 * Center for Environment and Water Resources, College of Chemistry and Chemical Engineering, Central South University(环境与水资源中心,化学与化工学院,中南大学) Key Laboratory of Hunan Province for Water Environment and Agriculture Product Safety(湖南省水环境与农产品安全重点实验室) School of Resources and Environment, Hunan University of Technology and Business(资源与环境学院,湖南工业大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) State Key Laboratory of High Performance Ceramics and Superfine Microstructure, Shanghai Institute of Ceramics, Chinese Academy of Sciences(高性能陶瓷与超细微结构重点实验室,上海陶瓷研究所,中国科学院) Beijing Key Laboratory for Green Catalysis and Separation, Department of Chemical Engineering, College of Materials Science and Engineering, Beijing University of Technology(绿色催化与分离北京市重点实验室,化学工程系,材料科学与工程学院,北京理工大学) State Key Joint Laboratory of Environment Simulation and Pollution Control, School of Environment, Tsinghua University(环境模拟与污染控制国家重点联合实验室,环境学院,清华大学) School of Chemical Engineering and Materials Science, Yueyang University(化学工程与材料科学学院,岳阳大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) School of Software Engineering, Sun Yat-sen University(软件工程学院,中山大学)

AI总结 MOFh6利用大语言模型的动态多智能体框架,实现MOFs合成条件的高效提取与标准化,提升材料发现的效率和可扩展性。

Comments Accepted by TRAMAT 2 (2026) 100176

Journal ref Transactions of Materials Research, 2026, 2(1), 100176

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15937 2026-02-24 cs.AI

Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment

推进移动GUI代理:一种以验证器驱动的方法用于实际部署

Gaole Dai, Shiqi Jiang, Ting Cao, Yuanchun Li, Yuqing Yang, Rui Tan, Mo Li, Lili Qiu

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率

Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05479 2026-02-23 eess.IV cs.CV physics.med-ph

Retinal OCT Synthesis with Denoising Diffusion Probabilistic Models for Layer Segmentation

利用去噪扩散概率模型进行视网膜OCT合成以实现分层分割

Yuli Wu, Weidong He, Dennis Eschweiler, Ningxin Dou, Zixin Fan, Shengli Mi, Peter Walter, Johannes Stegmaier

机构 * Institute of Imaging and Computer Vision, RWTH Aachen University(成像与计算机视觉研究所,亚琛RWTH大学) Bio-manufacturing Engineering Laboratory of Tsinghua SIGS, Tsinghua University(清华大学SIGS生物制造工程实验室) Shenzhen Eye Hospital(深圳眼科医院) Department of Ophthalmology, RWTH Aachen University(眼科部,亚琛RWTH大学)

AI总结 本文提出利用DDPMs合成视网膜OCT图像,通过知识迁移提升分割精度,展示其在减少人工标注需求方面的潜力。

Comments ISBI 2024

Journal ref 2024 IEEE International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07825 2026-02-20 cs.CV

Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model

点语言模型:通过桥接大型3D语言模型实现任意对象分割

Zhuoxu Huang, Mingqi Gao, Jungong Han

机构 * Department of Computer Science, Aberystwyth University(计算机科学系,阿伯里斯特维斯大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 点语言模型通过桥接大型3D语言模型与密集3D点云,解决表示不一致问题,提升3D对象分割的准确性和鲁棒性。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16958 2026-02-20 cs.AI cs.LG

Automating Agent Hijacking via Structural Template Injection

通过结构模板注入自动化代理劫持

Xinhao Deng, Jiaqing Wu, Miao Chen, Yue Xiao, Ke Xu, Qi Li

机构 * Tsinghua University \& Ant Group Hangzhou China Tsinghua University Beijing China Zhongguancuan Laboratory Beijing China Tsinghua University \& Ant Group Tsinghua University Zhongguancuan Laboratory

AI总结 本文提出Phantom框架,通过结构模板注入自动化代理劫持,提升攻击成功率和效率,揭示结构模板劫持的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08179 2026-02-20 cs.CV cs.MM

PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation

PP-Motion: 人类运动生成的物理-感知保真度评估

Sihan Zhao, Zixuan Wang, Tianyu Luan, Jia Jia, Wentao Zhu, Jiebo Luo, Junsong Yuan, Nan Xi

机构 * Tsinghua University(清华大学) University at Buffalo(布法罗大学) BNRist, Tsinghua University(清华大学BNRist研究所) Key Laboratory of Pervasive Computing, Ministry of Education(教育部 pervasive 计算重点实验室) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) University of Rochester(罗切斯特大学)

AI总结 PP-Motion是一种新的数据驱动度量,通过物理和感知保真度评估提升人类运动生成的准确性与真实性。

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏