arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2603.17834 2026-04-28 cs.RO cs.AI

Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control

生成控制作为优化:用于自适应和鲁棒机器人控制的时间无条件流匹配

Zunzhe Zhang, Runhan Huang, Yicheng Liu, Shaoting Zhu, Linzhan Mou, Hang Zhao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Department of Computer Science, Princeton University, New Jersey, US(普林斯顿大学计算机科学系) Galaxea Inc., Beijing, China(Galaxea公司)

AI总结 GeCO通过将动作合成转化为迭代优化,解决了传统流匹配在状态复杂度上计算效率低的问题,实现了自适应的计算分配和无监督的安全检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14295 2026-04-28 cs.RO cs.MA

Aegis: Automated Error Generation and Attribution for Multi-Agent Systems

Aegis:多智能体系统的自动化错误生成与归因

Fanqi Kong, Ruijie Zhang, Huaxiao Yin, Guibin Zhang, Xiaofei Zhang, Ziang Chen, Zhaowei Zhang, Xiaoyuan Zhang, Song-Chun Zhu, Xue Feng

机构 * Peking University Beijing Institute of General Artificial Intelligence(北京大学北京通用人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出Aegis框架,通过自动化生成大规模多智能体系统错误数据,提升错误归因能力,实验表明其模型性能可与专有模型媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12382 2026-04-28 cs.LG cs.AI cs.CR

Exploring the Secondary Risks of Large Language Models

探索大型语言模型的二次风险

Jiawei Chen, Zhengwei Fang, Yu Tian, Jiawei Du, Chao Yu, Zhaoxia Yin, Hang Su

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Beijing Zhongguancun Academy(北京中关村学院) Department of Computer Science and Technology, THBI Lab, Tsinghua University(计算机科学与技术系,清华大学THBI实验室) CFAR, A*STAR, Singapore(新加坡A*STAR CFAR)

AI总结 本文提出二次风险作为新型失败模式,通过SecLens框架系统评估,揭示了大型语言模型在良性交互中存在广泛且转移性强的有害行为,强调需加强安全机制。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23380 2026-04-28 cs.LG cs.CV

V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think

V-GRPO:去噪生成模型的在线强化学习比你想象的更容易

Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学) Amazon FAR(亚马逊FAR) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出V-GRPO方法,通过结合ELBO近似与GRPO算法,实现稳定高效的去噪生成模型在线强化学习,优于传统MDP方法,在文本到图像合成中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23212 2026-04-28 stat.ML cs.LG math.ST stat.TH

Learning Curves and Benign Overfitting of Spectral Algorithms in Large Dimensions

谱算法在高维空间中的学习曲线与良性过拟合

Weihao Lu, Qian Lin, Yingcun Xia, Dongming Huang

机构 * Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系)

AI总结 本文研究了高维环境下谱算法的学习曲线和良性过拟合现象,揭示了在不同正则化条件下学习曲线的三阶段特性,并展示了在特定光滑性条件下良性过拟合的出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23134 2026-04-28 cs.LG

h-MINT: Modeling Pocket-Ligand Binding with Hierarchical Molecular Interaction Network

h-MINT:基于分层分子相互作用网络的口袋-配体结合建模

Yanru Qu, Yijie Zhang, Wenjuan Tan, Xiangzhe Kong, Xiangxin Zhou, Chaoran Cheng, Mathieu Blanchette, Jiaxuan You, Ge Liu

机构 * Department of Computer Science, UIUC(伊利诺伊大学厄巴纳-香槟分校计算机科学系) DOE Center for Advanced Bioenergy and Bioproducts Innovation, UIUC(美国能源部先进生物能源与生物产品创新中心,伊利诺伊大学厄巴纳-香槟分校) School of Computer Science, McGill University(麦吉尔大学计算机科学系) MILA-Québec AI Institute(魁北克AI研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究 institute) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出h-MINT模型,通过重叠BPE分词和分层分子相互作用网络,改进分子表示以提升结合亲和力预测和虚拟筛选性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22885 2026-04-28 cs.CV cs.AI

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

联邦跨模态检索与缺失模态的语义路由和适配器个性化

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-鲁克桑克鲁特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) Shaanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RCSR框架,通过语义路由和适配器个性化解决联邦跨模态检索中异构数据和缺失模态的问题,提升全局检索准确性和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22881 2026-04-28 cs.LG cs.AI

MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches

MTServe: 生成推荐模型高效服务的分层缓存系统

Xin Wang, Chi Ma, Shaobin Chen, Pu Wang, Menglei Zhou, Junyi Qiu, Qiaorui Chen, Jiayu Sun, Shijie Liu, Zehuan Wang, Lei Yu, Chuan Liu, Fei Jiang, Wei Lin, Hao Wang, Jiawei Jiang, Xiao Yan

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗quant研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

AI总结 MTServe通过分层缓存管理减少生成推荐模型的推理开销,利用主机内存扩展GPU内存,结合异步数据传输和局部性驱动替换策略,在保持高命中率的同时实现3.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22858 2026-04-28 cs.CV

A Digital Pathology Resource for Liver Cancer Quantification with Datasets, Benchmarks, and Tools

用于肝癌定量的数字病理资源:包含数据集、基准和工具

Ying Xiao, Shimiao Tang, Xitong Ling, Weiming Chen, Jun Wang, Jiawen Li, Huaitian Yuan, Jianghui Yang, Bowen Li, Huan Li, Yiting Meng, Tian Guan, Yonghong He, Hongfang Yin

机构 * Department of Pathology, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University, Beijing, China(北京清华长庚医院病理科,临床医学学院,清华大学医学院,清华大学,北京,中国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

AI总结 本文提出HepatoBench数据集及HepatoQuant工具,解决肝癌细粒度组织成分识别难题,提供统一的定量分析流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22779 2026-04-28 cs.LG cs.AI cs.CL

KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning

KARL:通过知识边界感知强化学习缓解大语言模型的幻觉

Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

机构 * Tsinghua University(清华大学)

AI总结 KARL通过知识边界感知强化学习框架,动态调整大语言模型的回避行为,有效抑制幻觉并保持高精度。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21764 2026-04-28 cs.AI

Thinking with Reasoning Skills: Fewer Tokens, More Accuracy

通过推理技能思考:更少的标记,更高的准确性

Guangxiang Zhao, Qilong Shi, Xusen Xiao, Xiangzheng Zhang, Tong Yang, Lin Sun

机构 * Qiyuan Tech(启元科技) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本文提出通过存储和检索推理技能来减少推理标记并提升性能,适用于编码和数学推理任务。

Comments 10 pages, The 64th Annual Meeting of the Association for Computational Linguistics -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02556 2026-04-28 cs.LG cs.AI

Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs

超越经验检索:学习生成优化的结构化经验以冻结LLM

Xuancheng Li, Haitao Li, Yujia Zhou, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国) Quancheng Laboratory(千晨实验室)

AI总结 本文提出SEAM模块,通过单次前向传递生成实例定制的经验条目,优化冻结LLM的执行效率,实验显示在数学推理基准上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-04-28 cs.CL cs.AI

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21275 2026-04-28 cs.DC cs.AI

InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training

InfiniPipe:弹性流水线并行用于高效可变长度长上下文LLM训练

Shiju Wang, Yujie Wang, Ao Sun, Fangcheng Fu, Zijian Zhu, Bin Cui, Xu Han, Kaisheng Ma

机构 * Tsinghua University(清华大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出弹性流水线并行和阶段感知切片级自适应检查点,以应对资源和工作负载异质性,实验证明InfiniPipe比现有系统快1.69倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02316 2026-04-28 cs.CV cs.AI

ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation

ConsDreamer:推进多视图一致性以实现零样本文本到3D生成

Yuan Zhou, Shilong Jin, Litao Hua, Wanjun Lv, Haoran Duan, Jungong Han

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Lenovo(联想)

AI总结 ConsDreamer通过消除视图偏差和几何一致性约束,解决多面Janus问题,提升零样本文本到3D生成的多视图一致性。

Comments Accepted by IEEE Transactions on Image Processing, Code is available at: https://github.com/GAInuist/ConsDreamer

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04468 2026-04-28 cs.CV

NVILA: Efficient Frontier Visual Language Models

NVILA:高效的前沿视觉语言模型

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Tsinghua University(清华大学)

AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。

Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00978 2026-04-28 cs.CL

AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

AWQ:基于激活的权重量化用于LLM压缩与加速

Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, Song Han

机构 * MIT(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达) Tsinghua University(清华大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文提出AWQ方法,通过识别重要权重通道减少量化误差,实现低比特权重量化,提升LLM的压缩与加速性能,并在多个基准测试中表现优异。

Comments MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14897 2026-04-28 cs.CV

Seer: Language Instructed Video Prediction with Latent Diffusion Models

Seer:基于潜在扩散模型的语言指导视频预测

Xianfan Gu, Chuan Wen, Weirui Ye, Jiaming Song, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai AI Lab(上海人工智能实验室) NVIDIA

AI总结 Seer通过扩展预训练文本到图像扩散模型的时间轴,提出高效模型以实现文本条件视频预测,提升机器人未来预测能力,实验表明其在多个数据集上性能优越。

Comments 31 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22548 2026-04-27 stat.AP cs.LG

Multi-output Extreme Spatial Model for Complex Aircraft Production Systems

多输出极值空间模型用于复杂飞机生产系统

Cheolhei Lee, Xing Wang, Xiaowei Yue, Jianguo Wu

机构 * Grado Department of Industrial and Systems Engineering, Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学工业与系统工程系) Department of Mathematics, Illinois State University(伊利诺伊州立大学数学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Department of Industrial Engineering and Management, Peking University(北京大学工业工程与管理系)

AI总结 本文提出多输出极值空间模型,用于复杂飞机生产系统中的极值预测与风险分析,通过双域线性函数捕捉动态,提升极端事件预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22335 2026-04-27 cs.CL

Context-Fidelity Boosting: Enhancing Faithful Generation through Watermark-Inspired Decoding

上下文保真度提升:通过水印启发式解码增强忠实生成

Weixu Zhang, Fanghua Ye, Qiang Gao, Jian Li, Haolun Wu, Yuxing Tian, Sijing Duan, Nan Du, Xiaolong Li, Xue Liu

机构 * Hunyuan AI Digital Human, Tencent(腾讯文深AI数字人) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Wuhan University(武汉大学) University of Montreal(蒙特利尔大学) Tsinghua University(清华大学) MBZUAI

AI总结 本文提出CFB框架,通过增加源支持标记的生成概率减少大语言模型中的保真度幻觉,采用基于水印技术的logit调整策略,三种增强策略提升生成忠实度,无需重训练即可兼容多种LLM。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22324 2026-04-27 cs.LG

A Brain-Inspired Deep Separation Network for Single Channel Raman Spectra Unmixing

一种受大脑启发的深度分离网络用于单通道拉曼光谱解混

Gaoruishu Long, Jinchao Liu, Bo Liu, Jie Liu, Xiaolin Hu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(南开大学人工智能学院) Guangdong Laboratory of Chemistry and Fine Chemical Industry, Guangdong, China(广东省化学与精细化工实验室) Smekal Tech (Shantou) Ltd.(斯梅卡科技(汕头)有限公司) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 本文提出受语音分离启发的深度分离网络RSSNet,用于单通道拉曼光谱解混,通过分解千种成分库中的噪声混合光谱,优于现有方法,且能有效处理真实世界混合样品。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN 2026). 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22225 2026-04-27 cs.CL eess.AS

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

TTS-PRISM:一种用于细粒度诊断的感知推理和可解释语音模型

Xi Wang, Jie Wang, Xingchen Song, Baijun Song, Jingran Xie, Jiahe Shao, Zijian Lin, Di Wu, Meng Meng, Jian Luan, Zhiyong Wu

机构 * Tsinghua University(清华大学) MiLM Plus, Xiaomi Inc.(小鹏科技MiLM Plus) The University of Tokyo(东京大学)

AI总结 本文提出TTS-PRISM模型,通过多维诊断框架和可解释合成流程,实现对语音生成中细粒度声学问题的诊断与解释,实验表明其在人感知对齐上优于通用模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07038 2026-04-27 cs.CV cs.CL

UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents

UNIKIE-BENCH:用于视觉文档中关键信息提取的大型多模态模型基准测试

Yifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

AI总结 本文提出UNIKIE-BENCH基准,用于评估大型多模态模型在视觉文档关键信息提取中的性能,揭示了不同场景下模型的性能差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22630 2026-04-27 cs.CL cs.AI cs.LG

StateX: Enhancing RNN Recall via Post-training State Expansion

StateX:通过后训练状态扩展增强RNN回忆能力

Xingyu Shen, Yingfa Chen, Zhen Leng Thai, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Department of Science and Technology, Tsinghua University(清华大学科学技术部)

AI总结 StateX通过后训练方法扩展RNN状态,提升长上下文回忆与上下文学习性能,无需显著增加参数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20662 2026-04-27 cs.AI

AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage

AutoReproduce:基于论文溯源的自动AI实验复现

Xuanle Zhao, Zilin Sang, Yuxuan Li, Qi Shi, Weilun Zhao, Shuo Wang, Duzhen Zhang, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xidian University(西安电子科技大学) OpenBMB(开放大脑实验室) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AutoReproduce,通过论文溯源系统自动复现实验代码,采用多智能体框架和采样单元测试策略,验证了其在复现精度和执行性能上的优势。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏