arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 392
2603.00546 2026-07-16 cs.AI cs.CV 版本更新

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13467 2026-07-16 cs.LG 版本更新

On the Sublinear Regret of Continuous K-Max Bandits

关于连续 K 最大多臂老虎机的次线性遗憾

Yu Chen, Siwei Wang, Longbo Huang, Wei Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Institute for Interdisciplinary Information Sciences(交叉信息院) Tsinghua University(清华大学)

AI总结 研究连续K最大多臂老虎机问题,该问题在推荐等应用中出现,有离散化误差等困难。引入DCK - UCB算法,证明其实现了\(\widetilde{O}(T^{3/4})\)遗憾界,还针对特定情况提出MLE - Exp算法,为连续组合老虎机提供了算法解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11327 2026-07-15 cs.LG cs.AI 版本更新

PRISM Edit: One Vector for All Temporal Answers

PRISM Edit:适用于所有时间答案的单一向量

Chen Huang, Qi Zheng, Ruiqin Zheng, Long Zeng, Yuantong Xu

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。

Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31437 2026-07-15 cs.CV 版本更新

Astra: a generalizable report generation foundation model for 3D computed tomography

Astra:一种用于三维计算机断层扫描的通用报告生成基础模型

Zhuhao Wang, Fang Chen, Chaohui Yu, Zihan Li, Yuchao Zheng, Jing Wang, Xuan Yang, Jia Guo, Zhenlu Yang, Xingju Zheng, Yihua Sun, Haojie Han, Xiaoxiao Qin, Zhan Feng, Wenbo Xiao, Chao Zhu, Yuehua Li, Shipeng Zhang, Hao Luo, Yunsong Peng, Fan Wang, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Laboratory(壶辰实验室) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Radiology, Guizhou Provincial People’s Hospital(贵州省级人民医院放射科) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院放射科) Department of Radiology, Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院放射科) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 提出Astra模型,通过风格统一和强化学习,在8个器官系统的CT报告生成中实现高精度,平均细粒度诊断指标提升44.1%,并加速临床工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12783 2026-07-15 cs.IR cs.AI 版本更新

SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise

SQuTR:一种在语音噪声下 spoken query 到文本检索的鲁棒性基准

Yuejie Li, Ke Yang, Yueying Hua, Berlin Chen, Jianhao Nie, Yueping He, Caixin Kang

机构 * Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) Soochow University(苏州大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Tsinghua University(清华大学) The University of Tokyo(东京大学)

AI总结 SQuTR通过大规模数据集和统一评估协议,评估语音检索系统在复杂噪声环境下的鲁棒性,揭示了极端噪声下检索性能显著下降的问题。

Comments Accepted by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09977 2026-07-15 cs.CV 版本更新

INFANiTE: Implicit Neural representation for high-resolution Fetal brain spatio-temporal Atlas learNing from clinical Thick-slicE MRI

INFANiTE:隐式神经表示用于高分辨率胎儿脑空间-时间大体图谱学习从临床厚切片MRI

Xiaotian Hu, Mingxuan Liu, Hongjia Yang, Tongxi Song, Yijin Li, Yifei Chen, Haoxiang Li, Zihan Li, Yingqi Hao, Ziyu Li, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Beihang University(北航大学) Tsinghua University(清华大学) Sichuan University(四川大学) University of Oxford(牛津大学)

AI总结 INFANiTE通过隐式神经表示方法,实现了从厚切片MRI中高效生成高分辨率胎儿脑空间-时间大体图谱,显著加快了图谱构建过程,提升了图谱的一致性、参考保真度和生物合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04241 2026-07-15 cs.LG math.OC 版本更新

Learning an Interpretable Risk Scoring System for Maximizing Decision Net Benefit

学习一种可解释的风险评分系统以最大化决策净收益

Wenhao Chi, Ş. İlker Birbil

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Amsterdam Business School, University of Amsterdam(阿姆斯特丹大学阿姆斯特丹商学院)

AI总结 本文提出一种直接优化决策阈值范围内净收益的风险评分系统,通过稀疏整数线性规划构建透明评分系统,实现可解释性和实用性,同时验证了净收益优化与传统性能指标的一致性。

Comments 50 pages, 9 figures, 17 tables, and 6 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-07-15 cs.RO cs.AI 版本更新

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 17 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23276 2026-07-15 cs.LG cs.MA 版本更新

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08765 2026-07-14 cs.CV 版本更新

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

通过几何感知预训练增强上下文全景生成

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

机构 * Insta360 Research(影石创新研究院) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Wuhan University(武汉大学)

AI总结 该研究提出两阶段框架Canvas360用于上下文全景生成,结合几何感知预训练与微调。通过构建数据集及特定建模方法,增强文本到全景生成,经实验验证其能提高全景图像保真度,在相关指标上表现优异。

Comments Project page: https://zry000.github.io/Canvas360/ Github: https://github.com/Insta360-Research-Team/Canvas360

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02502 2026-07-14 cs.LG cs.AI 版本更新

DemoPSD: Disagreement-Modulated Policy Self-Distillation

DemoPSD: 分歧调节的策略自蒸馏

Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳理工大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21587 2026-07-14 cs.LG cs.AI 版本更新

FAST: A Framework for Aligned Sampling and Training in Parallel Reinforcement Learning for Autonomous Driving

FAST:面向自动驾驶并行强化学习中的对齐采样与训练框架

Bonan Wang, Letian Tao, Bin Shuai, Jiaxin Gao, Wenxin Zhao, Wei Xiong, Kehua Sheng, Bo Zhang, Yang Guan, Shengbo Eben Li

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Didi Voyager Labs, DiDi Autonomous Driving(滴滴自动驾驶沃芽实验室) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 提出FAST框架,通过动态并行采样对齐和缩放掩码填充优化,解决并行强化学习中的掉队者效应和采样效率瓶颈,实现至少1.78倍加速且保持统计无偏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15753 2026-07-14 cs.RO cs.CV 版本更新

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

层次化和整体化的开放词汇功能3D场景图用于室内空间

Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas, Xiangkui Zhang, Marc Pollefeys, Francis Engelmann, Xiangyang Ji

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Dalian University of Technology(大连理工大学) Microsoft(微软) Stanford University(斯坦福大学) University of Lugano(卢加诺大学)

AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10332 2026-07-14 cs.AI 版本更新

EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents

EmbodiSkill:基于技能的反思以实现自我进化的具身智能体

Ruofei Ju, Xinrui Wang, Xin Ding, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Hao Wen, Xiangyu Li, Weijun Wang, Kun Li, Yunxin Liu, Haipeng Dai, Wei Wang, Ting Cao

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出EmbodiSkill,一种无需训练的具身技能自我进化框架,通过技能感知反思和针对性修订提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03636 2026-07-14 stat.ML cs.LG math.ST stat.AP stat.ME stat.TH 版本更新

Likelihood Matching for Diffusion Models

扩散模型的似然匹配

Lei Qian, Wu Su, Yanqi Huang, Song Xi Chen

机构 * Center for Data Science(数据科学中心) Peking University(北京大学) Guanghua School of Management(光华管理学院) Department of Statistics and Data Science(统计与数据科学系) Tsinghua University(清华大学)

AI总结 研究提出似然匹配方法训练扩散模型,通过建立目标数据分布似然与反向扩散样本路径似然的等价关系,利用拟似然近似反向转移密度,估计得分和海森矩阵函数,引入随机采样器,建立一致性并提供收敛保证,经评估验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18610 2026-07-14 cs.CL 版本更新

PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs

PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化

Tengxuan Liu, Shiyao Li, Jiayi Yang, Tianchen Zhao, Feng Zhou, Xiaohui Song, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Columbia University(哥伦比亚大学) OPPO AI Center(OPPO人工智能中心) Shanghai Jiaotong University(上海交通大学)

AI总结 针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。

Comments Accepted by ICLR 2026. Code available at https://github.com/thu-nics/PM-KVQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29858 2026-07-13 cs.CL 版本更新

Smooth Scaling Laws Hide Stepwise Token Learning

平滑缩放定律隐藏了逐步的令牌学习

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua university(清华大学)

AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31271 2026-07-13 cs.CV 版本更新

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。

Comments arXiv admin note: text overlap with arXiv:2605.21273

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15849 2026-07-13 cs.CV 版本更新

Memory-SAM: Human-Prompt-Free Tongue Segmentation via Retrieval-to-Prompt

Memory-SAM:无需人工提示的舌头分割:通过检索生成提示

Joongwon Chae, Lihui Luo, Xi Yuan, Dongmei Yu, Zhenglin Chen, Lian Zhang, Peiwu Qin

机构 * Tsinghua University, China(清华大学) The Fifth Affiliated Hospital of Wenzhou Medical University, China(温州医科大学第五附属医院) Shenzhen Traditional Chinese Medicine Hospital, China(深圳中医医院) Wenzhou Medical University, China(温州医科大学) The First Hospital of Hebei Medical University, China(河北医科大学第一医院) Chinese Medicine Guangdong Laboratory/Hengqin Laboratory, China(广东中医实验室/横琴实验室)

AI总结 Memory-SAM通过检索生成提示实现无需人工提示的舌头分割,利用密集DINOv3特征和FAISS检索自动生成有效提示,提升分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10260 2026-07-13 cs.CV cs.AI 版本更新

H3Former: Hypergraph-based Semantic-Aware Aggregation via Hyperbolic Hierarchical Contrastive Loss for Fine-Grained Visual Classification

H3Former:基于超图的语义感知聚合,通过双曲层次对比损失进行细粒度视觉分类

Yongji Zhang, Siqi Li, Kuiyang Huang, Yue Gao, Yu Jiang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Software, Jilin University(吉林大学软件学院) School of Software, Tsinghua University(清华大学软件学院)

AI总结 针对细粒度视觉分类难题,提出H3Former框架,通过语义感知聚合模块利用多尺度上下文线索构建加权超图捕捉高阶语义依赖,引入双曲层次对比损失增强语义约束,实验验证了该框架在FGVC任务中的优越性。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22951 2026-07-10 cs.AI cs.CL cs.LG 版本更新

The Power of Power Law: Asymmetry Enables Compositional Reasoning

幂律的力量:不对称性使组合推理成为可能

Zixuan Wang, Xingyu Dang, Jason D. Lee, Kaifeng Lyu

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文研究了幂律分布对组合推理任务的影响,发现其在状态跟踪和多步算术等任务中优于均匀分布,通过理论分析揭示了幂律分布通过引入有益的不对称性,使模型能更高效地学习长尾技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13230 2026-07-10 cs.LG cs.NE 版本更新

Does Dimensionality Reduction via Random Projections Preserve Landscape Features?

通过随机投影进行降维是否能保持景观特征?

Iván Olarte Rodríguez, Anja Jankovic, Thomas Bäck, Elena Raponi

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) RTWH Aachen University(亚琛工业大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

AI总结 本文研究了通过随机高斯嵌入进行降维对探索性景观分析特征的鲁棒性,发现线性随机投影会改变与ELA相关的几何和拓扑结构,大多数特征对嵌入高度敏感。

Comments 9 Pages, 5 figures, Submitted and accepted to Proceedings of The Genetic and Evolutionary Computation Conference 2026,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10180 2026-07-10 cs.DC cs.LG 版本更新

Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation

Tessera:通过内核粒度解耦解锁异构GPU

Tiancheng Hu, Jin Qin, Zheng Wang, Junhao Hu, Yuzheng Wang, Lei Chen, Yizhou Shan, Mingxing Zhang, Ting Cao, Chunwei Xia, Huimin Cui, Tao Xie, Chenxi Wang

机构 * Peking University(北京大学) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) University of Chinese Academy of Sciences(中国科学院大学) Institute for AI Industry Research, Tsinghua University(清华大学人工智能研究院) Tsinghua University(清华大学) University of Leeds(利兹大学) Huawei Cloud(华为云)

AI总结 Tessera通过内核粒度解耦提升异构GPU上的大模型推理性能和成本效率,利用离线分析与在线适应结合,实现计算与硬件能力的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12742 2026-07-10 cs.CV 版本更新

Effective Gaussian Management for High-fidelity Scene Reconstruction

高保真物体重建的有效高斯管理

Jiateng Liu, Hao Gao, Jiu-Cheng Xie, Chi-Man Pun, Jian Xiong, Haolun Li, Junxin Chen, Feng Xu

机构 * School of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化学院) school of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院) School of Software, Dalian University of Technology(大连理工大学软件学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) School of Software and BNRist, Tsinghua University(清华大学软件学院和BNRist)

AI总结 提出一种高斯管理框架,通过选择性激活属性、自适应表示和任务解耦剪枝,结合正则化表面重建模块,在减少参数的同时实现高保真外观与几何重建。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19422 2026-07-10 cs.CV 版本更新

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg:通过自回归掩码生成进行图像分割

Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Tsinghua University(清华大学) Shenzhen University(深圳大学) Meituan(美团) Division of AMC and Department of ECE, HKUST(HKUST AMC 分部和电子工程系)

AI总结 LlamaSeg是通过自然语言指令统一图像分割任务的视觉自回归框架,将分割视为视觉生成,编码掩码为视觉令牌。引入数据标注管道和SA-OVRS数据集,能基于文本提示定位对象并生成掩码,实验显示其在分割基准上表现出色。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19813 2026-07-09 cs.LG math.ST stat.TH 版本更新

A Van Trees Lower Bound for Fully Interactive Differentially Private Federated Learning

具有任意公共 transcripts 交互的差分隐私联邦学习的一般下界

T. Tony Cai, Yicheng Li

机构 * Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系)

AI总结 本文研究了在任意公共 transcripts 交互下差分隐私联邦学习的下界问题,提出了一个针对平方 $\ell_2$ 损失参数估计的联邦 Van Trees 下界,并通过均值估计、线性回归和非参数回归等应用展示了该下界。

详情

展开后加载摘要…

URL PDF HTML 收藏