arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-13 至 2026-07-13 共收录 5
2606.29858 2026-07-13 cs.CL 版本更新

Smooth Scaling Laws Hide Stepwise Token Learning

平滑缩放定律隐藏了逐步的令牌学习

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua university(清华大学)

AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31271 2026-07-13 cs.CV 版本更新

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。

Comments arXiv admin note: text overlap with arXiv:2605.21273

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15849 2026-07-13 cs.CV 版本更新

Memory-SAM: Human-Prompt-Free Tongue Segmentation via Retrieval-to-Prompt

Memory-SAM:无需人工提示的舌头分割:通过检索生成提示

Joongwon Chae, Lihui Luo, Xi Yuan, Dongmei Yu, Zhenglin Chen, Lian Zhang, Peiwu Qin

机构 * Tsinghua University, China(清华大学) The Fifth Affiliated Hospital of Wenzhou Medical University, China(温州医科大学第五附属医院) Shenzhen Traditional Chinese Medicine Hospital, China(深圳中医医院) Wenzhou Medical University, China(温州医科大学) The First Hospital of Hebei Medical University, China(河北医科大学第一医院) Chinese Medicine Guangdong Laboratory/Hengqin Laboratory, China(广东中医实验室/横琴实验室)

AI总结 Memory-SAM通过检索生成提示实现无需人工提示的舌头分割,利用密集DINOv3特征和FAISS检索自动生成有效提示,提升分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10260 2026-07-13 cs.CV cs.AI 版本更新

H3Former: Hypergraph-based Semantic-Aware Aggregation via Hyperbolic Hierarchical Contrastive Loss for Fine-Grained Visual Classification

H3Former:基于超图的语义感知聚合,通过双曲层次对比损失进行细粒度视觉分类

Yongji Zhang, Siqi Li, Kuiyang Huang, Yue Gao, Yu Jiang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Software, Jilin University(吉林大学软件学院) School of Software, Tsinghua University(清华大学软件学院)

AI总结 针对细粒度视觉分类难题,提出H3Former框架,通过语义感知聚合模块利用多尺度上下文线索构建加权超图捕捉高阶语义依赖,引入双曲层次对比损失增强语义约束,实验验证了该框架在FGVC任务中的优越性。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏