arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-08-06 至 2026-08-06 共收录 6
2608.05139 2026-08-06 cs.CL cs.LG 新提交

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04147 2026-08-06 cs.LG cs.AI cs.CV 新提交

LiNC: Lightweight Noise Correction via Per-Sample Trust and Gaussian Mixture Modeling

LiNC:基于逐样本置信度与高斯混合模型的轻量级噪声校正

Abhishek Moturu, Babak Taati, Anna Goldenberg

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(病童医院) UHN KITE Research Institute(大学健康网络KITE研究所) Vector Institute(向量研究所) Institute of Biomedical Engineering(生物医学工程研究所) Rehabilitation Sciences Institute(康复科学研究所) Department of Laboratory Medicine and Pathobiology(检验医学与病理生物学系)

AI总结 针对医学成像数据集的标签噪声问题,本文提出LiNC方法,通过逐样本置信度参数结合高斯混合模型校正标签,在MedMNISTv2数据集上取得稳定的准确率提升且开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28276 2026-08-06 cs.RO 版本更新

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

SimFoundry: 用于策略学习和评估的模块化自动化场景生成

Nadun Ranawaka, Josiah Wong, Wei-Lin Pai, Wei-Teng Chu, Tianyuan Dai, Masoud Moghani, Hang Yin, Yunfan Jiang, Wesley Durbano, Brandon Huynh, Yu Fang, Danfei Xu, Ruohan Zhang, Li Fei-Fei, Linxi Fan, Bowen Wen, Ajay Mandlekar, Yuke Zhu

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学)

AI总结 提出SimFoundry系统,从视频零样本构建仿真场景,支持对象、场景和任务编辑,生成数字孪生与数字表亲,提升策略在真实世界的泛化能力,实验显示仿真评估与真实性能高度相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00992 2026-08-06 cs.RO 版本更新

Geometry-Aware Sampling-Based Motion Planning on Riemannian Manifolds

基于几何感知的黎曼流形上运动规划

Phone Thiha Kyaw, Jonathan Kelly

机构 * Institute for Aerospace Studies, University of Toronto(航空航天研究 institute,多伦多大学)

AI总结 本文提出基于采样的运动规划框架,直接在黎曼流形上操作,利用黎曼几何距离近似和自然梯度引导局部规划,实验证明其在非欧几里得几何下能生成更优轨迹。

Comments In Proceedings of the 17th World Symposium on the Algorithmic Foundations of Robotics (WAFR), Oulu, Finland, Jun 15-17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07558 2026-08-06 cs.HC cs.AI 版本更新

Generative Experiences for Digital Mental Health Interventions: Evidence from a Randomized Study

生成体验用于数字心理健康干预:来自随机研究的证据

Ananya Bhattacharjee, Michael Liut, Matthew Jörke, Diyi Yang, Emma Brunskill

机构 * Stanford University(斯坦福大学) University of Toronto Mississauga(多伦多大学滑铁卢分校)

AI总结 本文提出生成体验范式,通过动态构建干预体验提升数字心理健康干预效果,实验显示GUIDE在减压和用户体验方面显著优于基线对照。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15395 2026-08-06 cs.AI 版本更新

Corrigibility Transformation: Constructing Goals That Accept Updates

可修正性转换:构建接受更新的目标

Rubi Hudson

机构 * University of Toronto(多伦多大学)

AI总结 该研究提出一种可修正性转换方法,可在不牺牲性能的情况下将几乎任何目标转换为可修正版本,能诱导AI产生可修正行为,为AI安全提供了关键的可修正目标方案。

详情

展开后加载摘要…

URL PDF HTML 收藏