arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-07-22 至 2026-07-22 共收录 7
2607.19313 2026-07-22 cs.LG cs.AI 新提交

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16667 2026-07-22 cs.CV 版本更新

Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model

在放弃之前再看一眼:预算约束下的共形证据获取用于可靠的视觉-语言模型

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

机构 * South China University of Technology(华南理工大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进智能研究中心) Columbia University(哥伦比亚大学)

AI总结 针对视觉-语言模型幻觉问题,提出预算约束共形证据获取(BCEA)方法,通过三级决策(回答、放弃或获取额外视觉证据)在有限计算预算下控制幻觉率,并恢复有限样本保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14079 2026-07-22 cs.AI 版本更新

FormGym: Doing Paperwork with Agents

FormGym:用智能体完成文书工作

Matthew Toles, Rattandeep Singh, Isaac Song, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 FormGym提出一个表格填写基准测试,通过FieldFinder工具提升智能体在表格定位和填写任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08436 2026-07-22 cs.NE cs.AI cs.MA cs.SY eess.SY q-bio.NC 版本更新

Active Electrosensing and Communication in MARL-trained Weakly Electric Fish Collectives

在多智能体强化学习训练的弱电鱼群体中的主动电感应与通信

Satpreet H. Singh, Sonja Johnson-Yu, Zhouyang Lu, Aaron Walsman, Federico Pedraja, Denis Turcu, Pratyusha Sharma, Naomi Saphra, Nathaniel B. Sawtell, Kanaka Rajan

机构 * Harvard University(哈佛大学) Brown University(布朗大学) Columbia University(哥伦比亚大学) MIT(麻省理工学院)

AI总结 研究个体互动如何产生复杂集体行为,通过多智能体强化学习训练弱电鱼样智能体集体觅食,再现真实鱼类特征,经模拟干预和神经动力学分析确定因果驱动因素,为弱电鱼等社会动物神经行为学研究提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06374 2026-07-22 cs.CL 版本更新

Evaluating Style-Personalized Text Generation: Challenges and Directions

评估风格个性化文本生成:挑战与方向

Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan, Adrian de Wynter, Sujay Kumar Jauhar

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) The University of York(约克大学)

AI总结 研究风格个性化文本生成面临的挑战,通过提出的风格判别基准评估常用指标,发现多样评估指标集成效果更佳,为可靠评估该文本生成提供指导。

Comments Accepted to the 5th GEM workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08654 2026-07-22 quant-ph cs.AI cs.LG cs.NI 版本更新

Robust Belief-State Policy Learning for Quantum Network Routing Under Decoherence and Time-Varying Conditions

在退相干和时变条件下量子网络路由的鲁棒信念状态策略学习

Amirhossein Taherpour, Abbas Taherpour, Tamer Khattab, Mazen Hasna

机构 * Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) Department of Electrical Engineering, Imam Khomeini International University(伊玛目·霍梅尼国际大学电气工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系)

AI总结 针对量子网络路由在复杂条件下的在线决策问题,基于q-POMDP和GNN开发鲁棒信念状态路由框架,通过原子微纪元等方法考虑多种因素,引入多种策略实现可扩展性,经融合与规则提供理论保证,模拟显示该混合控制器性能优于多种基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19737 2026-07-22 cs.CL 版本更新

XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs

XCOMPS:概念最小对的多语言基准测试

Linyang He, Ercong Nie, Sukru Samet Dindar, Arsalan Firoozi, Adrian Florea, Van Nguyen, Corentin Puffay, Riki Shimizu, Haotian Ye, Jonathan Brennan, Helmut Schmid, Hinrich Schütze, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) University of Michigan(密歇根大学) KU Leuven(根特大学)

AI总结 介绍多语言概念最小对数据集XCOMPS,通过多种方式评估LLMs多语言概念理解,比较不同模型发现LLMs对低资源语言概念理解弱,指令微调与知识蒸馏有不同效果,形态复杂语言理解分数低。

Comments Accepted at SIGTYP 2025: https://aclanthology.org/2025.sigtyp-1.9/

详情

展开后加载摘要…

URL PDF HTML 收藏