arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-04-21 至 2026-04-21 共收录 10
2604.18574 2026-04-21 cs.LG cs.AI

When Can LLMs Learn to Reason with Weak Supervision?

大语言模型何时能通过弱监督学习推理?

Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel, Pavel Izmailov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New York University(纽约大学) Google(谷歌)

AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17290 2026-04-21 cs.CL cs.AI cs.PL

Probabilistic Programs of Thought

思维概率程序

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck

机构 * University of California Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(Allen人工智能研究所)

AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08539 2026-04-21 cs.CV cs.AI cs.CL

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

OpenVLThinkerV2: 一个多领域视觉任务的通用多模态推理模型

Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

AI总结 本文提出G$^2$RPO训练目标,通过非线性分布匹配解决多视觉任务中的奖励拓扑差异和感知与推理平衡问题,构建了鲁棒的OpenVLThinkerV2模型,在18个基准测试中表现优异。

Comments code at: https://github.com/uclanlp/openvlthinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04609 2026-04-21 cs.CL

When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation

当更多词语说更少:在图像描述评估中解耦长度与特异性

Rhea Kapur, Robert Hawkins, Elisa Kreiss

机构 * Stanford University(斯坦福大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出通过对比集定义描述特异性,验证人们更偏好信息密集的描述,无论长度如何,且长度分配影响特异性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16886 2026-04-21 cs.RO

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

交互链基准(COIN):当推理遇见具身交互

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 COIN基准通过设计日常场景下的50个交互任务,评估机器人在部分可观测环境下进行因果依赖推理的能力,揭示现有方法在交互推理任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16448 2026-04-21 eess.SY cs.LG cs.SY

FM-CAC: Carbon-Aware Control for Battery-Buffered Edge AI via Time-Series Foundation Models

FM-CAC:通过时间序列基础模型实现电池缓冲的边缘AI碳感知控制

Kang Yang, Walid A. Hanafy, Prashant Shenoy, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 本文提出FM-CAC框架,利用电池作为时间缓冲,通过时间序列基础模型进行碳预测,减少碳排放同时保持高服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06201 2026-04-21 cs.CL cs.AI

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

超越事实:大型语言模型分布式阅读理解基准测试

Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

机构 * National Taiwan University(国立台湾大学) University of California, Los Angeles(加州大学洛杉矶分校) Academia Sinica, Taiwan(台湾“中央研究院”) NTU AI-CoRE(国立清华大学AI研究中心)

AI总结 本文提出Text2DistBench基准测试,评估LLM从自然语言中推断分布知识的能力,通过真实YouTube评论数据,测试模型在估计评论比例和识别高频主题方面的表现,揭示LLM在分布式阅读理解中的能力和局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02378 2026-04-21 cs.CR cs.CV cs.MM eess.IV

Authenticated Contradictions from Desynchronized Provenance and Watermarking

认证矛盾源于脱同步的溯源与水印

Alexander Nemecek, Hengzhi He, Guang Cheng, Erman Ayday

机构 * Case Western Reserve University(凯斯西储大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 研究揭示了溯源和水印验证层之间的矛盾,通过元数据清洗流程生成伪造内容,提出跨层审计协议实现100%准确分类。

Comments Accepted at CVPR 2026 Workshop Authenticity & Provenance in the Age of AI (APAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14774 2026-04-21 cs.CL cs.AI

LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs

LiveCLKTBench: 向多语言大语言模型中跨语言知识转移的可靠评估迈进

Pei-Fu Guo, Yun-Da Tsai, Chun-Chia Hsu, Kai-Xin Chen, Ya-An Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

机构 * National Taiwan University(国立台湾大学) University of California, Los Angeles(加州大学洛杉矶分校) Academia Sinica, Taiwan(台湾“中央研究院”) NTU AI-CoRE(国立清华大学AI研究中心)

AI总结 本文提出LiveCLKTBench,通过自动化生成流程评估多语言大语言模型的跨语言知识转移,发现语言距离和方向对转移影响显著,且模型规模越大收益越小。

详情

展开后加载摘要…

URL PDF HTML 收藏