arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

共收录 1060
2605.17232 2026-07-24 cs.LG math.ST stat.ML stat.TH 版本更新

Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space

离散扩散模型的维度无关收敛性:伴随方程诱导了正确的空间

Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Markos A. Katsoulakis

机构 * Department of Mathematics(数学系) Oden Institute School of Data Science and Society(数据科学与社会学院) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Computational and Applied Sciences Group(计算与应用科学组) Department of Mathematics and Statistics(数学与统计学系) SRI International(SRI国际) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文提出了一种基于伴随方程的统一框架,实现了任何积分概率度量(IPM)下的维度无关收敛保证,克服了传统KL和TV方法在处理大规模状态空间时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16703 2026-07-24 cs.LG cs.AI stat.ME 版本更新

On the Granularity of Causal Effect Identifiability

因果效应可识别性的粒度性

Yizuo Chen, Adnan Darwiche

机构 * Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

AI总结 本文研究了基于状态的因果效应的可识别性,证明在存在额外知识时,即使变量层面不可识别,状态层面仍可能可识别,并提出相应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12997 2026-07-24 cs.AI cs.CL 版本更新

WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance

WebCoach:具有跨会话记忆引导的自我进化网络代理

Genglin Liu, Shijie Geng, Sha Li, Hejie Cui, Sarah Zhang, Xin Liu, Tianyi Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09949 2026-07-23 cs.CL cs.LG cs.SD eess.AS

Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers

更小的总是更快的吗?压缩自监督语音Transformer的权衡

Tzu-Quan Lin, Tsung-Huan Yang, Chun-Yao Chang, Kuang-Ming Chen, Tzu-hsun Feng, Hung-yi Lee, Hao Tang

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) University of California, Los Angeles, United States(美国加州大学洛杉矶分校) University of Washington, United States(美国华盛顿大学) University of Edinburgh, United Kingdom(英国爱丁堡大学)

AI总结 本文研究了压缩自监督语音Transformer的权衡,评估了四种压缩方法并比较了几种最新技术,为实际部署提供指导。

Comments Accepted at ASRU 2025. Code is available at https://github.com/nervjack2/Speech-SSL-Compression

Journal ref 2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pp. 1-7

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18770 2026-07-22 cs.CR cs.CV 新提交

GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors

GLID:门控局部内在维度修复面部伪造检测器的盲点

Guang Yang, Fengchen Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究针对微调基础模型面部伪造检测器对训练外生成器家族有盲点的问题,提出GLID检测器,通过估计图像补丁令牌局部内在维度,经置信门进入微调检测器,在基准测试中表现出色,揭示相关经验法则并降低准确率跨种子传播。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14512 2026-07-22 cs.AI cs.CL cs.LG 版本更新

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划

Yanqiao Zhu, Jingru Gan, Xiaoqi Sun, Fang Sun, Yidan Shi, Md Mofijul Islam, Chao Shang, Wenhao Gao, Connor W. Coley, Yizhou Sun, Wei Wang

机构 * UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院) Amazon(亚马逊公司) UPenn(宾夕法尼亚大学)

AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。

Comments To appear at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09816 2026-07-22 cs.LG 版本更新

RUBRIC: Realism--Utility Balanced Ranking for Imbalanced Classification

RUBRIC:用于不平衡分类的现实-效用平衡排序

Yanxuan Yu, Dong Liu, Eric Jiang, Shu Wang, Wenxiao Zhao, Jinxi Yu, Shaoyi Lu, Hui Pan, Renata Borovica-Gajic, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Melbourne(墨尔本大学)

AI总结 研究类别不平衡问题,提出RUBRIC框架,将合成样本选择设为质量优化问题,用现实-效用权衡排序,能收紧泛化边界,经实验验证其在信用卡欺诈检测等任务中可提升F1宏和召回率,保持ROC-AUC并可进行lambda敏感性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12995 2026-07-21 cs.RO 版本更新

GenHOI: Contact-Aware Humanoid-Object Interaction by Imitating Generated Videos without Task-Specific Training

GenHOI: 通过模仿生成视频实现接触感知的人形机器人-物体交互,无需任务特定训练

Zhihai Bi, Qiang Zhang, Guoyang Zhao, Jiahang Cao, Xueyin Luo, Yushan Zhang, Jinglan Xu, Ruoyu Geng, Yulin Li, Andrew F. Luo, Jun Ma

机构 * The University of Tokyo(东京大学) National University of Singapore(新加坡国立大学) University of California, Los Angeles(加州大学洛杉矶分校) Tsinghua University(清华大学)

AI总结 提出GenHOI框架,通过模仿单个生成视频实现人形机器人零样本执行多种物体交互任务,无需任务特定训练或物理演示数据,利用接触事件和手-物接触区域编码为几何约束优化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15701 2026-07-20 cs.RO 新提交

RAVEN: Reinforcement-Adaptive Visibility-Graph Planning for Robust Humanoid Navigation with Collision-Free MPC

RAVEN:用于稳健人形机器人导航的强化自适应可见性图规划与无碰撞MPC

Ruochen Hou, Shiqi Wang, Beom Jun Kim, Hanzhang Fang, Mehak Singal, Dennis W. Hong

机构 * Robotics and Mechanisms Laboratory (RoMeLa), Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(机器人与机构实验室(RoMeLa),机械与航天工程系,加利福尼亚大学洛杉矶分校)

AI总结 研究针对人形机器人在动态环境中的导航问题,提出RAVEN框架,通过强化学习自适应调整可见性图规划器几何结构,结合无碰撞MPC层跟踪轨迹,经实验评估,该方法能减少超调、提高狭窄通道稳健性及在延迟噪声下可靠导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15190 2026-07-20 cs.AI 版本更新

Can We Trust Item Response Theory for AI Evaluation?

我们能信任项目反应理论进行人工智能评估吗?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

机构 * Johns Hopkins University(约翰·霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25354 2026-07-20 cs.LG math.ST stat.TH 版本更新

Analysis of Semi-Supervised Learning on Hypergraphs

超图上的半监督学习分析

Adrien Weihs, Andrea L. Bertozzi, Matthew Thorpe

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of Warwick(沃里克大学)

AI总结 研究超图上的半监督学习问题,提出高阶超图学习(HOHL)方法,通过分析随机几何超图上的变分问题,确定缩放机制,证明离散极小值收敛,还给出多尺度拉普拉斯替代并证明收敛,数值实验验证了高阶正则化的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01514 2026-07-20 cs.CL cs.AI cs.CR 版本更新

Decoupled Alignment for Robust Plug-and-Play Adaptation

用于鲁棒即插即用适应的解耦对齐

Haozheng Luo, Jiahao Yu, Wenxin Zhang, Jialong Li, Chenghao Qiu, Yimin Wang, Eric Hanchen Jiang, Jerry Yao-Chieh Hu, Yan Chen, Binghui Wang, Xinyu Xing, Han Liu

机构 * Northwestern University(西北大学) New York University Abu Dhabi(纽约大学阿布扎克分校) Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) University of California, Los Angeles(加州大学洛杉矶分校) Illinois Institute of Technology(伊利诺伊理工学院)

AI总结 研究提出无需训练的大语言模型对齐方法,利用知识蒸馏提取对齐信号,经模型融合实现即插即用的对齐校正,采用增量调试识别关键知识组件,在有害问题数据集上显著提升防御成功率,且不损性能。

Comments Revised to correct the Acknowledgments section. Previous versions inadvertently included acknowledgments of NSF and NIH awards that did not support this work. Those funding acknowledgments have been removed. The technical content, results, and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14487 2026-07-17 cs.RO 新提交

MIDAS Hand: Modular low-Impedance Direct-drive Anthropomorphic Sensing Hand

MIDAS手:模块化低阻抗直接驱动拟人传感手

Alvin Zhu, Mingzhang Zhu, Beom Jun Kim, Quanyou Wang, Jose Victor S. H. Ramos, Dennis Hong

机构 * UCLA(加州大学洛杉矶分校)

AI总结 针对灵巧操作受手部硬件限制的问题,提出低成本开源的MIDAS手,有16个自由度,直接驱动且回驱扭矩低,集成触觉传感,发布完整堆栈,经多种测试分析,为触觉灵巧操作和人机数据收集提供平衡可重复平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15208 2026-07-17 stat.CO cs.LG math.PR stat.ML 新提交

Delocalization of bias in unadjusted Hamiltonian Monte Carlo and underdamped Langevin

无调整哈密顿蒙特卡罗和欠阻尼朗之万中偏差的离域化

Yifan Chen, Xiaoou Cheng, Jonathan Niles-Weed, Jonathan Weare

机构 * Department of Mathematics, University of California, Los Angeles, CA 90095, USA(加州大学洛杉矶分校数学系) Courant Institute, New York University, NY 10012, USA(纽约大学Courant研究所)

AI总结 研究将偏差离域化现象从过阻尼朗之万算法扩展到无调整哈密顿蒙特卡罗和欠阻尼朗之万算法,表明在特定假设下控制高维分布K维边际偏差\(O(\sqrt{K})\)积分步即可,用矩阵多项式框架解决离散时间积分器技术难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17386 2026-07-17 cs.CV cs.AI cs.RO 版本更新

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

TerraTransfer: 无需专家示范的端到端驾驶策略学习

Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

机构 * Applied Intuition UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

AI总结 提出一种无需专家示范的端到端驾驶方法,通过向量化模拟器中的自博弈预训练策略,再与预训练视觉骨干对齐,降低了数据成本并达到或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19244 2026-07-17 cs.CV 版本更新

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13591 2026-07-16 cs.CL cs.AI 新提交

Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

作为受控过程的记忆:为大语言模型智能体学习自适应内存管理

Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of Washington(华盛顿大学) Northwestern University(西北大学)

AI总结 研究LLM智能体内存管理问题,提出MemCon框架将内存操作建模为马尔可夫决策过程,通过在线策略自适应管理内存,该框架与后端无关,实验表明其在多基准测试中优于基线,提升任务成功率并减少令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18798 2026-07-16 cs.MM cs.AI 版本更新

ELF: A Family of Encoder-Free ECG-Language Models

ELF:无编码器心电图语言模型家族

William Han, Tony Chen, Chaojing Duan, Xiaoyu Song, Yihang Yao, Yuzhe Yang, Michael A. Rosenberg, Emerson Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼医疗网络) University of California Los Angeles(加州大学洛杉矶分校) University of Colorado(科罗拉多大学) Allergy and Immunology(过敏与免疫学)

AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。

Comments 34 pages, 12 figures; Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14893 2026-07-16 cs.RO 版本更新

STITCHER: Constrained Trajectory Planning in Complex Environments with Real-Time Motion Primitive Search

STITCHER:通过实时运动原语搜索在复杂环境中进行约束轨迹规划

Helene J. Levy, Brett T. Lopez

机构 * VECTR Laboratory, University of California, Los Angeles(VECTR实验室,加州大学洛杉矶分校)

AI总结 研究针对自主高速穿越复杂环境的轨迹规划问题,提出无优化规划框架STITCHER,通过拼接短轨迹段和图搜索实时计算轨迹,经模拟与硬件测试验证其性能优越,能满足多种约束并高速实时规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12631 2026-07-15 cs.CL cs.AI 新提交

Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?

诱导情绪会影响大语言模型在序列决策中的行为吗?

Minh Khoi Ho, Zihao Zhu, Runchuan Zhu, Levina Li, Zhiwen Fan, Zhangyang Wang, Junyuan Hong

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Texas A&M University(德州农工大学) National University of Singapore(新加坡国立大学) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mass General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12385 2026-07-15 cs.AI 新提交

PM-Bench: Evaluating Prospective Memory in LLM Agents

PM-Bench:评估大语言模型智能体中的前瞻记忆

Genglin Liu, Saadia Gabriel

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 研究针对智能体人工智能中的前瞻记忆挑战,引入PM-Bench基准,受认知科学启发评估大语言模型智能体相关能力。在模拟一周内比较八个先进模型,发现各模型在此基准测试中均具挑战性,且无单一改善策略占优,还发布该基准用于诊断与干预。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24372 2026-07-15 cs.LG cs.AI cs.NE 版本更新

Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning

大规模进化策略:超越强化学习的LLM微调

Xin Qiu, Yulu Gan, Conor F. Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Meyerson, Babak Hodjat, Risto Miikkulainen

机构 * University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) Cognizant AI Lab, San Francisco, CA, USA(Cognizant AI实验室) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

AI总结 本文提出使用进化策略进行大规模LLM微调,证明其在多个方面优于强化学习,为LLM微调提供了新的方法。

Comments Published at ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10116 2026-07-14 cs.LG cs.AI 新提交

When Data Imbalance Helps: Robust Generalization Through Shortcut Saturation

数据不平衡何时起作用:通过捷径饱和实现稳健泛化

Cheng-Ting Chou, Duc Binh Hoang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Purdue University(普渡大学)

AI总结 研究虚假相关性下数据不平衡对模型泛化的影响,通过改变虚假比率和模型容量发现数据不平衡能促进强大模型泛化,如合成任务中2层变压器在特定虚假比率下泛化效果提升,还通过机制分析找到相关途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10719 2026-07-14 cs.CV 版本更新

SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

SpaceDrive: 在基于视觉语言模型的自动驾驶中引入空间感知

Peizheng Li, Zhenghao Zhang, David Holtz, Hang Yu, Yutong Yang, Yuzhi Lai, Rui Song, Andreas Geiger, Andreas Zell

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) TU Munich(慕尼黑工业大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Stuttgart(斯图加特大学) UCLA(加州大学洛杉矶分校)

AI总结 本文提出SpaceDrive框架,通过将空间信息作为显式位置编码来增强基于VLM的自动驾驶系统对精细3D空间关系的理解,从而提升规划精度和开放环性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09059 2026-07-13 cs.AI 新提交

ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning

ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架

Kunbo Zhang, Lei Fu, Zeyu Wang, Zijing Liu, Kejian Tong

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Northeastern University(东北大学)

AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03595 2026-07-13 cs.CL 版本更新

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏