arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2542
2609.19145 2026-09-17 cs.CL cs.AI 新提交

Objective vs. Search: Decomposing What Makes a Good Tokeniser

目标 vs. 搜索:分解什么造就一个好的分词器

Ahmetcan Yavuz, Clara Meister, Tiago Pimentel

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

AI总结 本研究通过补全2x2设计空间,分解词元化器的优化目标与搜索过程,发现搜索过程(自底向上合并)主导性能,而非目标,为构建更优分词器提供指导。

Comments Accepted at EMNLP 2026. 20 pages, 4 figures, 10 tables. Code: https://github.com/Ahmetcanyvz/comp-vs-like

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19144 2026-09-17 cs.CL cs.AI cs.LG 新提交

A Zeroth-Order Paradigm for LLM Preference Alignment

大语言模型偏好对齐的零阶范式

Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

机构 * University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) DAMO Academy, Alibaba Group U.S.(阿里巴巴集团美国达摩院) Columbia University(哥伦比亚大学)

AI总结 本文提出零阶对齐方法ComPO,利用比较oracle提取偏好方向信息,避免似然位移,并在多种LLM上实现更优的长度控制胜率。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19143 2026-09-17 cs.CV cs.CL 新提交

PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

PANORAMA: 通过掩码提议选择的全景接地描述

Sara Pieri, Evangelos Kazakos, Shizhe Chen, Josef Sivic, Cordelia Schmid

机构 * Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所,巴黎高等师范学院,法国国家科学研究中心,巴黎文理研究大学) Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague(捷克信息学、机器人与控制论研究所,布拉格捷克理工大学)

AI总结 针对视觉-语言模型在图像描述中缺乏像素级接地的问题,提出全景接地描述任务,构建PanoCaps基准并设计PANORAMA模型,通过从短语条件掩码提议中选择实现高质量接地,达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19142 2026-09-17 cs.CV cs.RO 新提交

PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

PointZero:用于学习可迁移三维动力学的三维点轨迹补全

Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung, Bowen Wen, Stan Birchfield, Yunzhu Li, Deva Ramanan, Jeffrey Ichnowski

机构 * CMU(卡内基梅隆大学) Columbia(哥伦比亚大学) NVIDIA(英伟达)

AI总结 PointZero提出以三维点轨迹补全为预训练目标,无需机器人数据即可学习可迁移三维动力学,并在下游动作预测和模仿学习任务中优于基线。

Comments https://pointzero-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19137 2026-09-17 cs.RO cs.AI 新提交

Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

梦见接触的声音:利用视频和音频生成实现零样本力感知操作与数据生成

Guanhua Ji, Tianyu Li, Dayoon Suh, Yuqian Zhang, Boyan Zhang, Nadia Figueroa

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本工作提出利用视频和音频生成,从自然语言提示中推导力感知轨迹,通过音频响度塑造目标力曲线,在Franka Panda机器人上实现零样本接触任务成功,并用于数据生成训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19135 2026-09-17 cs.LG 新提交

Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging

历史依赖日志记录下离线策略评估的指数级困难性

Pranaya Jajoo

机构 * University of Alberta(阿尔伯塔大学)

AI总结 本研究证明,在历史依赖记录下,即使数据覆盖所有隐藏状态,离线策略评估仍可能指数级困难,通过构造POMDP实例并给出匹配的最优估计器,确立了该问题的难解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19134 2026-09-17 cs.CL cs.CY 新提交

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments

ScienceIDE:将全球科学代码库转化为智能体可学习环境

Hejia Geng, Zesen Huang, Haoyang Li, Wenbin Li, Koutian Wu, Zihan Zhou, Yuanbo Pang, Weihao Liu, Zigong Xu, Zhiping Li, Zongzheng Zhang, Chuanfei Dong, Jiankai Sun, Tianzhe Zheng, Fengyu Xie, Yue Ma, Yueheng Shi, Tong Xie, Zonglin Di, Xianrong Liu, Qucheng Gao, Yimin Liu, Jiaming Pan, Sheng Huang, Xiao-Han Ma, Lanqing Yuan, Zhenlin Zhu, Ziang Liu, Ziyang Xu, Junkai Wang, Kangkai Liang, Jiayi Xian, Zehong Zhao, Liuwei Xu, Jingxu Xie, Peijin Zhang, Qiang Gao, Chengyi Xing, Zhe Zhao, Xi Wang, Yaopeng Xing, Xing Meng, Zhenfei Yin, Yingcheng Wu, Ling Yang

机构 * PhAI-Labs(PhAI实验室) Qwen

AI总结 针对科学代码难以转化为学习体验的瓶颈,提出ScienceIDE基础设施,将科学代码仓库转化为可执行环境,训练PhAI-IDE系列模型,在代码修复和通用基准上取得提升。

Comments Code: https://github.com/aitofound/ScienceIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19128 2026-09-17 cs.AI cs.LG cs.MA 新提交

Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments

双过程语言智能体的认知扩展:交互环境中的记忆与自我反思

João Meneses dos Santos, Arlindo L. Oliveira

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) INESC-ID(INESC-ID研究所)

AI总结 本研究通过为双过程语言智能体SwiftSage添加自适应记忆模块和自我反思模块,在ScienceWorld环境中显著提升了任务成功率,并发现执行时间控制是主要瓶颈。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19122 2026-09-17 cs.CV 新提交

Adaptive Convolutional Sparse Coding via Information Bottleneck for Robust Visual Signal Representation

基于信息瓶颈的自适应卷积稀疏编码用于鲁棒视觉信号表示

Meng'en Qin, Yinchen Liu, Mingxuan Cui, Youlu Xing

机构 * Shenzhen University of Advanced Technology(深圳理工大学) University of Electronic Science and Technology of China(电子科技大学) Shandong University(山东大学)

AI总结 提出自适应卷积稀疏编码框架,通过信息瓶颈动态调整稀疏系数,结合FISTA展开与后训练策略,在CIFAR和ImageNet上显著提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19107 2026-09-17 cs.LG 新提交

How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents

模型增长、递归与边界算子如何影响缩放指数

Zixi Chen, Akshay Vegesna, Samip Dahal, Andrew Gordon Wilson

机构 * Q Labs(Q实验室) New York University(纽约大学)

AI总结 该研究证明架构干预(如模型增长、循环和边界算子)可改变预训练缩放指数,带来计算效率的指数级提升,其中模型增长效果最显著,且增益随规模增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19104 2026-09-17 cs.RO cs.AI 新提交

rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

rMuscle:用于高效视觉-语言-动作模型推理的机器人肌肉记忆

Kaijun Zhou, Zhiyang Li, Le Chen, Jinyu Gu

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所)

AI总结 针对VLA模型推理延迟问题,提出受肌肉记忆启发的rMuscle框架,利用跨执行相似性通过双阶段缓存减少计算和权重访问,在多种任务上实现1.29-1.42倍加速且保持成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19099 2026-09-17 cs.LG 新提交

Evidence-Grounded Agentic Formulation Development in an Autonomous Laboratory

自主实验室中基于证据的智能体配方开发

Michael M. Craig, Riley J. Hickman, Yingshan Ma, Rémi Piché-Taillefer, Christine Allen, Pauric Bannigan

机构 * Intrepid Labs(无畏实验室)

AI总结 本文提出智能体系统Andromeda 2,利用结构化内部实验证据和自动化实验室,在紫杉醇SEDDS配方开发中显著提升命中率与载药量,优于现有优化模型和实验设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19093 2026-09-17 cs.CL cs.AI 新提交

Reporting Practice Matters: The Impact of Reference Choice on Chest X-ray Report Evaluation

报告实践至关重要:参考选择对胸部X光报告评估的影响

Daniel P. Jeong, Charles Q. Li, Hossein Hosseiny, Nitya M. Bhalla, Fatma Uyar Morency, Pradeep Ravikumar, Zachary C. Lipton, Michael Oberst

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼健康网络) Highmark Health(海马克健康) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 本研究量化了放射学报告实践变化对AI报告生成评估指标的影响,提出ReRef方法重写参考报告,并发布MIMIC-CXR-Ext-ReRef数据集,证明参考选择可改变模型排名。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19088 2026-09-17 cs.AI cs.CL cs.CV 新提交

MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

MUSE:在情境化教育中的多模态理解上对大型视觉-语言模型进行基准测试

Luyao Zhu, Xun Wei Yee, Wei Li, Mun Thye Mak, Wee Siong Ng

机构 * AI Singapore, National University of Singapore(新加坡国立大学新加坡人工智能) School of Computing, National University of Singapore(新加坡国立大学计算学院) Institute of Advanced Intelligence and Computing, A*STAR(新加坡科技研究局先进智能与计算研究所)

AI总结 提出MUSE基准,评估大型视觉-语言模型在情境化教育中对艺术图像的多模态理解,涵盖十二项任务,揭示模型在情感解读和组合推理上的显著差距,并识别常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19077 2026-09-17 cs.LG cs.AI 新提交

Probabilistic Linear Explanations

概率线性解释

Frederic Koriche, Jean-Marie Lagniez, Chi Tran

机构 * Computer science Research Institute of Lens (CRIL), UMR CNRS 8188, University of Artois(朗斯计算机科学研究所(CRIL),CNRS UMR 8188,阿尔图瓦大学)

AI总结 本文提出基于稀疏锚定线性模型的统一概率可解释框架,适用于分类与回归,通过布尔超立方体映射捕捉特征贡献,并证明其相关性误差有界,实验优于LIME和MAPLE。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19074 2026-09-17 cs.LG cs.AI 新提交

RLLBC-Lib: An Educational Code Library for Reinforcement Learning and Learning-Based Control

RLLBC-Lib:用于强化学习与基于学习的控制的 educational 代码库

Bernd Frauenknecht, Emma Cramer, Artur Eisele, Paul Kruse, Lukas Kesper, Jonas Hertrampf, Ramil Sabirov, Jyotirmaya Patra, Johannes Berger, Paul Brunzema, Friedrich Solowjow, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering (DSME)(机械工程数据科学研究所) RWTH Aachen University(亚琛工业大学)

AI总结 RLLBC-Lib 是一个教育代码库,通过表格型与深度 RL 实现降低学习门槛,并支持自动评分作业。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19072 2026-09-17 cs.CL cs.CY cs.LG 新提交

Safety-Flag: A Unified Benchmark for the Reliability and Calibration of LLM Content Moderators

Safety-Flag:LLM 内容审核器可靠性与校准的统一基准

Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

AI总结 Safety-Flag 是一个统一基准,整合七个安全基准,评估 LLM 内容审核器的错误方向、校准和置信度排序,发现总体准确率掩盖严重偏差,温度校准可大幅降低误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19070 2026-09-17 cs.CL 新提交

Reading Between the Lines: Can LLMs Discover the Question Behind the Text?

字里行间:大语言模型能否发现文本背后的问题?

Claudiu Creanga, Liviu P. Dinu

机构 * University of Bucharest(布加勒斯特大学)

AI总结 本文提出“问题考古学”任务,通过新数据集评估大语言模型推断文本背后作者意图的能力,发现当前模型超越人类,为AI理解人类交流提供新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19059 2026-09-17 cs.CL cs.AI 新提交

MIRAGE: How Conversation State Shapes Historical Evidence Use in Multimodal Personal Agents

MIRAGE:对话状态如何影响多模态个人代理中的历史证据使用

Yu Liu, Wenxiao Zhang, Cheng Hu, Cong Cao, Fangfang Yuan, Xinyu Wang, Jin B. Hong, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)

AI总结 本研究提出MIRAGE框架,通过控制对话状态变化评估多模态个人代理的历史证据使用,发现压缩前后存在非单调失败机制,强调需在状态变化下评估而非仅看结果正确性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19048 2026-09-17 cs.LG 新提交

Integrated Optimization of Automated Warehouse Operations and Last-Mile Transport for Differentiated On-Demand Delivery

差异化按需配送下自动化仓库运营与最后一公里运输的集成优化

Xiaozhu Sun, Bilal Farooq

机构 * Toronto Metropolitan University(多伦多城市大学)

AI总结 针对差异化按需配送,提出集成AGV智能仓库与最后一公里运输的深度强化学习联合优化框架,实现仓储100%准时率,末公里时间降29.3%-53.2%,高优先级服务率超92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19044 2026-09-17 cs.CL cs.HC 新提交

Entropy in Conversational AI: Structured Unpredictability as Inferrable Interiority

对话式AI中的熵:结构化不可预测性作为可推断的内在性

Sebastian Cochinescu

机构 * University of Bucharest(布加勒斯特大学)

AI总结 本研究提出结构化不可预测性作为对话AI设计目标,通过选择层更新隐藏状态并选择响应,实验表明该方法提升词汇新颖性但未建立路径依赖,且未测试感知心智主张。

Comments 18 pages, 5 figures, 6 tables. Ancillary files contain the complete artifact: code, frozen protocol, per-sequence and per-item outcome files, and deterministic analysis scripts. Code archive: https://doi.org/10.5281/zenodo.21462383 Final-grid pre-registration: https://osf.io/dyt3w/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19041 2026-09-17 cs.RO 新提交

Loco-Loco-RL: Low-Cost Terrain Mapping for Humanoid Locomotion with Reinforcement Learning

Loco-Loco-RL:基于强化学习的人形机器人低成本地形测绘

Jordan Dowdy, Gryffin Reizian, Jean Chagas Vaz

机构 * University of Louisville(路易斯维尔大学)

AI总结 本文提出Loco-Loco-RL,利用低成本飞行时间传感器获取紧凑3D地形表示,结合令牌压缩的时间变换器策略,实现人形机器人鲁棒的地形行走,并通过仿真到现实迁移验证。

Comments 6 pages, 3 figures. Accepted manuscript. Accepted for publication in the 2026 IEEE National Aerospace and Electronics Conference (NAECON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19040 2026-09-17 cs.RO 新提交

Learning to Stack: Cube-Stacking Imitation Learning from Virtual Reality Demonstrations

学习堆叠:基于虚拟现实演示的立方体堆叠模仿学习

Gryffin Reizian, Jordan Dowdy, Jean Chagas Vaz

机构 * University of Louisville(路易斯维尔大学)

AI总结 本研究提出基于虚拟现实的数据收集流程,在Isaac Sim中收集200个立方体堆叠演示,训练行为克隆策略,实现无需重复遥操作的演示复用。

Comments 5 pages, 3 figures. Accepted manuscript. Accepted for publication in the 2026 IEEE National Aerospace and Electronics Conference (NAECON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19011 2026-09-17 cs.LG 新提交

TwinMark: A Unified Watermark for Provable Survival Under Feature and Logit Distillation

TwinMark:一种在特征与logit蒸馏下可证明存活的统一水印

Redwanul Karim, Tobias Feigl, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所) University of Technology Nürnberg (UTN)(纽伦堡工业大学)

AI总结 TwinMark提出一种双通道水印方案,通过协方差投影和Fisher对齐线性载体读取共享秘密,在特征与logit蒸馏攻击下提供可证明的检测能力,并跨多种架构和任务验证其鲁棒性。

Comments 10 figures, 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19010 2026-09-17 cs.LG cs.AI cs.CV 新提交

Tabular Deep Learning vs Classical Machine Learning for Urban Land Cover Classification

表格深度学习与经典机器学习在城市土地覆盖分类中的对比研究

Muntasir Tabasum, Tanpia Tasnim, Md. Ekramul Islam, Al Zadid Sultan Bin Habib

机构 * West Virginia University(西弗吉尼亚大学) Green University of Bangladesh(孟加拉国绿色大学) Stamford University Bangladesh(孟加拉国斯坦福大学)

AI总结 本研究在UCI城市土地覆盖数据集上对比经典机器学习与表格深度学习模型,发现TDL模型在非线性交互显著且处理类别不平衡时能匹配或超越树集成方法,为城市制图提供互补优势。

Comments Published in NeurIPS 2025 The 5th Muslims In ML (MusIML) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19006 2026-09-17 cs.CL cs.AI 新提交

WordPolo: Evaluating Language Models Through Iterative Semantic Feedback

WordPolo:通过迭代语义反馈评估语言模型

Tyler McDonald, Ali Emami

机构 * Brock University(布鲁克大学) Emory University(埃默里大学)

AI总结 WordPolo通过语义反馈找词任务,评估LLM和LRM的迭代推理与搜索策略,引入进展指标揭示模型能力,强调过程与结果并重的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.19004 2026-09-17 cs.LG cs.CL 新提交

CompileRover: Revolutionizing Virtual Machine Compiler Optimization with a Tri-Role LLM-Driven Framework

CompileRover:利用三角色LLM驱动框架革新虚拟机编译器优化

Mingqiao Mo, Yunlong Tan, Hao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 CompileRover提出三角色(裁判、顾问、操作员)LLM驱动框架,通过控制流分析、结构转换和动态模式识别优化虚拟机编译器,显著提升执行性能并降低开销。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.18999 2026-09-17 cs.SD eess.AS 新提交

Variable-Rate Harmonic-Percussive Time-Scale Modification with Real-Time Playback in Python

可变速率谐波-打击乐时间尺度修改及其Python实时播放

Sayema Lubis, Clark Peng, Jared Carreño, TJ Tsai

机构 * Harvey Mudd College(哈维穆德学院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出一种Python实现的谐波-打击乐时间尺度修改方法,支持可变速率实时播放,通过预计算表优化减少约一半运行时间,且感知质量不变。

Comments 10 pages, 3 figures, 2 tables. Open-source implementation: https://github.com/HMC-MIR/TSMRealTime

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.18998 2026-09-17 cs.LG cs.CL cs.MA 新提交

One Axis, No Brake: Self-Knowledge Limits the Filtering of Harmful Peer Conformity in LLMs

单轴无刹车:自我认知限制了大语言模型中有害同伴一致性的过滤

Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

AI总结 本研究揭示多智能体LLM系统中过滤有害同伴一致性受限于模型自我认知,提出“墙”与“悬崖”现象,强调修订前信息优于事后过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.18996 2026-09-17 cs.AI cs.CL 新提交

Compiled Agency: Frontier General-Purpose Coding Agents Build Winning Game Players from Bare Interaction - from Flappy Bird to StarCraft II and Civilization

编译智能体:前沿通用编码智能体从裸交互到构建制胜游戏玩家——从Flappy Bird到星际争霸II和文明

Joey Xiao, Haonan Huang

机构 * New York University(纽约大学) Princeton University(普林斯顿大学)

AI总结 本文提出Gauntlet框架,验证前沿通用编码智能体能在无辅助情况下,通过单次自主会话从裸交互构建完整游戏控制器,首次独立赢得星际争霸II和文明等完整商业游戏,展现编译智能体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏