arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2085
2608.18077 2026-08-19 cs.RO 新提交

Hydra-0: Action Flow for Generalist World Modeling and Control

Hydra-0:面向通用世界建模与控制的动作流

Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang

机构 * NVIDIA(英伟达) Brown University(布朗大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

AI总结 本研究提出Hydra-0通用世界模型,以动作流为条件实现跨实体、任务等的通用建模控制,在RoboLab基准获高相关性,还涌现出逆模式,可助力机器人控制。

Comments Project page: https://nvidia-isaac.github.io/video_to_data/hydra-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-19 cs.CV cs.AI 新提交

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18066 2026-08-19 cs.AI cs.CL cs.LG 新提交

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自改进智能体的脆弱性:方差、任务顺序与规格不足

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。

Comments Code: https://github.com/SalesforceAIResearch/self-improve-fragility Data: https://huggingface.co/datasets/Salesforce/self-improve-fragility

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18063 2026-08-19 cs.CV 新提交

EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

EditBridge:迈向忠实且高效的超高清图像编辑

Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) National University of Singapore(新加坡国立大学)

AI总结 针对现有扩散图像编辑模型无法高效处理超高清图像的问题,提出EditBridge扩散桥框架,通过先验引导的块级稀疏注意力机制实现4K高保真编辑,速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-19 cs.CL cs.LG 新提交

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18058 2026-08-19 cs.AI 新提交

Delegation Asymmetry in Agentic Recommender Systems: Measuring Two-Sided Receptivity in Online Dating

智能体推荐系统中的委托不对称性:在线约会中的双边接受度测量

Daria Leshchikova, Valentina V. Kuskova, Dmitry Zaytsev, Valerii Klimov

机构 * Fleamily, Inc.(弗利米利公司) Lucy Family Institute for Data & Society(露西数据与社会研究所) University of Notre Dame(圣母大学)

AI总结 该研究针对约会平台智能体推荐系统,开发测量双边智能体接受度的模型,发现存在委托不对称性,量化了相关倾向及设计杠杆,为智能体推荐设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18056 2026-08-19 cs.AI 新提交

HLSR: Hybrid Live Forecast Selective Dynamic Vehicle Rerouting for Real-Time Congestion Avoidance

HLSR:用于实时拥堵规避的混合实时预测选择性动态车辆重路由算法

Xiao Wang, Shun Ren Yang, Hui Nien Hung

机构 * National Tsing Hua University(国立清华大学) National Chiao Tung University(国立交通大学)

AI总结 针对城市交通拥堵问题,提出HLSR框架,通过融合实时与预测数据的选择性重路由方法,实现实时拥堵规避,提升重路由的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18050 2026-08-19 cs.AI 新提交

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents

StagedWorkspace:面向知识工作智能体的版本化工作空间

Yining Hua, Hongbin Na, Yifan Zhou, Akshay Kalose, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) Raycaster AI(雷caster人工智能公司) University of Technology Sydney(悉尼科技大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 该研究针对知识工作智能体的版本化工作空间问题,提出StagedWorkspace方案,通过绑定解析记录与原生文件内容哈希提升性能,在OfficeQA Pro等数据集上取得显著优于基准的效果,为相关基准构建提供了新方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18041 2026-08-19 cs.CL 新提交

Language Has Two Parameters: Narrative-Induced Semantic Plasticity and Phase-Sensitive Interpretation

语言具有两个参数:叙事诱导的语义可塑性与相位敏感的解读

Hollis Robbins

机构 * University of Utah(犹他大学)

AI总结 该研究提出语言解读需第二个带符号、持久且以个体与二元组为索引的相位参数,指出标准Transformer无相位显式表征,需构建承载相位语义状态的语言模型。

Comments 23 pages; 0 figuresCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18040 2026-08-19 cs.LG cs.CV 新提交

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

优化你的采样:基于贝叶斯优化的调优扩散采样

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学)

AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18034 2026-08-19 cs.CV 新提交

Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation

深度学术调查:用于学术调查自动化的有状态智能体闭环范式

Zhikai Xu, Zhucun Xue, Teng Hu, Yabiao Wang, Yong Liu, Jiangning Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出DAS框架,通过状态智能体闭环实现学术调查自动化,在DAS-Bench基准测试中,其在引用质量等四维度得分及专家评估中均优于现有系统。

Comments Project page: https://zhikaixu24.github.io/projects/DAS/ | Code: https://github.com/ZhikaiXu24/DAS | Data: https://huggingface.co/datasets/ZhikaiXu24/DAS-2M

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18028 2026-08-19 cs.CV 新提交

Initialization-Free Bundle Adjustment Revisited: A Controlled Experimental Study

重新审视无需初始化的光束平差法:一项受控实验研究

Simon Weber, Mateo de Mayo, Je Hyeong Hong, Carl Olsson, Daniel Cremers, Ronald Clark

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Hanyang University(汉阳大学) Lund University(隆德大学)

AI总结 本文通过统一评估框架开展受控实验,揭示无需初始化的光束平差法存在优化-重建差距,明确其核心挑战是获取可可靠度量升级的投影重建,为该领域研究提供了实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18027 2026-08-19 cs.CL 新提交

Chain-of-Experience for Continual LLM Improvement

用于持续改进大语言模型的经验链(Chain-of-Experience, CoE)

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Bytedance Seed(字节跳动Seed)

AI总结 该研究提出经验链(CoE)方法,通过迭代交互让LLM从经验中持续改进,在多领域8种LLM上验证其比无反馈基线更优,结合互补反馈可进一步提升,且每令牌准确率高于现有测试时策略。

Comments H.T. and Y.F. contributed to this work equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18026 2026-08-19 cs.LG cs.CE 新提交

TabNSM: Neural Sparse Mixer for Tabular Regression

TabNSM:面向表格回归的神经稀疏混合器

Ali Eslamian, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Institute for Biomedical Informatics(生物医学信息学研究所)

AI总结 该研究提出TabNSM框架,通过自适应稀疏交互模块、多阶段回归头等组件,在9个真实回归基准上实现高维表格回归的优性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18025 2026-08-19 cs.LG cs.AI cs.SD 新提交

Why GPT-Style Models Do Not Directly Transfer to Symbolic Music: Compression in the Wrong Coordinate System

为何GPT风格模型无法直接迁移到符号音乐:错误坐标系中的压缩

Yi Wang

机构 * Tsinghua University(清华大学)

AI总结 该研究针对GPT风格模型无法直接迁移到符号音乐的问题,提出有效性-无损性框架,通过构建预测有效且关系无损的坐标系优化标记化,实验验证了相关边界,揭示了跨模态迁移的关键在于标记化接口而非架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18021 2026-08-19 cs.LG 新提交

Revisiting WEASEL 2.0: Reproduction, Sensitivity, and an Adaptive Ensemble-Size Rule

再探WEASEL 2.0:复现、敏感性分析与自适应集成规模规则

Cian Higgins, Gerard Carrigan, Pinar Sungu Isiacik, Georgiana Ifrim

机构 * University College Dublin(都柏林大学学院)

AI总结 本研究复现了WEASEL 2.0,分析其四项设计选择的敏感性,发现最大集成规模规则对长序列数据集配置过度,提出自适应规则后可减少内存和时间消耗且准确率影响极小。

Comments 24 pages, 7 figures. Accepted at the 11th International Workshop on Advanced Analytics and Learning on Temporal Data (AALTD 2026), held at ECML/PKDD 2026, Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18017 2026-08-19 cs.AI 新提交

Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach

大语言模型能否解释飞行安全事件?一种先验引导的基于语义大语言模型的方法

Lu Xu, Xu Li, Linjiang Zheng, Fan Li, Riquan Zhang, Jiaxing Shang

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Sichuan Flight Engineering Technology Research Center, Civil Aviation Flight University of China(中国民航飞行学院四川飞行工程技术研究中心) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海对外经贸大学统计与数据科学学院)

AI总结 本研究针对飞行安全事件解释难题,提出FlightLLM方法,结合特征工程、语义离散化、CatBoost先验引导及对比小样本学习等技术,在704个A320飞行样本上实现了良好分类与合理事件原因解释。

Comments 14 pages, 6 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18011 2026-08-19 cs.CL 新提交

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛

Eduardo Sánchez, Rita Berrada, Dan-Mircea Mirea, Sara Rajaee, Alexander Piperski, Ana Meta Dolinar, Boris Iomdin, Andrey Nikulin, Mariya Shmatova, Marzieh Fadaee, Julia Kreutzer

机构 * University College London(伦敦大学学院) Meta CentraleSupélec(中央高等电力学院) McGill University(麦吉尔大学) Cohere Labs(Cohere实验室) Princeton University(普林斯顿大学) University of Amsterdam(阿姆斯特丹大学) Stockholm University(斯德哥尔摩大学) Faculty of Liberal Arts and Sciences(文理学院) Universidade Federal de Goiás(戈亚斯联邦大学)

AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18009 2026-08-19 cs.CV 新提交

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

基于记忆树引导的关键帧查询的高效三维问答

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon(亚马逊公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18008 2026-08-19 cs.LG cs.AI 新提交

Policy-Invariant Reward Shaping from LLM Feedback: A Framework for Hybrid RL Agents

基于大语言模型反馈的策略不变奖励塑形:混合强化学习智能体框架

Christophe D. Hounwanou, John Emeka Eze, Yaé U. Gaba

机构 * AI Research and Innovation Nexus for Africa (AIRINA Labs)(非洲AI研究与创新中心(AIRINA实验室)) Sefako Makgatho Health Sciences University (SMU)(塞法科·马加托健康科学大学) African Center for Advanced Studies (ACAS)(非洲高级研究中心) African Institute for Mathematical Sciences(非洲数学科学学院)

AI总结 该研究针对LLM衍生奖励信号的理论模糊问题,提出基于LLM反馈的策略不变奖励塑形框架,将混合架构形式化为目标增强MDP,证明其最优策略集保留保证更强,并通过数值实验验证了结果。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17995 2026-08-19 cs.CV 新提交

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: https://github.com/QHR69/AViTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17994 2026-08-19 cs.CL 新提交

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

判断、检索或弃权:带有可证明风险保证的不确定性引导大语言模型(LLM)判断

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Emory University(埃默里大学)

AI总结 本研究针对无参考LLM评判的可靠性问题,提出带可证明风险保证的不确定性引导双模式风险控制框架,在维持目标错误率的同时提升了判决覆盖率。

Comments Accepted at Conference on Language Modelling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17988 2026-08-19 cs.CV 新提交

GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation

GS-Voxel:用于大规模3DGS生成的免拟合结构化隐变量

Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Amap(高德地图) Alibaba(阿里巴巴)

AI总结 GS-Voxel是免拟合结构化隐变量框架,可将预优化3DGS重建转为稀疏活跃体素,通过GS专用VAE编码为稀疏3D隐变量,结合图像条件流模型实现大规模航空3DGS场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17983 2026-08-19 cs.CV cs.AI 新提交

Dual Co-Train: Cross-Dataset Ultrasound Tongue Segmentation Under Extreme Data Scarcity

双协同训练:极端数据稀缺场景下的跨数据集超声舌部分割

Alisher Myrgyyassov, Zhen Song, Bruce Xiao Wang, Yu Sun, Min Ney Wong, Yihao Zhou, Yongping Zheng

机构 * Hong Kong Polytechnic University(香港理工大学) Research Institute for Smart Ageing(智能老龄化研究院)

AI总结 本文提出基于UltraUNet的无源域适应框架,通过伪标签优化、质量控制及条件GAN合成样本,在12组跨数据集超声舌分割任务中优于基线方法,提升了分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17981 2026-08-19 cs.LG 新提交

Recirculation

再循环

Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind) University of Texas, Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出推理时架构增强技术“再循环”及其自适应变体,无需额外训练,可显著降低Gemma3系列模型的困惑度、提升推理任务准确率,为架构演进提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17979 2026-08-19 cs.CL 新提交

When Writing Style Drifts: Benchmarking Authorship Verification under Distribution Shifts in Genre, Time and the AI-Era

当写作风格发生漂移:在体裁、时间与AI时代的分布偏移下对作者验证进行基准测试

Lotta Kiefer, Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(纽伦堡工业大学(UTN))

AI总结 本研究推出首个德语作者验证基准AVShift,对跨体裁、时间及AI时代分布偏移下的作者验证进行基准测试,发现微调LLM跨体裁泛化最佳,时间漂移是影响作者验证的最强因素之一,未观测到可测量的AI时代分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17973 2026-08-19 cs.CV 新提交

LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching

LinCa:基于可学习分解特征缓存的扩散模型加速方法

Jinshan Liu, Haoran Qin, Xiaobing Tu, Jiacheng Liu, Jiahui Hu, Zhengan Yan, Yukun Xie, Kerui Shen, Jinkui Ren, Yuqi Lin, Xiantao Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) South China University of Technology(华南理工大学) Jilin University(吉林大学)

AI总结 本文提出LinCa框架,通过可学习可逆网络分解缓存特征并差异化预测,仅需少量额外参数即可在5-7倍加速下使扩散模型保持近无损质量,性能优于现有方法。

Comments Accepted to ECCV 2026. 28 pages including appendix. Code: https://github.com/QHR69/LinCa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17972 2026-08-19 cs.SD 新提交

Target Speaker Identification: A Low-Latency Streaming Pipeline

目标说话人识别:一种低延迟流式处理管道

Patrick S. Burke, Satyam Raj, Sean Kinahan

机构 * Arizona State University(亚利桑那州立大学)

AI总结 针对助听器低延迟需求,提出含流式说话人分割与验证的两步法管道,经多工具基准测试与参数优化,17个评估片段中中位数准确率超0.90,为低延迟选择性放大提供概念验证。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17971 2026-08-19 cs.LG 新提交

Evaluating and improving crop-yield forecasting methods during extreme drought

极端干旱期间作物产量预测方法的评估与改进

Shrey Gupta, Yi Ming, George Mohler

机构 * Boston College(波士顿学院)

AI总结 本研究针对极端干旱年份2012年的县级玉米产量预测问题,对比非深度学习与深度学习模型,采用样本加权和特征选择改进非深度学习模型,发现VITA模型表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏