arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2108
2608.27456 2026-08-28 cs.CV 新提交

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27455 2026-08-28 cs.CL 新提交

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

CritICL:基于小语言模型失败模式的推理时弱到强泛化

Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学) Princeton University(普林斯顿大学)

AI总结 CritICL是一种新型推理时框架,利用小语言模型的结构化失败模式,通过两种变体提升推理性能,效率优于标准上下文学习和测试时缩放方法。

Comments this https URL (https://github.com/umwyf/CRITICL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27454 2026-08-28 cs.AI cs.CL 新提交

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

WikiSkill:将智能体经验编译为持久知识以实现技能演化

Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu

机构 * Google Research(谷歌研究院) Virginia Tech(弗吉尼亚理工大学)

AI总结 WikiSkill是使智能体技能与持久知识库协同演化的框架,在多基准与模型上优于现有方法,证实持久知识积累对技能演化关键,且演化技能可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27448 2026-08-28 cs.CL 新提交

TTPO: Test-Time Policy Optimization

TTPO:测试时策略优化

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。

Comments Project Page: this https URL (https://zju-real.github.io/TTPO) Code: this https URL (https://github.com/ZJU-REAL/TTPO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27428 2026-08-28 cs.CL 新提交

Stochastic Estimation of Transduced Language Models

转导语言模型的随机估计

Vésteinn Snæbjarnarson, Samuel Kiegeland, Manuel de Prada Corral, Ryan Cotterell, Tim Vieira

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

AI总结 该研究针对转导语言模型提出无放回重加权的递归束求和算法,实现目标前缀概率的无偏估计,在文本、DNA等任务上较基线方法有更优性能,可支撑长目标字符串的前缀概率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27420 2026-08-28 cs.CL 新提交

Boosting LLM Exploration via Weak-Model Guidance in RLVR

通过RLVR中的弱模型引导增强大语言模型探索能力

Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) National Engineering Research Center of New Electronic Publishing Technologies(国家新型电子出版技术工程研究中心)

AI总结 本研究提出弱模型引导的RLVR方法,通过弱模型的部分推理轨迹增强LLM探索,缓解熵崩溃,在数学基准上提升大k值下的推理性能与覆盖范围。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27417 2026-08-28 cs.CV 新提交

Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information

检索头与视觉结合:揭示视觉语言模型如何定位和提取视觉信息

Chanho Park, Daehyeon Choi, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 该研究发现视觉语言模型(VLMs)中存在视觉检索头(VRHs),其占注意力头的1.7%-2.6%,负责将文本描述与图像区域建立因果关联,屏蔽前20个VRHs可使定位准确率降低多达80个百分点,且VRHs具备泛化性、功能特异性与架构共享性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27409 2026-08-28 cs.CL 新提交

Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

跨领域整合RLVR能力:融合范式的深入探究

Siye Wu, Kai Yang, Yuchen Cai, Xin Xu, Peng-Yuan Wang, Jiaxuan Wang, Jiashun Liu, Jiafei Lyu, Yangkun Chen, Saiyong Yang, Yanghua Xiao

机构 * Tencent(腾讯) Fudan University(复旦大学)

AI总结 该研究探究Merge、Mix RL、MOPD三种RLVR融合范式的性能差异与适用场景,发现其平均性能差最多1.4点,单基准差达8.6点,给出了不同场景下的选择指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27407 2026-08-28 cs.CV 新提交

Reconstructing Humans and Objects in Interaction using Large Reconstruction Models

基于大型重建模型重构交互中的人体与物体

Agniv Chatterjee, Georgios Pavlakos

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出MILO框架,利用大型重建模型(LRMs)从单张图像重构三维人体-物体交互,在多个基准场景中精度优于现有方法。

Comments Accepted at ECCV 2026. Project Page: this https URL (https://ac5113.github.io/MILO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27406 2026-08-28 cs.RO cs.AI cs.CV 新提交

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAP:跨具身视频世界模型是零样本物理模拟器

Kechen Liu, Ola Shorinwa

机构 * Princeton University(普林斯顿大学)

AI总结 CLAP是跨具身动作条件视频生成框架,可在人类与机器人的多样化视频上训练,能接近或超越单具身视频模型性能,开源代码与模型,为训练单具身视频世界模型提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27402 2026-08-28 cs.CL cs.AI cs.LG 新提交

How Language Models Organize and Structure Moral Knowledge

语言模型如何组织与构建道德知识

Orion Reblitz-Richardson

机构 * Distiller Labs(蒸馏实验室)

AI总结 该研究探究大型语言模型的道德知识组织方式,通过线性探针揭示其道德表征的几何结构,发现其道德整合分量具特异性,且道德困境表征反映冲突结构而非预判决断。

Comments 31 pages, 16 figures. Code and outputs at this https URL (https://github.com/deepsteer/deepsteer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27397 2026-08-28 cs.CL cs.AI 新提交

Making Clinical Language Models Auditable: Concept-Guided Fine-Tuning for Robust Prediction

使临床语言模型可审计:概念引导的鲁棒预测微调

Jin Mu, Guanhua Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本研究提出基于SAE的可审计临床文本分类框架CAST,通过提取并抑制病历人工制品特征,在MIMIC-IV死亡率预测任务上提升了基线性能并保留与强LLM相当的效果,同时提供可审计的特征级轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27395 2026-08-28 cs.CV cs.AI 新提交

LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics

LeVJEPA:无需启发式方法的高效可扩展视频预训练

Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner

机构 * German Cancer Research Center(德国癌症研究中心) German Cancer Consortium(德国癌症联盟) Goethe University Frankfurt(法兰克福大学) Mila(米拉研究所) Université de Montréal(蒙特利尔大学) Brown University(布朗大学) Courant Institute, New York University(纽约大学柯朗研究所) Advanced Machine Intelligence (AMI Labs)(高级机器智能实验室(AMI Labs))

AI总结 LeVJEPA是首个基于LeJEPA无崩溃目标训练的视频编码器,无需启发式方法,预训练计算量大幅降低,在ImageNet-1K等基准上性能优于现有方法,可作为通用视觉预训练的更优基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27394 2026-08-28 cs.CL cs.IR 新提交

RATIO: A Benchmark for Retrieval Across Typed Ideation Operations in Scientific Literature

RATIO:面向科学文献中类型化构思操作检索的基准

Maayan Sharon, Tom Hope

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) The Allen Institute for AI (AI2)(艾伦人工智能研究所)

AI总结 本研究提出名为RATIO的大规模基准,定义三类构思操作的检索任务,构建时结合话语标记远程监督与LLM及人工审核,实验显示操作特定微调可提升检索器性能,为科学灵感检索提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27391 2026-08-28 cs.AI cs.CL cs.IR cs.LG 新提交

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

CorporateBench:基于时序知识库的大规模问答基准测试

Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov

机构 * Epiq AI Labs(Epiq AI实验室) Cornell University(康奈尔大学)

AI总结 研究针对企业级LLM评估的数据集难题,构建了含23万+文档的CorporateBench基准,从信息提取与知识库查询维度评估5种LLM,发现输入规模接近实际时性能下降,填补了相关评估指标空白。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27384 2026-08-28 cs.RO 新提交

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA:用于快速异步VLA推理的流式动作解码

Zekai Li, Jiaming Tang, Zhijian Liu

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院)

AI总结 FlashVLA是一种流式动作解码框架,通过分块因果注意力维护动作缓冲,实现低延迟、平稳异步的VLA推理,在单GPU上达≥30Hz控制频率且任务性能优异。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27380 2026-08-28 cs.CL 新提交

D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

D2C-Routing:用于混合来源AI生成文本检测的维度到组成证据路由

Xin Chen, Fuwei Zhang, Yiqi Tong, Wei Guo, Yutian Xiao, Fuzhen Zhuang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 本研究针对混合来源AI生成文本检测问题,提出D2C-Routing方法,在MixD2C数据集上取得0.8603的四向平均TPR@1%FPR,性能优于RACE-local重运行结果。

Comments 17 pages, 4 figures. To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27371 2026-08-28 cs.RO 新提交

Embodied Scene Rearrangement Planning

具身场景重排规划

Canzhi Chen, Zan Wang, Siqi Zhu, Qi Wu, Yixuan Li, Wei Liang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

AI总结 本文提出具身场景重排规划(ESRP)新任务,构建含5400+场景对的ESRP-Bench基准,评估四类方法发现现有方法难高效完成,为智能体现实部署奠定基础。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026. Project page: this https URL (https://bit-pie.github.io/ESRP/) Code: this https URL (https://github.com/BIT-PIE/ESRP) Dataset: this https URL (https://huggingface.co/datasets/serendipity800/ESRP-PD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27370 2026-08-28 cs.CL cs.LG 新提交

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Puro-2B:Poor Lab基于RTX 5090训练的Qwen2-1.5B模型,训练成本低于5090美元

Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室)

AI总结 该研究提出开源预训练方案,在RTX 5090上低成本训练出Puro-2B模型,推导出成本缩放定律并开展数据课程影响下游性能的案例研究,完整方案已开源。

Comments 62 pages, 20 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27365 2026-08-28 cs.CV cs.AI 新提交

KnockGS:interaction-Grounded Calibrationof Physical Gaussian Representations

KnockGS:基于交互的物理高斯表示校准

Chenchen Ge, Hanwen Shen, Bowen Jing, Jiyuan Cai, Xiaofeng Wang, Hongsen Lei, Weitao Zhou, Dandan Zhang, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) Tsinghua University(清华大学) Simple AI Imperial College London(伦敦帝国学院) Shanghai Jiao Tong University(上海交通大学) GigaAI Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学)

AI总结 KnockGS是基于交互-响应的PhysicalGS框架,可从三维高斯物体动力学中校准材料尺度,在参数恢复与响应保真度上优于对比方法,为交互式PhysicalGS系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27364 2026-08-28 cs.AI econ.GN 新提交

Sophistication in GenAI Use: Field Evidence from a Large Firm

生成式AI(genAI)使用中的成熟度:来自一家大型企业的实地证据

Nicholas J. Hallman, Zachary T. Kowaleski, Anu Puvvada, Jaime J. Schmidt

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) KPMG LLP(毕马威有限责任公司)

AI总结 本研究以某大型企业后台员工为对象,通过8个月的71万余条数据,发现资深员工genAI使用更成熟,战略等领域成熟度最高,且成熟度难随时间或培训提升,为管理者和研究者提供相关衡量指标与见解。

Comments 59 pages, 4 figures, 8 tables. Includes Appendix A (variable definitions), Appendix B (supplementary tables), and Online Appendix C (meta prompts)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27360 2026-08-28 cs.CL 新提交

Your Voice Cloning System is Secretly a Voice Anonymizer

你的语音克隆系统实则是一款隐形的语音匿名器

Romolo Muletta, Felix Matthias Saaro, Mark Cieliebak, Jan Deriu

机构 * ZHAW School of Engineering(苏黎世应用科技大学工程学院) Centre for Artificial Intelligence(人工智能中心)

AI总结 本研究将多语言语音克隆模型XTTSv2重新用于说话人匿名化,通过迭代优化策略平衡隐私与实用性,在7种欧洲语言上实现接近最优的隐私性及更优的语音质量,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27358 2026-08-28 cs.CL cs.AI 新提交

RCMN: Understanding Misleadingness in Influential Public Discourse

RCMN:理解有影响力公共话语中的误导性

Peiling Yi

机构 * School of Computer Science and Mathematics(计算机科学与数学学院) Faculty of Engineering, Computing and the Environment(工程、计算与环境学院) Kingston University London(伦敦金斯顿大学)

AI总结 本研究针对有影响力公共话语的误导性,提出以读者为中心的RCMN框架构建数据集,发现轻量表征可恢复读者解读但难识别误导机制,为可扩展误导性分析提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-28 cs.LG 新提交

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27348 2026-08-28 cs.CL 新提交

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-08-28 cs.CV cs.AI 新提交

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27343 2026-08-28 cs.CL 新提交

Pair-Level Essay-Scale Republication and Reuse from Fragmented Historical Text Reuse: A Workflow Study on Eighteenth-Century Books and Newspapers

从碎片化的历史文本复用中恢复成对的散文级再发布与复用:一项关于18世纪书籍与报纸的工作流研究

Ke Shu, Kira Hinderks, Eetu Mäkelä, Mikko Tolonen

机构 * University of Helsinki(赫尔辛基大学)

AI总结 本研究针对碎片化历史文本复用的成对证据整合难题,以18世纪休谟的散文为研究对象,提出分阶段规则工作流,在ECCO数据集上验证了方法的有效性,为历史文本复用的恢复提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27340 2026-08-28 cs.AI 新提交

Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance

并非所有评估感知都等同:能力框架预测合规性

Allison Zhuang, Santiago Aranguri

机构 * ENS Paris-Saclay(巴黎萨克雷高等师范学校) Goodfire AI

AI总结 该研究发现评估感知的框架类型会显著影响模型合规性,能力导向型框架的合规性远高于安全导向型,且评估感知并非行为均匀的单一量,总抑制率变化不代表安全相关部分同步变化。

Comments 5 pages (14 appendices), 5 figures, presented at 2026 ICML Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27328 2026-08-28 cs.CV 新提交

R2M-Bench: Evaluating Revisit Memory via Relative Consistency in Interactive Video World Models

R2M-Bench:通过交互式视频世界模型中的相对一致性评估重访记忆

Qiwen Gu, Bingjie Gao, Rui Chen, Geng Li, Jifan Li, Qishuai Wen, Li Niu, Jing Tang, Xiangxiang Chu, Junqiao Zhao

机构 * DreamX Team, Alibaba Group(阿里巴巴集团DreamX团队) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出R2M-Bench基准,通过同滚动过程的相对校准评估视频世界模型的重访记忆,其NMR与人类判断相关性良好,可减少慢动作捷径,DreamX-World-Memo表现最优。

Comments Code: this https URL (https://github.com/AMAP-ML/R2MBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27311 2026-08-28 cs.AI 新提交

Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification

更智能地验证,进一步进化:通过感知行为的验证实现高效的智能体控制策略进化

Jinghan Xu, Yikai Zhang, Aili Chen, Weiyuan Li, Jiaqing Liang, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 针对智能体控制策略进化中验证成本高的问题,提出HarnessLens框架,通过行为感知的选择性验证,在提升保留任务性能的同时大幅降低评估预算。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏