arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2368 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 275 篇

2605.06006 2026-07-20 cs.CL 版本更新 57%

From Articles to Premises: Building PrimeFacts, an Extraction Methodology and Resource for Fact-Checking Evidence

从文章到前提:构建PrimeFacts,一种提取事实核查证据的方法和资源

Premtim Sahitaj, Jawan Kolanowski, Ariana Sahitaj, Veronika Solopova, Max Upravitelev, Daniel Röder, Iffat Maab, Junichi Yamagishi, Sebastian Möller, Vera Schmitt

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PrimeFacts方法,通过提取事实核查文章中的细粒度证据,提升自动化验证系统的性能,其在证据检索和声明验证中表现出显著优势。

Comments Accepted at LREC 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 57%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04920 2026-07-10 cs.AI 版本更新 57%

Conversational AI for Rapid Scientific Prototyping: A Case Study on ESA's ELOPE Competition

用于快速科学原型设计的对话式人工智能:以欧空局的ELOPE竞赛为例

Nils Einecke

机构 * Honda Research Institute Europe GmbH(本田欧洲研究机构)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 以欧空局ELOPE竞赛为例,探讨用ChatGPT进行快速科学原型设计。介绍其在竞赛中的表现,包括提供代码、推理等,虽有局限但凸显人机协作潜力,分析优缺点,提出将大语言模型集成到科学工作流程可增强快速原型设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00533 2026-07-09 cs.LG cs.IT math.IT 版本更新 57%

Toward Robust Open-set Adaptation: Synapse Consolidation Inspired by Rac1/MAPK Pathways

在开放测试流中学习并适应未知

Xiao Zhang, Tianyu Hu, Juntao Lyu, Qianchuan Zhao, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SyCo方法,通过Rac1和MAPK路径实现参数高效适应,解决LLM在动态任务中的适应问题,实验表明其在18个NLP数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 57%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08269 2026-07-07 cs.NE cs.AI 版本更新 57%

A Systematic Survey on Large Language Models for Evolutionary Optimization: From Modeling to Solving

关于用于进化优化的大语言模型的系统综述:从建模到求解

Yisong Zhang, Ran Cheng, Guoxing Yi, Kay Chen Tan

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。

Comments Accepted by IEEE CIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03315 2026-07-03 cs.AI 版本更新 57%

Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity

Memora: 一种平衡抽象与特异性的和谐记忆表示

Menglin Xia, Xuchao Zhang, Shantanu Dixit, Paramaguru Harimurugan, Rujia Wang, Victor Ruhle, Robert Sim, Chetan Bansal, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Memora记忆表示,通过主抽象和线索锚点平衡抽象与特异性,结合检索策略实现高效上下文感知检索,在LoCoMo和LongMemEval基准上达到新最优。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08316 2026-07-02 cs.CR cs.CL cs.CV 版本更新 57%

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA:针对基于VLM的GUI代理的高效后门攻击

Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。

Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09910 2026-06-25 cs.CL 版本更新 57%

Learning to Erase Private Knowledge from Multi-Documents for Retrieval-Augmented Large Language Models

学习从多文档中擦除私有知识以用于检索增强型大语言模型

Yujing Wang, Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Binghui Guo, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Eraser4RAG,通过构建全局知识图谱、划分私有与公共子图并微调Flan-T5重写文档,结合PPO优化,有效擦除用户定义的私有知识,保留公共知识,防御去匿名化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13744 2026-06-23 cs.CV cs.AI 版本更新 57%

Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

缓解多图像理解中大型视觉语言模型的跨图像信息泄露

Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

机构 * Sogang University(ソガン大学) Princeton University(普林斯顿大学) NAVER AI Lab(NAVER AI实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大型视觉语言模型在多图像输入时性能下降的问题,提出无需训练且架构无关的FOCUS方法,通过随机噪声掩码和噪声参考输入抑制跨图像信息泄露,显著提升多图像和视频理解性能。

Comments Source code is available at https://github.com/yejipark-m/FOCUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10139 2026-06-17 cs.CL 版本更新 57%

TACOMORE: Exploring a replicable prompting protocol for LLM-assisted corpus analysis

TACOMORE: 探索一种可复现的提示协议用于LLM辅助语料库分析

Bingru Li, Han Wang, Nicholas Groom

机构 * Department of Linguistics and Communication, University of Birmingham(伯明翰大学语言学与传播系) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Institute of Foreign Languages and Cultures, University of Tartu(塔尔图大学外国语言与文化研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出TACOMORE框架,通过结构化提示将LLM从通用概率预测转向基于语料共现模式的推理,提升关键词、搭配和索引行分析的准确性与可复现性,但幻觉问题仍需人工验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16592 2026-06-16 cs.RO cs.AI cs.CV cs.ET 版本更新 57%

Human Cognition in Machines: A Unified Perspective of World Models

机器中的人类认知:世界模型的统一视角

Timothy Rupprecht, Pu Zhao, Amir Taherin, Arash Akbari, Arman Akbari, Yumei He, Tooba Imtiaz, Sean Duffy, Juyi Lin, Yixiao Chen, Rahul Chowdhury, Enfu Nan, Yixin Shen, Yifan Cao, Haochen Zeng, Weiwei Chen, Geng Yuan, Jennifer Dy, Sarah Ostadabbas, Xuan Zhang, David Kaeli, Edmund Yeh, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Tulane University(路易斯安那州立大学) Cornell University(康奈尔大学) University of Georgia(佐治亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出统一框架整合记忆、感知等认知功能,指出动机和元认知研究不足,并引入认知世界模型新类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05017 2026-06-15 cs.CV cs.CL 版本更新 57%

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

通过细化文本嵌入缓解大型视觉语言模型中的幻觉

Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) Capital One

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对大型视觉语言模型因过度依赖文本先验而忽视视觉线索导致的幻觉问题,提出一种简单有效的视觉特征融入方法,通过学习视觉信息化的文本嵌入来平衡注意力分布,显著降低幻觉并提升多模态推理能力。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18817 2026-06-12 cs.LG 版本更新 57%

Multi-Token Residual Prediction

多令牌残差预测

Yufeng Xu, Zishuo Bao, Qian Wang, Zeshen Zhang, Haoqi Zhang, Bowen Peng, Ang Li, Rahul Chalamala, Yucheng Lu

机构 * New York University(纽约大学) New York University Shanghai(纽约大学上海) Nos Research(Nos研究) Modal

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种轻量级模块Multi-token Residual Prediction,通过利用去噪过程中相邻步骤的logit分布相似性,在单次骨干网络前向传播中实现依赖感知的多令牌去噪,从而在成本较低的情况下提高去噪效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16651 2026-06-11 cs.CV cs.LG 版本更新 57%

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

正确预测,误导性解释:关于视觉-语言模型解释的脆弱性

Narges Babadi, Hadis Karimipour

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 57%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03280 2026-06-08 cs.AI 版本更新 57%

A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting

Pythia多跳设置中跨模型激活迁移的负面结果

Peiyan Zhang, Jason Xin

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究在Pythia-160M到Pythia-410M的多跳推理设置中,通过线性翻译层传递隐藏状态是否能够改善下游回答,结果发现离线表示对齐不足以实现有用的因果通信。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01802 2026-06-08 cs.SD cs.AI 版本更新 57%

MOSS-Audio Technical Report

MOSS-Audio 技术报告

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen, Ke Chen, Wenxuan Wang, Yang Wang, Yaozhou Jiang, Yi Jiang, Zhengyuan Lin, Ziqi Chen, Zhaoye Fei, Chenghao Liu, Donghua Yu, Jun Zhan, Kang Yu, Kexin Huang, Liwei Fan, Mingshu Chen, Qinyuan Cheng, Ruixiao Li, Shimin Li, Songlin Wang, Xingjian Zhao, Yang Gao, Yitian Gong, Yiyang Zhang, Zhe Xu, Xipeng Qiu

机构 * OpenMOSS Team(开放MOSS团队)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出统一音频-语言模型 MOSS-Audio,通过 DeepStack 跨层特征注入和时间标记实现语音、环境声和音乐的理解,在音频字幕、时间感知问答、时间戳转录和音频推理任务上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25171 2026-06-08 cs.CL 版本更新 57%

Re-defining Humor Data Objects for AI Humor Research

为AI幽默研究重新定义幽默数据对象

Anna Arnett, Bang Nguyen, Meng Jiang

机构 * Department of Computer Science and Engineering, University of Notre Dame(诺特大学计算机科学与工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究将幽默视为具有上下文和解释的社会互动,通过定义幽默推理数据对象并改进提示策略,使LLM生成更高质量的幽默解释,为AI幽默研究的数据合成与增强奠定基础。

Comments Added link to code and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07941 2026-08-20 cs.CR 版本更新 50%

Collective Hallucination in Multi-Agent LLMs:Modeling and Defense

多智能体大语言模型中的集体幻觉:建模与防御

Saeid Jamshidi

专题命中 其他推理 :reasoning(abstract)

AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13132 2026-08-19 cs.NI 版本更新 50%

LLM-Driven Large-Scale Spectrum Access

基于大语言模型的大规模频谱接入

Ning Yang, Jinliang Gao, Haijun Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出基于群体相对策略优化的LSA框架,通过分层状态序列化机制解决超长提示导致的计算崩溃问题,实现高效频谱管理。

Comments 11 pages, 2 figures, 8 tables. Submitted to IEEE Transactions on Mobile Computing (TMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08151 2026-08-17 cs.CV cs.MM 版本更新 50%

Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合

Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Jun Ma, Jie Yu

专题命中 其他推理 :reasoning(abstract)

AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。

Comments CVPR Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15777 2026-08-12 cs.HC 版本更新 50%

UXCascade: Scalable Usability Testing with Simulated User Agents

UXCascade: 可扩展的可用性测试与模拟用户代理

Steffen Holter, Eunyee Koh, Mustafa Doga Dogan, Gromit Yeuk-Yin Chan

专题命中 其他推理 :reasoning(abstract)

AI总结 UXCascade通过多级分析工作流程,帮助从业者在早期界面开发中实现迭代反馈,通过提取、汇总和展示代理生成的可用性反馈,支持可操作的设计改进。

Comments 10 pages, 7 figures, accepted at UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16987 2026-08-07 cs.CV 版本更新 50%

DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection

DVAR:对抗性多智能体辩论用于视频真实性检测

Hongyuan Qi, Feifei Shao, Ming Li, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学) Guangming Lab(光明实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 DVAR通过多智能体辩论框架,将视频真实性检测转化为结构化推理过程,利用生成假设代理与自然机制代理的竞争,结合MDL框架和GenVideoKB知识库,实现对未知生成架构的强泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13105 2026-08-07 cs.AR 版本更新 50%

Knowledge-Driven Hybrid SSD Management Enhanced by Fine-Tuned LLMs

微调大语言模型(LLMs)增强的知识驱动混合固态硬盘(SSD)管理

Qian Wei, Yi Li, Zehao Chen, Tianren Zhou, Zhaoyan Shen, Dongxiao Yu, Bingzhe Li

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出LLM-hybridSSD框架,将混合SSD管理转化为参数调优问题,结合LLM与强化学习优化,使吞吐量平均提升58.92%、写放大降低28.56%。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02323 2026-08-06 cs.SE 版本更新 50%

ECLAIR: A Causally-Grounded AI Framework for Scientific Discovery in Empirical Software Engineering

ECLAIR:一种用于实证软件工程科学发现的因果基础AI框架

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Denys Poshyvanyk

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出因果基础AI框架ECLAIR,将LLMs整合到软件工程科学过程各阶段,通过案例研究揭示提示设计对LLMs代码生成准确率的影响,为AI辅助软件工程实证研究提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00280 2026-08-05 cs.OS cs.SE 版本更新 50%

Benchmarking LLMs on File System Design and Implementation

在文件系统设计与实现上对大语言模型(LLMs)进行基准测试:优势、不足与缺陷

Yuqi Xue, Daixuan Li, Jian Huang

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出针对文件系统特定任务的LLM基准框架phi-Bench,含505项六类任务,测试开源与专有LLMs,揭示模型效率、失败原因及缓解技术,将开源phi-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新 50%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 50%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00919 2026-08-04 cs.CV cs.RO 版本更新 50%

DriveCode: Domain Specific Numerical Encoding for LLM-Based Autonomous Driving

DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码

Zhiye Wang, Yanbo Jiang, Rui Zhou, Bo Zhang, Fang Zhang, Zhenhua Xu, Yaqin Zhang, Jianqiang Wang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi, Beijing, China(滴滴出行) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。

Comments The project page is available at https://shiftwilliam.github.io/DriveCode

详情

展开后加载摘要…

URL PDF HTML 收藏