arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2606.19399 2026-06-19 cs.LG cs.AI cs.LO cs.PL 新提交 73%

VERITAS: Verifier-Guided Proof Search for Zero-Shot Formal Theorem Proving

VERITAS:验证器引导的零样本形式定理证明搜索

Manish Acharya, Zhenyu Liao, Yueke Zhang, Kevin Leach, Yu Huang, Yifan Zhang

机构 * Department of Computer Science, Vanderbilt University(范德堡大学计算机科学系) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出VERITAS框架,通过两阶段协议(Best-of-N采样+批评引导MCTS)利用验证器反馈进行零样本定理证明,在miniF2F上达40.6%准确率,并发布组合学基准VERITAS-CombiBench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19354 2026-06-19 cs.CL cs.LG 新提交 73%

Granularity-Regulated Adaptive Computational Efficiency for Optimal Verification in Test-Time Scaling

粒度调控的自适应计算效率:测试时扩展中的最优验证

Ardit Krasniqi, Luan Vejsiu, Elira Dervishi

机构 * European University of Tirana(欧洲地拉那大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE理论框架,将验证粒度建模为问题难度、验证器准确率和计算预算的函数,证明存在相变:细粒度验证在计算预算大或问题难时占优,粗粒度验证在低预算简单问题时更优,自适应策略可达到计算-性能帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19349 2026-06-19 cs.CL cs.AI 新提交 73%

Where to Place the Query? Unveiling and Mitigating Positional Bias in In-Context Learning for Diffusion LLMs via Decoding Dynamics

查询应置于何处?通过解码动力学揭示并缓解扩散大语言模型中上下文学习的位置偏差

Zhengheng Li, Panrui Li, Xuyang Liu, Puzhi Xia

机构 * Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了扩散大语言模型中查询位置对生成质量的影响,发现其与示例语义质量同等重要,并提出基于平均置信度的无训练自适应路由策略Auto-ICL以优化查询放置。

Comments 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19222 2026-06-18 cs.LG cs.AI 新提交 73%

Mechanism-Guided Selective Unlearning for RLVR-Induced Reasoning

机制引导的选择性遗忘:针对RLVR诱导的推理

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学研究院工程学院) College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电子与计算机工程系)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MAST方法,通过机制引导选择性更新参数,在遗忘RLVR诱导的推理行为时,显著降低对保留性能的附带损害。

Comments 15 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16783 2026-06-16 cs.CV cs.AI cs.LG 新提交 73%

Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

Gen-VCoT: 基于扩散的RGB中间表示的生成式视觉思维链推理

Zhiqiang Zhou, Junliang Dai, Xu ling

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Gen-VCoT框架,利用专家视觉模型生成RGB图像作为推理中间步骤,通过自适应路由器选择推理深度,在空间和深度问题上分别提升25%和50%,但简单事实查询性能下降,表明最优表示依赖于任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16603 2026-06-16 cs.CL cs.AI 新提交 73%

VeriGraph: Towards Verifiable Data-Analytic Agents

VeriGraph: 迈向可验证的数据分析智能体

Jiajie Jin, Zhao Yang, Wenle Liao, Yuyang Hu, Guanting Dong, Xiaoxi Li, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出VeriGraph框架,通过构建显式异质证据有向无环图(DAG)实现数据分析智能体的可验证性,并设计基于图的策略优化提升正确性与可审计性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15877 2026-06-16 cs.CL cs.AI 新提交 73%

Free Energy Heuristics: Fast-And-Frugal Cognition as Active Inference Under Uncertain Precision

自由能启发式:作为不确定精度下主动推理的快速节俭认知

Alex Bogdan

机构 * Evolutionairy AI Toronto, Canada(进化人工智能(多伦多,加拿大))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出元不确定性决定链式思维(CoT)的效果:当模型对自身证据的可靠性高度不确定时,更多推理会降低准确率。通过自由能最小化策略证明,在重尾精度先验下,有限数量的高有效性线索后停止整合,与“取最优”启发式等价。实验验证了高元不确定性下长CoT导致准确率下降17.3个百分点。

Comments 64 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15686 2026-06-16 cs.AI cs.LG 新提交 73%

Recurrent Reasoning on Symbolic Puzzles with Sequence Models

基于序列模型的符号谜题循环推理

Gowrav Mannem, Chowdhury Marzia Mahjabin, Jason Chen, Shivank Garg, Kevin Zhu

机构 * Algoverse AI Research Cornell University(康奈尔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 RecurrReason 基准,包含四个递归逻辑谜题,通过控制难度参数 N 评估序列模型,发现架构比规模更重要,预训练仅对局部结构转移函数的谜题有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15455 2026-06-16 cs.LG cs.AI 新提交 73%

Understanding Diversity Collapse in RLVR via the Lens of Overtraining

通过过度训练的视角理解RLVR中的多样性崩溃

Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An

机构 * Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) Southeast University(东南大学) Microsoft(微软) Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) Chongqing University(重庆大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过过度训练的视角形式化RLVR中的多样性崩溃,发现标准训练中大部分更新是过度训练,并提出贝叶斯边界门控(BBG)方法,通过估计每个问题对推理边界的边际贡献来优化,提升多个基准上的Pass@k。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交 73%

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11437 2026-06-11 cs.DS cs.AI cs.LG stat.ML 新提交 73%

The Power of Test-Time Training for Approximate Sampling

测试时训练对近似采样的威力

Noah Golowich, Ankur Moitra, Dhruv Rohatgi

机构 * Microsoft Research NYC(微软研究院纽约分校) MIT(麻省理工学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文形式化测试时训练(TTT)为从已知分布类中采样的问题,证明查询复杂度的二次下界,并展示在分布类大小受限时可规避该下界,为TTT提供理论框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10475 2026-06-10 cs.MA cs.AI cs.CL 新提交 73%

Decoupling Thought from Speech: Knowledge-Grounded Counterfactual Reasoning for Resilient Multi-Agent Argumentation

思想与言语解耦:基于知识反事实推理的鲁棒多智能体辩论

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙技术大学计算机科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出知识反事实推理(KG-CFR)双阶段架构,通过私有规划缓冲与公共执行层分离,在动态资源分配环境下将扰动后论证质量从0.694提升至0.822,并减少语义循环。

Comments Accepted for publication in the Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09278 2026-06-09 cs.LG cs.AI 新提交 73%

Internalizing Geometric Law: Learning from Solver Residuals for Precision-Critical Generation

内化几何法则:从求解器残差中学习以实现精度关键生成

Rafael Cabral, Pang Zixi, Ziyi Shou, Shen Xin

机构 * Huawei Celia Team(华为Celia团队)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型在精度关键领域(如技术图表和机械设计)中的幻觉问题,提出可编程几何DSL PyGeoX及分层基准PyGeoX-Bench,并设计饱和加性奖励(SAR)方法,将奖励分解为有界逐约束项,解决异常梯度掩盖问题,使8B模型在基准上达到与更大前沿系统竞争的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09743 2026-07-14 cs.AI cs.GT 新提交 72%

Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets

为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预

Pratyush Singh

机构 * California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI;LLM(comments)

AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。

Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25124 2026-07-29 cs.HC 新提交 71%

UrbanTrace: LLM-Assisted Discovery and Semantics-Aware Integration of Spatial Data

UrbanTrace:基于大语言模型的空间数据发现与语义感知集成

Sonia Castelo, Eden Wu, Joao Rulff, Harish Doraiswamy, Juliana Freire, Claudio Silva

专题命中 推理与问题求解 :LLM(title)

AI总结 研究针对城市决策中异构空间数据整合问题,提出UrbanTrace视觉分析系统,利用离线分析器结合大语言模型,通过三个交互式视图实现有效空间聚合,经评估在数据发现上表现优异,将空间聚合敏感性转化为视觉资产。

Comments 11 pages, 7 figures. Accepted to IEEE VIS 2026 (Full Papers Track). Author's version accepted for publication in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20055 2026-08-21 cs.CR cs.AI 新提交 70%

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

EchoCoT:从大型推理模型中提取隐藏的思维链

Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出EchoCoT多步骤攻击方法,通过API交互可从开源及前沿专有大型推理模型中近乎逐字提取隐藏思维链,该方法还具备泛化性,凸显隐藏CoT提取的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19854 2026-08-21 cs.SE cs.AI 新提交 70%

Repo0: Design-Driven Zero-to-All Code Generation

Repo0:面向从零到全代码生成的设计驱动框架

Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Repo0是面向从零到全代码生成的连续结构演化框架,通过Dual-DAG架构等技术,在RepoCraft数据集上相较RPG大幅提升了代码生成的功能覆盖率与通过率。

Comments Our code and data are available at https://github.com/cslsolow/Repo0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-20 cs.AI 新提交 70%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18534 2026-08-20 cs.AI cs.IR 新提交 70%

FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems

FinRCA-Bench:面向金融AI系统的证据检索与推理基准

Pratik Ghawate

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究推出FinRCA-Bench基准,评估金融AI系统的证据检索与推理,发现检索架构影响性能,正确根本原因标签是可审计诊断的弱代理。

Comments 19 pages, 4 figures, 7 tables. Code and data: https://github.com/PratikGhawate/FinRCA-AI-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18078 2026-08-20 cs.AI 新提交 70%

Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions

立场:AI推理智能体间的合谋风险证明其在制定市场决策时需满足认证要求

Matthew Riemer, Tommaso Tosato, Amin Memarian, Maximilian Puelma Touzel, Glen Berseth, Irina Rish, Guillaume Dumas

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究指出具备思维链推理能力的AI智能体易出现合谋倾向,提出需对其进行行为认证,实验显示DeepSeek-R1智能体在伯特兰寡头定价场景中存在默契合谋,且其思维链可被隐蔽引导至合谋或竞争状态。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17834 2026-08-19 cs.HC cs.AI 新提交 70%

AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis

AdaLens:用于监控和引导长时间运行的智能体数据分析的交互式故事情节

Yangtian Liu, Yan Miao, Shuhan Liu, Yunfan Zhou, Dae Hyun Kim, Di Weng, Yingcai Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长时间智能体数据分析的传统界面无法满足可观测性与可引导性需求,本文提出交互式系统AdaLens,结合故事情节表示与引导交互,经案例及用户研究验证其能有效支持分析师监控与引导此类分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17164 2026-08-19 cs.LG 新提交 70%

SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version

SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版

Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu

机构 * VinUniversity FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) VNU University of Engineering and Technology(VNU工程技术大学) Aalborg University(奥尔堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。

Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15634 2026-08-18 cs.AI 新提交 70%

Argumentation for Common Ground: Finding Zones of Possible Agreement between Individuals in Conflict

寻求共识的论证:在冲突个体间寻找可能的共识区

Elisa Cavatorta, Antonio Rago

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出定量双极论证框架,通过合并冲突双方的推理框架识别可能的共识区(ZOPA),并以巴以冲突的调查数据验证其可行性,为冲突解决提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15432 2026-08-18 cs.AI 新提交 70%

Does the Proof Prove It That Way? Faithful Formalization of Elements Proofs

证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化

Tadd Mao, Tianjun Zhong, Dhruva Arekar, Yuming Feng, One An, Jiani Huang, Xujie Si, Ziyang Li

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。

Comments Preprint. 18 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 70%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14765 2026-08-18 cs.AI cs.DB 新提交 70%

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

无干净参考的智能体数据清洗:能力与权衡的实验研究

Hadi Fadlallah

机构 * Faculty of Arts and Sciences(文理学院) University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。

Comments 21 pages, 3 figures, Submitted to New Generation Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16118 2026-08-18 cs.AI math.HO 新提交 70%

Assessing LLMs' mathematical abilities requires understanding the various mechanisms of mathematical creativity

评估大语言模型的数学能力需要理解数学创造力的多种机制

Silvère Gangloff

机构 * University of Ostrava(俄斯特拉发大学) IRAFM

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出数学创造力包含多种不可替代的机制,当前LLMs仅具备部分模式的能力,建议围绕该机制分类而非综合基准评估其数学能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13244 2026-08-14 cs.CL cs.CE q-bio.BM 新提交 70%

Localize, Then Reason: Visual Latent Structural Reasoning for Molecular Properties and Edits

先定位,再推理:用于分子性质与编辑的视觉隐式结构推理

Xingqiao Lin, Junmei Wang, Haocheng Tang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对现有化学推理模型无法聚焦分子关键区域的问题,提出VLSR框架,采用先定位再推理策略,在分子性质推理任务上实现9.6倍于文本推理基准的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13031 2026-08-14 cs.CV cs.AI 新提交 70%

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估

Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。

Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12571 2026-08-14 cs.DL cs.CL 新提交 70%

Is this Citation on Point?

该引用是否相关?

Apurv Verma

专题命中 推理与问题求解 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文针对现有大语言模型法律用例评估忽视的“指向真实案件却不支持主张”的引用问题,通过扰动真实法律引用验证14种模型配置,发现模型易混淆主题识别与页码级支持验证能力,规模与推理能力仅能部分缩小错精准页码扰动的检测差距。

Comments Accepted to the 1st Workshop on AI for Law at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏