arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 353 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 56 篇

2511.15669 2026-08-06 cs.LG cs.AI cs.RO 版本更新 73%

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

DeepThinkVLA: 提升视觉-语言-动作模型的推理能力

Cheng Yin, Yankai Lin, Wang Xu, Sikyuen Tam, Xiangrui Zeng, Zhiyuan Liu, Zhouping Yin

机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) Gaoling School of Artificial Intelligence, Renmin University of China, China(中国人民大学 Gallagher 人工智能学院) Beijing Zhongguancun Academy, China(北京中关村学院)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过系统实验发现,Co-T推理需满足解码对齐和因果对齐两个条件,提出DeepThinkVLA模型在LIBERO等任务中取得显著提升。

Comments 26 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04726 2026-08-06 cs.AI cs.CV 新提交 70%

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

当提示词成为像素:面向多模态推理的提示词-区域定位

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04709 2026-08-06 cs.CL 新提交 70%

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

EmpaAva:开源智能体式3D化身共情实时聊天机器人

Jie Yang, Wenhao Xu, Shuhui Lin, Hao Fei

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。

Comments Project&Demo: https://empaava.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 70%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03545 2026-08-06 cs.CL 版本更新 70%

Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

Hi-TTRL:利用提示调控测试时强化学习的共识

Kunbin Xu, Xingzuo Li, Xuefeng Bai, Kehai Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对测试时强化学习(TTRL)中共识强度不当导致的问题,提出 Hi-TTRL 框架,通过 MCMC 提示采样器调控共识强度,提升了 TTRL 的性能。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01207 2026-08-06 cs.CV cs.AI 版本更新 70%

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择

Puzhuo Zheng, Hasan Kurban

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04634 2026-08-06 cs.MA 新提交 67%

HELENA:Hierarchical Sparse Coordination over a Union of Complementary Topologies for MAS

HELENA:面向多智能体系统的互补拓扑联合上的分层稀疏协调框架

Zhifang Mao, Linyao Zheng, Xuhang Shi, Xiuquan Hou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 HELENA 是一种 MAS 框架,通过互补拓扑联合与分层稀疏协调抑制冗余噪声,在八个基准测试上实现最优结果,平均提升 3.47%,MMLU-Pro 最高提升 10.34%,难基准提升更显著且附加成本合理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 67%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 67%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04459 2026-08-06 cs.SE 新提交 67%

AdaptAgent: A Multi-agent, Domain-Guided Reasoning Framework for Code Adaptation

AdaptAgent:一种用于代码适配的多智能体、领域引导推理框架

Xiaokai Rong, Hridya Dhulipala, Aashish Yadavally, Tien N. Nguyen

专题命中 推理与问题求解 :LLM(abstract_cn);prompting(abstract)

AI总结 本研究提出AdaptAgent框架,通过分工的多智能体实现代码适配,在真实数据集上的语义正确性优于强基线,各智能体对适配效果均有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04434 2026-08-06 cs.CV 新提交 67%

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04217 2026-08-06 cs.SE 新提交 67%

Neuro-Symbolic Proof-of-Vulnerability Generation with Open-Weight Models

基于开放权重模型的神经符号漏洞证明生成

Yu Nong, Haipeng Cai

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 研究人员提出POVGEN神经符号框架,利用开放权重模型实现低成本漏洞证明生成,在基准测试和真实CVE中表现优于模糊测试与符号执行,还发现了有缺陷补丁及未报告漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12735 2026-08-06 cs.CV 版本更新 67%

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

AffectAgent:协同多智能体推理用于检索增强的多模态情感识别

Zeheng Wang, Zitong Yu, Yijie Zhu, Bo Zhao, Haochen Liang, Taorui Wang, Wei Xia, Jiayu Zhang, Zhishu Liu, Hui Ma, Fei Ma, Qi Tian

机构 * Great Bay University(大湾大学) Guangming Laboratory(光明实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04160 2026-08-06 cs.CL cs.LG 新提交 62%

Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap

注意输出上限:输出预算机制会改变测得的多语言推理差距

Ankit Goyal, Jaideep Ray

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现多语言推理差距受输出token预算机制影响,通过固定Qwen模型的预算峰值等实验,提出应将输出上限作为独立变量,报告不同预算机制下的准确率。

Comments 15 pages, 2 figures, 11 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04575 2026-08-06 cs.CV cs.AI 新提交 57%

PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning

PhysMind:从视频到可执行世界的无训练物理推理框架

Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 PhysMind是无训练的智能体框架,为每个视频构建可执行世界,在CLEVRER、Physion++数据集及反事实问题上的物理推理准确率显著优于现有视觉语言模型。

Comments 27 pages, 18 figures. Project page: https://physmind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 57%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21597 2026-08-06 cs.AI 版本更新 57%

Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals

风险不是目标:评估野火运行风险信号的单调框架

Nicolas Caron, Christophe Guyeux, Hassan Noura, Maxime Coulmeau, Benjamin Aynes

机构 * Météo-France(法国气象局) INRAE(法国国家农业、食品与环境研究院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究提出用单调评估框架衡量野火风险系统预测分数与运行负荷关系,比较DFE、GRU模型及FARS三种方法,发现DFE单调性最佳,GRU局部强但风险水平分布不佳,FARS有局限性,好风险模型应能解释运行动态。

Comments Accepted in 2026 IEEE 50th Annual Computers, Software, and Applications Conference (COMPSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 57%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18842 2026-08-06 cs.CL cs.CV 57%

v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning

v1: 为多模态 grounded 推理学习指向视觉标记

Jiwan Chung, Junhyeok Kim, Siyeol Kim, Jaeyoung Lee, Min Soo Kim, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 v1通过点对复制机制实现轻量级的主动视觉引用,提升多模态推理中视觉证据与推理空间的对齐性,优于现有基线模型。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21396 2026-08-06 cs.CV cs.AI 57%

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim

机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新 57%

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04385 2026-08-06 cs.CV 新提交 50%

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround:通过自诊断与视觉重检验恢复多步推理中的视觉接地

Lei Peng, Shuai Lv, Wei Hu

机构 * University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) State Key Laboratory of Precision and Intelligent Chemistry(精准与智能化学国家重点实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 ReGround是无需架构修改或外部工具的两阶段框架,通过自诊断与视觉重检验解决VLMs多步推理中的视觉接地丢失问题,在八个基准上获一致增益且推理开销适度。

Comments Accepted to ACM Multimedia 2026 (MM '26). 8 pages main text, 4 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04166 2026-08-06 cs.HC 新提交 50%

Enacting Constructive Conflicts with AI Agents to Enhance Reconsideration among Novice Interaction Designers

借助AI智能体构建建设性冲突以提升新手交互设计师的重新考量能力

Howard Ziyu Han, Nikolas Martelaro

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究构建受对抗性设计理论启发的AI智能体,通过45名设计学生的实验发现,该智能体实施的建设性冲突可提升新手交互设计师的重新考量能力,推动设计改进与创意拓展。

Comments 8 pages, 4 figures, conditionally accepted to Human-Agent Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 88 篇

2608.04240 2026-08-06 cs.CL cs.AI 新提交 92%

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

棋盘上的幻觉:工具增强型大语言模型(LLM)象棋评论评估

S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) Sentient Labs University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ACT-Eval框架,评估工具增强型LLM的象棋评论,发现事实幻觉普遍存在,工具可提升事实正确性但战略战术覆盖度仍有限。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05030 2026-08-06 cs.AI 新提交 92%

From Score Matrices to Football-Aware Match-State Simulation: An Auditable LLM Harness for Exact-Score Reranking

从得分矩阵到足球感知的比赛状态模拟:用于精确得分重排序的可审计大语言模型(LLM)框架

Shaopeng Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出可审计混合架构,结合动态统计模型与LLM实现足球得分重排序,经迭代优化后在英超150场比赛时序测试中提升了精确得分准确率与候选覆盖度,明确了该方法的改进及局限。

Comments 9 pages, 1 figure, 5 tables. Interim chronological benchmark on the first 150 matches of the 2025-26 English Premier League

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04907 2026-08-06 cs.CR cs.AR 新提交 91%

LLM-Assisted Detection and Repair of Hardware Security Vulnerabilities in Verilog Designs

基于Verilog设计的大语言模型辅助硬件安全漏洞检测与修复

Ethen Santana, Gabriel Gyaase, Hao Zheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出利用LLM从Verilog硬件设计中识别潜在CWE漏洞的方法,经单模块Verilog数据集迭代评估,证实LLM可增强硬件安全分析,为设计阶段漏洞识别提供自动化可扩展辅助。

Comments 6 Pages, 3 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06781 2026-08-06 cs.CL 版本更新 91%

When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

当更好的代码手册还不够:LLM政治事件编码中的预测性能与行为可靠性

Zixian He, Bharath Raahul Murugesan, Patrick Brandt, Yibo Hu

机构 * Independent Researcher(独立研究者) Illinois Institute of Technology(伊利诺伊理工学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究探讨在政治事件编码任务中,将专家代码手册优化为LLM友好形式能显著提升分类性能,但预测增益并未完全转化为行为可靠性,模型在代码手册变化下仍可能失效。

Comments 13 pages, 3 figures, 13 tables. Revised version with updated experiments, behavioral reliability analyses, and additional API-model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-06 cs.AI cs.LG 新提交 91%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 42pages,22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04015 2026-08-06 cs.CL 新提交 90%

Transfer Learning for Named Entity Recognition of Classical Latin through LLM Prompting

通过大语言模型提示学习实现古典拉丁语命名实体识别的迁移学习

Callum Chan

机构 * University of Ottawa(渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文介绍渥太华大学团队通过对gemini-2.5-pro和claude-sonnet-4-5进行提示工程,利用跨语言迁移学习完成古典拉丁语NER任务,在EvaLatin 2026的两个NER子任务中均获第一。

Journal ref EvaLatin (LT4HALA@LREC), ELRA, May 2026, Palma De Majorque, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04333 2026-08-06 cs.LG 新提交 90%

Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

成本感知多目标老虎机:理论及在预算约束下的大语言模型配置评估中的应用

Bo Xue, Zhi Hong, Jiayi Li, Yuanyu Wan, Ji Cheng, Shuang Qiu

机构 * City University of Hong Kong(香港城市大学) South China University of Technology(华南理工大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文将LLM配置评估建模为成本感知多目标老虎机问题,提出基于超体积的UCB算法与成本感知经验差距消除算法,在有限预算下实现高效在线决策和准确的帕累托识别。

详情

展开后加载摘要…

URL PDF HTML 收藏