ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs
ChartWalker: 跨图表RAG任务的基准测试
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ChartWalker: 跨图表RAG任务的基准测试
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
理论家工具箱:基于智能体的LLM辅助经济理论研究工具
专题命中 测试时计算 :verifier(abstract)
AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。
探索多模态大语言模型与两阶段微调在时尚图像检索中的应用
机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) ; Vietnam National University, Ho Chi Minh(胡志明市国家大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。
Comments SOICT 2025
门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard
专题命中 测试时计算 :verifier(abstract)
AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。
DeSRPA: 通过推理时干预的解耦语音角色扮演智能体
机构 * Nagoya University(名古屋大学) ; National Institute of Informatics(国立情报学研究所)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。
Comments Accepted to INTERSPEECH 2026
AI代理网络的可靠性:密度演化、停止集与架构优化
专题命中 测试时计算 :verifier(abstract)
AI总结 将多代理AI系统建模为稀疏图上的消息传递,扩展LDPC编码的密度演化理论,分析三种擦除失效模式,并证明密度演化定理以预测未解决子声明的渐近比例。
基于分歧的跨模型路由用于隐式视频问答
机构 * Independent Researcher(独立研究员)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对隐式视频问答中单模型精度瓶颈和自一致性策略失效问题,提出无标签无训练的分歧驱动跨模型路由方法,将分歧样本路由至第二模型,在ImplicitQA基准上提升平均准确率1.43%。
RepFusion:利用多模态先验在表示空间中进行去噪
机构 * Meta AI ; New York University(纽约大学)
专题命中 测试时计算 :test-time compute(abstract)
AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。
Comments Project Page: https://xichenpan.com/repfusion
CQC-RAG: 通过跨查询一致性实现鲁棒的检索增强生成
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出CQC-RAG框架,通过生成语义等价但句法多样的查询,并基于跨查询一致性评估答案置信度稳定性,有效过滤噪声诱导的幻觉,在开放域问答任务上显著提升性能。
无需互信处理器的所有AI集群I/O指纹识别
专题命中 测试时计算 :verifier(abstract)
AI总结 提出一种通过网络分流器计算哈希来加密承诺进出数据中心所有信息的方法,并设计“安全网关设备”消除隐蔽信道,以实现对AI集群I/O的可验证审计。
用于多模态思维链推理的视觉显著性引导蒸馏
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。
CoEvoT:用于图语言模型推理的协同进化思维链提示
机构 * Sun Yat-Sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing University of Posts and Telecommunieations(北京邮电大学) ; Singapore Management University(新加坡管理大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 研究分布转移下的图学习问题,提出CoEvoT框架,通过文本到图令牌重写与图到文本推理指导的闭环协同进化,实现逐步的、状态感知的证据细化,在八个数据集实验中性能优于现有基准模型。
Comments Under review
去噪迭代自校正:用于可靠LLM推理的结构化验证循环
机构 * Thomson Reuters Labs(汤森路透实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出DISC方法,通过将验证输出视为噪声测量,在多次验证-判断-校正循环中逐步减少推理错误,并引入二元判断门控机制防止破坏正确答案,在三个基准上优于现有方法。
从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索
专题命中 复杂问题求解 :CoT(title,summary_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。
Comments 26 pages,10 figures,14 Tables
SuCo: 充分性引导的连续自适应推理
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大型推理模型生成过长思维链导致计算浪费的问题,提出最小充分CoT概念,并构建两阶段训练框架SuCo,通过自适应充分性阈值和强化学习优化推理长度,在数学、代码和科学基准上同时提升准确率和效率。
Comments Accepted to ICML 2026. 18 pages
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
DAIS:用于复杂推理的依赖感知中间问答监督
机构 * Xi’an Jiaotong University(西安交通大学) ; Huawei Technologies Ltd(华为技术有限公司)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究针对思维链监督的局限性,提出依赖感知中间问答监督(DAIS)框架,将教师推理依据转换为阶段级记录,在多个数据集上提升了最终答案准确率,在政策合规基准测试中有显著增益,证明其作为辅助监督信号的有效性。
CAT:面向大型推理模型高效推理的置信度自适应思考
机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) ; Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省泛在智能与可信服务重点实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出置信度自适应思考(CAT)框架,利用模型内在自确信信号作为置信度,通过偏好优化自主调节推理长度,在保持准确率的同时压缩简单问题的推理开销。
Comments Accepted at ACL 2026 Industry Track
Operadic一致性:LLM中组合推理失败的无标签信号
机构 * Incubilate ; University of Cambridge(剑桥大学) ; Allen Institute for Artificial Intelligence(艾伦人工智能研究所)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 提出Operadic一致性(OC)作为检测大语言模型组合推理失败的无标签信号,在四个多跳QA数据集上与准确率强相关(Pearson r≥0.86),优于自一致性等方法。
Dep-LLM:基于证据引导的结构化多因素与可靠LLM推理的无训练抑郁症诊断
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, Guangdong, China(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机学院) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) ; Pengcheng Laboratory(鹏城实验室) ; Chinese People’s Liberation Army General Hospital, Beijing, China(中国人民解放军总医院)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出无训练框架Dep-LLM,通过思维链多因素分析、置信度调制和协作预测,在冻结LLM上实现抑郁症诊断,超越零样本和微调方法。
推理评审团:用于评估推理轨迹的多模型共识机制
机构 * Amazon AGI(亚马逊AGI)
专题命中 复杂问题求解 :reasoning(title,summary_cn);分类 cs.AI
AI总结 本研究提出Reasoning Jury系统,以多LLM评审团及调控共识机制替代单模型评审员,其识别推理缺陷的准确率显著优于前沿模型,且开销仅为后者的8%-15%,还可用于理解推理LLM的失败模式。
更少Token,更小缓存:奖励协调的高效推理
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 针对大型推理模型过度思考导致的高推理成本问题,提出奖励协调压缩框架ReCo,通过奖励自适应缓存压缩等组件,减少生成Token并降低延迟,同时保持准确率。
Comments Work in progress, revisions ongoing
佩内洛普:用于高效结构化推理的局部潜在循环
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 研究复杂结构化推理任务计算问题,提出佩内洛普框架,通过局部潜在循环实现高效推理,将可见推理转移到内部循环路径,在开源基准实验中降低推理延迟,实现准确性-效率权衡。
Comments 8 pages, 2 figures
深度交互:一种用于大型推理模型的高效人机交互方法
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 针对大语言模型推理出错时现有交互方法的问题,提出深度交互机制,可直接编辑原始响应并提炼精炼提示引导模型,在STEM任务推理中纠正成功率大幅提升,令牌使用量显著减少。
ttda704 at SemEval-2026 Task 6: 用于政治回避检测的结构化思维链提示
机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)
专题命中 复杂问题求解 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 针对总统访谈中政治回避策略分类任务,比较QLoRA微调Qwen3与结构化思维链提示DeepSeek-V3.2/Grok-4-Fast,发现后者在Macro F1上显著更优,最佳系统在9类回避任务上Macro F1达0.5147。
通过自增强微调在Text-to-SQL中整合推理与泛化
机构 * Central South University(中南大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; McGill University(麦吉尔大学)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 提出CoTE-SQL方法,通过自增强推理轨迹、结构化思维链提示和错误感知修正,在开源LLM上实现Bird和Spider基准的最优性能。
Comments 14 pages, 13 figures, 7 tables
MODF-SIR:面向社交智能推理的多智能体全模态蒸馏框架
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) ; Cloud and AI BU, Huawei(华为云与AI业务部) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 提出基于轻量级多模态大语言模型的多智能体协作框架,通过知识蒸馏增强训练与推理,结合测试时适应、长尾事件提取和链式思维提示,在多个基准上取得最优结果。
稳定价值冲突解决的几何视角
机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。
Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics
ESC:面向可靠视觉语言模型的情感自我纠正
机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author
专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。
Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?
PTEI:在大语言模型中整合人格特质以提高情商
机构 * Telecom SudParis, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院) ; Aberystwyth University(阿伯里斯特威斯大学)
专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 研究针对大语言模型在复杂情感推理中不如人类的问题,提出PTEI框架,通过提取人格特质并用于人格感知提示引导模型推理,结合对比学习优化检索系统,经实验验证其能增强模型情感理解能力,与CoT推理结合可进一步提升准确率。