arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2211 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 461 篇

2607.06233 2026-08-11 cs.AI 版本更新 57%

Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale

展示TOFFEE:一个大规模合成数据代理轨迹的学习系统

Ziting Wang, Yin Li, Zuhao Yang, Xiuchang Li, Jiale Bai, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) Huawei(华为) Industrial and Commercial Bank of China Limited(中国工商银行)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有数据代理难以适应新环境的问题,提出TOFFEE系统,通过蒙特卡洛树搜索等方法,能从给定数据环境合成高质量数据代理轨迹,可用于监督微调与上下文学习,还展示了系统框架、界面及工作流程与应用场景。

Comments Accepted to VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21165 2026-08-11 cs.RO cs.AI 版本更新 57%

OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving

OmniV2X:一种用于高效端到端协同驾驶的生成式基础规划器

Juntong Peng, Juanwu Lu, Yupeng Zhou, Can Cui, Yaobin Chen, Ziran Wang

机构 * Purdue University(普渡大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出OmniV2X生成式基础模型,通过端到端监督训练和交叉注意力注入,利用多模态多智能体上下文实现高效协同驾驶,在DAIR-V2X-Seq数据集上以少于10%微调数据和1%通信带宽达到最优性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28181 2026-08-11 cs.CL 版本更新 57%

When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models

当置信度误导时:扩散语言模型的后缀锚定与锚邻近置信度调制

Jungwon Park, Jimyeong Kim, Jungmin Ko, Nojun Kwak, Wonjong Rhee

机构 * RICS(智能研究学院) AIIS(人工智能研究所) IPAI(人工智能研究所) Department of Intelligence and Information(智能与信息系) Daegu Gyeongbuk Institute of Science and Technology(大邱庆州市科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对扩散语言模型中置信度误导导致生成不完整或过早解码的问题,提出后缀锚定与锚邻近置信度调制方法,无需训练即可提升完全非自回归解码性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02637 2026-08-11 cs.MA cs.CL cs.PL 版本更新 57%

StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning

StitchCUDA:一种基于规则的多智能体端到端GPU编程框架与基于代理的强化学习

Shiyang Li, Zijian Zhang, Winson Chen, Yuebo Luo, Mingyi Hong, Caiwen Ding

机构 * Department of Computer Science\&Engineering, University of Minnesota-Twin Cities, Minnesota, USA Department of Electrical Engineering, University of Minnesota-Twin Cities, Minnesota, USA

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 StitchCUDA通过基于规则的多智能体强化学习,实现了端到端GPU编程的高效生成与验证,显著提升了性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07796 2026-08-11 cs.CL 版本更新 57%

Thinking Is Not Telling: Information Disclosure in User-Service LLM Agents

思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果

Jiatong Li, Changdae Oh, Hyeong Kyu Choi, Jindong Wang, Sharon Li

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。

Comments 26 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22966 2026-08-11 cs.CL 版本更新 57%

Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks

提示工程并不能普遍提升大型语言模型在临床决策任务中的性能

Mengdi Chai, Ali R. Zomorrodi

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究发现提示工程对LLMs在临床决策任务中的性能提升具有高度依赖模型和任务的特性,强调了定制化策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 57%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11953 2026-08-10 cs.LG 版本更新 57%

When Does Reward Teach State? A Hidden-Automaton Instrument and a Group-Language Warning Signal

奖励何时能引导对状态的理解?一种隐藏自动机工具与群语言边界

James E. Allchin

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究强化学习中高奖励与潜在状态理解的关系,通过将任务表示为隐藏自动机,利用三个可控轴(优化器强度、任务结构、观察信息量)来分别测量奖励成功和潜在状态学习,区分感知差距和规划差距,得出高奖励非任务理解证据且智能体恢复潜在状态可预测的结论。

Comments 17 pages, 3 figures, 6 tables (9-page main text). Ancillary file hidden-automata-rl-code.zip contains reproduction code and the complete per-run data behind every table and figure. v3: author name corrected, title revised, text rewritten for clarity, new robustness checks (nonlinear and off-policy probes) added; results and conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25220 2026-08-10 cs.AI 版本更新 57%

DATAREEL: Automated Data-Driven Video Story Generation with Animations

DATAREEL:基于动画的自动化数据驱动视频故事生成

Ridwan Mahbub, Syem Aziz, Mizanur Rahman, Mahir Ahmed, Shadikur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) RBC, Canada(加拿大RBC) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03545 2026-08-06 cs.CL 版本更新 57%

Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

Hi-TTRL:利用提示调控测试时强化学习的共识

Kunbin Xu, Xingzuo Li, Xuefeng Bai, Kehai Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对测试时强化学习(TTRL)中共识强度不当导致的问题,提出 Hi-TTRL 框架,通过 MCMC 提示采样器调控共识强度,提升了 TTRL 的性能。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23299 2026-08-06 cs.LG 版本更新 57%

GRIMIP: A General Framework for Instance-Specific Configuration of MIP Solvers Using LLMs

GRIMIP:一种使用LLM进行MIP求解器实例特定配置的通用框架

Yidong Luo, Xuemin Chen, Chenguang Wang, Fangzhou Zhu, Tao Zhong, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出GRIMIP框架,结合大语言模型的语义推理与贝叶斯优化的高效搜索,为混合整数规划求解器配置超参数,在MIPLIB等基准上实现超过40%的原始对偶积分减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 57%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 57%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00076 2026-08-05 cs.CV cs.AI 版本更新 57%

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

哪种模态起决定作用?多模态大语言模型的反事实模态归因

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21644 2026-08-05 cs.LG cs.SY eess.SY 版本更新 57%

Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

迈向偏微分方程的目标无关联合嵌入预测控制

Jonathan Gallagher, Roberto Guglielmi

机构 * University of Waterloo(滑铁卢大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 该研究针对偏微分方程提出目标无关控制框架,基于联合嵌入预测架构,通过离线训练小型二维ViT编码器等,经模型预测路径积分控制器复用。在相关基准测试中,KE探测器规划提升奖励、降低误差,验证了潜在动力学与目标无关及校准可观测量用于状态控制的优势。

Comments Associated code will be open sourced alongside a later, updated submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28114 2026-08-05 cs.AI 版本更新 57%

Language model agents show in-group trust bias invisible to standard behavioural audits

指令调优语言模型代理中类似人类的内群体偏见

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01243 2026-08-05 cs.CL 版本更新 57%

Suffix-Constrained Greedy Search Algorithms for Causal Language Models

后缀约束的贪心搜索算法用于因果语言模型

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

机构 * Université Paris-Saclay, CNRS, LISN(巴黎萨克雷大学、法国国家科学研究中心、LISN) Université de Rennes, INSA Rennes, CNRS, IRISA(雷恩大学、里昂国立应用科学学院、法国国家科学研究中心、IRISA)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出后缀约束贪心搜索算法,用于在因果语言模型中确保最终答案的结构化提取,同时不损害性能甚至提升结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13769 2026-08-05 cs.AI cs.CE cs.NE 版本更新 57%

OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery

OR-Agent:连接进化搜索与结构化研究以实现自动化算法发现

Qi Liu, Ruochen Hao, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education(教育部道路与交通工程重点实验室) College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 OR-Agent通过结构化树形工作流和进化-系统化构想机制,实现自动化算法发现的高效探索与科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24223 2026-08-04 cs.CL 版本更新 57%

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

相关性的新作用:在智能搜索中指导语料库交互

Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

机构 * Tencent(腾讯) IIE-CAS(中国科学院计算技术研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究提出相关性在智能搜索中作用新观点,介绍相关性感知的RipGrep搜索代理RARG,它能将相关性转化为语料库交互执行先验,提供从粗到细的相关性指导,在浏览问答和检索中提升准确性与效率,实现更快更可靠的搜索收敛。

Comments code is available at https://github.com/LeqsNaN/RARG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20997 2026-08-04 cs.AI 版本更新 57%

BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

BioInsight: 面向交互式生物医学知识发现的多智能体编排

Jieyi Wang, Bingxuan Li, Nanyi Jiang, Desong Meng, Zirui Fan, Yuxin Guo, Jiayu Liu, Kunlun Zhu, Eddie Yang, Xiusi Chen, Pan Lu, Bingxin Zhao

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Purdue University(普渡大学) Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。

Comments Update some experiments and contents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18109 2026-08-04 cs.LG cs.OS cs.SY eess.SY 版本更新 57%

TempoNet: Slack-Quantized Transformer-Guided Reinforcement Scheduler for Adaptive Deadline-Centric Real-Time Dispatchs

TempoNet:基于Transformer的强化学习调度器用于自适应截止时间导向的实时调度

Rong Fu, Yibo Meng, Zeyu Zhang, Ziming Guo, Jia Yee Tan, Xiaojing Du, Simon James Fong

机构 * University of Macau(澳门大学) Tsinghua University(清华大学) Northeast Normal University(东北师范大学) Shanghai AI Laboratory(上海人工智能实验室) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Harbin University of Science and Technology(哈尔滨理工大学) Renmin University of China(中国人民大学) Adelaide University(阿德莱德大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 TempoNet结合Transformer与深度Q近似,通过时间松弛量化和稀疏注意力机制提升实时调度性能,实现高吞吐量下的截止时间保障。

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26497 2026-08-03 cs.CL 版本更新 57%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 57%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10475 2026-08-03 cs.AI 版本更新 57%

PEMAND: Persona-Enriched Multi-Agent Negotiation for Household Decision-Making

PEMANT:面向旅行的个性化多智能体谈判

Yuran Sun, Mustafa Sameen, Yaotian Zhang, Rongguan Gu, Mrunal Vibhute, Chia-yu Wu, Yuanyuan Lei, Xilei Zhao

机构 * Department of Civil and Costal Engineering, University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PEMANT框架,结合行为理论与多智能体谈判,改进家庭旅行决策建模,提升预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10429 2026-08-03 cs.MA cs.AI 版本更新 57%

AIvilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles

AIvilization v0:迈向大规模人工社会模拟的统一代理架构与自适应代理档案

Wenkai Fan, Shurui Zhang, Xiaolong Wang, Haowei Yang, Tsz Wai Chan, Xingyan Chen, Junquan Bi, Zirui Zhou, Jia Liu, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Bauhinia AI

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AIvilization v0通过统一代理架构和自适应代理档案,实现大规模人工社会模拟,解决目标稳定性与反应正确性矛盾,支持长周期自主性和多目标环境下的稳健性。

Comments v2: major revision. Agent architecture and environment consolidated into self-contained sections; new problem-setting section formalizing the asynchronous event model; evaluation reorganized by experiment with results reported alongside each protocol; added action-simulator audit, and human-steering analyses; other sections rewritten

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24802 2026-07-31 cs.IR cs.CL 版本更新 57%

SourceMinds at CheckThat! 2026: NLI-Grounded Citation Auditing in a Multi-Agent Pipeline for Full Fact-Checking Article Generation

SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成

Farhan Sharukh Hasan, Anirban Saha Anik, Eric Liu, Xiaoying Song, Mohotarema Rashid, Lingzi Hong

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20891 2026-07-31 cs.AI 版本更新 57%

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

深度研究可靠吗?误导性知识会导致错误结论

Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究深度研究代理在开放信息环境中的可靠性,引入MisKnow-Agent框架生成误导性实例,通过实验发现其易因误导知识得出错误结论,验证与实际证据使用脱节,评估防御措施效果,强调需提升模型和框架层面的证据验证及纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02383 2026-07-31 cs.CL 版本更新 57%

MEDIAREF: A Public Knowledge Store for Media Background Checks

了解你的来源:用于媒体背景核查的公共知识库

Benjamin Nichols, Michael Schlichtkrull, Nedjma Ousidhoum

机构 * Cardiff University(卡迪夫大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。

Comments Code and Data: https://github.com/nedjmaou/mediaref

详情

展开后加载摘要…

URL PDF HTML 收藏