arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 76 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 76 篇

2607.16323 2026-07-21 eess.SP cs.CV cs.LG eess.IV 新提交 92%

ECG-LLM: Foundation Model for ECG-Based Cardiac Reasoning

心电图大语言模型:基于心电图的心脏推理基础模型

Alexander Selivanov, Friederike Jungmann, Jan Kehrer, Karl-Ludwig Laugwitz, Eimo Martens, Daniel Rueckert

专题命中 推理与问题求解 :LLM(title,summary_cn);foundation model(title);large language model(abstract);language model(abstract)

AI总结 研究针对一线分诊缺乏确定性成像及现有心电图人工智能系统局限的问题,提出ECG-LLM模型,用多模态到语言监督策略训练,能从心电图回答多样心血管问题,恢复测量值、预测表型,在相关任务中表现良好,为临床推理提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 91%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12349 2026-07-21 cs.CY cs.AI cs.CL 91%

Information Suppression in Large Language Models: Auditing, Quantifying, and Characterizing Censorship in DeepSeek

大语言模型中的信息压制:对DeepSeek的信息审查、量化与特征化

Peiran Qiu, Siyi Zhou, Emilio Ferrara

机构 * Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学) Information Sciences Institute, University of Southern California, USA(信息科学研究所,南加州大学) Annenberg School of Communication, University of Southern California, USA(安纳伯格传播学院,南加州大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过审计框架揭示DeepSeek在处理政治敏感提示时的信息压制现象,指出模型在内部推理中保留敏感内容,但在最终输出中进行过滤或改写,强调了对AI模型中信息压制机制进行系统审查的重要性。

Journal ref Inf. Sci. 724, C (Jan 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25624 2026-07-21 cs.CR cs.AI cs.CL cs.LG 版本更新 90%

STAC: When Innocent Tools Form Dangerous Chains for LLM Agents

STAC:当无害工具形成危险链以劫持LLM代理

Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) UC Berkeley(伯克利大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。

Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17331 2026-07-21 cs.AI cs.MA 新提交 90%

Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning

智能企业资源规划(Agentic ERP):用于自主企业资源规划的多智能体大语言模型架构

Zhihao Liu, Tianyu Wang, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering(生产工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 研究针对ERP系统过度依赖人类决策的问题,提出Agentic ERP架构,结合角色对齐的LLM智能体、人工参与框架和图编排器。通过特定决策问题表述、编排解耦及多层面评估,证明该方法优于基线,能让ERP主动执行决策,提供了参考架构与评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14905 2026-07-21 cs.CL cs.AI 版本更新 90%

Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution

告诉我你如何推理,我就能说出你是谁:用于可靠大语言模型作者归属的推理图

Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz

机构 * University of Passau(帕绍大学) University of Dundee(邓迪大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM生成文本检测和作者归属问题,此前方法易受改写等影响。本文提出利用论证挖掘管道提取推理图的图神经网络方法,在混淆攻击及新模型版本文本评估中,相比传统基线展现更强鲁棒性和泛化能力,提升了检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17437 2026-07-21 cs.AI 新提交 90%

Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions

经验基础提升了在干扰期间模拟人类行为的大语言模型智能体的现实性

Chen Xia, Zexi Kuang, Yuqing Hu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨经验基础对提升LLM智能体模拟人类行为现实性的作用,开发基于经验的框架,将多项调查数据嵌入其中,通过实验验证该框架能显著提升模拟效果,使LLM智能体成为更具统计可信度的人口行为模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15841 2026-07-21 cs.AI 版本更新 90%

Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains

预算受限LLM验证中的异方差信号:结构异质性限制了优化收益

Jinlong Yang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文发现LLM不确定性信号在预算受限验证中存在异方差性,导致全局分配扭曲;通过分层阈值干预(CST)在强异质性设置下提升命中率达17个百分点,揭示结构异质性是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22455 2026-07-21 cs.LG 版本更新 90%

SkillRouter: Skill Routing for LLM Agents at Scale

SkillRouter:大规模LLM代理中的技能路由

YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出SkillRouter,通过全文本检索和重排序提升大规模LLM代理的技能路由性能,实验显示隐藏技能体导致路由准确率下降31-44个百分点,SkillRouter在基准测试中达到74.0%的Hit@1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17266 2026-07-21 cs.CL cs.AI 新提交 90%

Debate-on-Graph: Reliable and Adaptive Reasoning of Large Language Model on Uncertain Knowledge Graph

图上辩论:大语言模型在不确定知识图谱上的可靠且自适应推理

Peiji Yu, Xin Chen, Tianxing Wu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在不确定知识图谱上问答时的问题,提出Debate-on-Graph框架,设计启发式搜索算法提取子图并引入多智能体辩论机制,经实验验证该框架能实现可靠且自适应推理,性能优于现有方法。

Comments 18 pages, Accepted by ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 88%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11765 2026-07-21 cs.MA cs.AI cs.LG 版本更新 88%

OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration

OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架

Shijun Li, Hilaf Hasson, Joydeep Ghosh

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) Intuit AI Research, Mountain View, United States(Intuit AI研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。

Comments Accepted as a Oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17946 2026-07-21 cs.LG cs.AI 新提交 87%

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 87%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 85%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 85%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 85%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20161 2026-07-21 cs.LG cs.AI cs.CL 版本更新 85%

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究部) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 84%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18199 2026-07-21 cs.CL cs.LG 新提交 84%

PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

PPL-Factory:从语言建模到推理的任务感知和预算感知数据选择

Hang Zhang, Warren J. Gross

机构 * McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究如何从语言建模到推理进行任务和预算感知的数据选择,提出PPL-Factory框架,结合任务感知困惑度得分与数据预算感知标准,实验表明该框架在GSM8K等任务上仅用少量训练集就能超越其他方法,有效提升微调效率。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01223 2026-07-21 cs.AI cs.CL cs.LG cs.LO cs.SE 版本更新 83%

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

Theoria: 非正式推理状态上的重写-可接受性验证

Michael Saldivar, Ben Slivinski

机构 * Independent Researchers(独立研究者)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Theoria验证架构,通过将候选解重写为带显式理由的序列化状态转换并验证变更完整性,在HLE-Verified Gold上以91.4%精确率认证105个问题,优于整体式LLM评判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23509 2026-07-21 cs.RO 版本更新 83%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12815 2026-07-21 cs.AI 版本更新 83%

Visual Access Boundaries in Vision-Language Model Reasoning

视觉语言模型推理中的视觉访问边界

Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi, Kai Yamashita, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究视觉语言模型推理中CoT提示扩展的内容,通过视觉访问扫描定义VAB,发现CoT不主要靠延长图像令牌访问提效,而是扩展语言侧计算,且CoT收益受感知读出限制,瓶颈在读出非计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16372 2026-07-21 cs.SE cs.AI cs.LG cs.PL 新提交 82%

AoA: Theorem Proving Agent over Abstract Syntax Tree of Redesigned Language

AoA:基于重新设计语言抽象语法树的定理证明智能体

Qiyuan Xu, Joshua Ong Jun Leang, Renxi Wang, Wenda Li, Haonan Li, Luke Ong, Conrad Watt

机构 * Nanyang Technological University Singapore(南洋理工大学新加坡分校) Imperial College London London, UK(伦敦帝国理工学院伦敦分校) University of Edinburgh Edinburgh, UK(爱丁堡大学爱丁堡分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究针对交互式定理证明中人工操作限制可扩展性及基于LLM的证明智能体成本高的问题,提出将智能体从源文本提升到抽象语法树的方法,实现了AoA,在多个方面有显著提升且解决更多难题。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17053 2026-07-21 cs.SE cs.AR 新提交 82%

MechMem-RTL: Reusing Verified Mechanism Memories for LLM-Based RTL Repair

MechMem-RTL:用于基于大语言模型的RTL修复的可复用验证机制存储器

Mingyu Cheng, Junjie Gao, Jinhua Cui, Kuncai Zhong

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型修复RTL设计时,利用任务文本相似性易误导的问题,提出MechMem-RTL框架,复用验证器确认的修复记录,通过严格匹配触发证据来注入记录,实验表明该框架在多个任务上修复效果优于标准反馈修复和任务相似性RAG。

Comments 7 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17674 2026-07-21 cs.LG cs.AI 新提交 81%

Uncovering Latent Reasoning Strategies in Language Models

揭示语言模型中的潜在推理策略

Awni Altabaa, John Lafferty

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究将预训练语言模型响应分布分解为策略条件表示的问题,提出潜在变量分解方法,引入新变分目标,通过多策略算法任务基准验证了该方法能恢复潜在代码并保留基础模型响应分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17047 2026-07-21 cs.LG cs.AI cs.LO 新提交 81%

Solver-Hard Is Not Model-Hard: A Hardness-Controlled Diagnostic for LLM Constraint Reasoning

求解器困难并非模型困难:一种用于大语言模型约束推理的硬度控制诊断方法

Lucky Verma

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型约束推理,在接近匹配子句密度时测试实例级转移,比较不同公式和锚点,发现求解器与模型硬度差异,以及模型对证明保留重新标记敏感,还研究了完成令牌花费与代理的关系。

Comments 13 pages, 2 figures, 5 tables. Code and aggregate reproduction data: https://github.com/lucky-verma/solver-hard-is-not-model-hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16712 2026-07-21 cs.AI cs.CL 新提交 81%

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

DS@GT在eRisk 2026的ARC:用于对话式抑郁症筛查的具有结构化算法指导的混合多智能体大语言模型系统

Victor Gong, David Guecha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 介绍DS@GT参加eRisk 2026对话式抑郁症筛查挑战赛,其系统历经三个阶段,最终采用混合配置并添加算法组件。提交三次运行结果,混合运行3表现出色,以低成本超付费基线,验证较弱开源模型经算法监督可与专有模型竞争。

Comments Conference and Labs of the Evaluation Forum (CLEF), 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14345 2026-07-21 cs.LG cs.AI cs.CR 版本更新 81%

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

价值泄露:大语言模型的答案被其自身价值观悄然塑造

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型存在价值泄露问题,即其答案受自身价值观影响却未向用户披露。为此引入评估套件量化,发现模型受多种价值观影响,前沿模型差异大,价值泄露是新的失败模式,当前训练和评估未充分解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10139 2026-07-21 cs.LG cs.AI 版本更新 81%

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型

Ning Liu

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。

详情

展开后加载摘要…

URL PDF HTML 收藏