arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 33 篇

2607.23424 2026-08-03 econ.GN q-fin.EC 版本更新 86%

Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam

错误且更自信:语言模型参加研究生经济学考试的实地实验

Piyush Akimitsu

专题命中 推理与问题求解 :language model(title,abstract);large language model(title)

AI总结 研究语言模型在研究生经济学考试中面对误导性信息的表现,通过GERB实验发现误导性信息降低正确答案概率,不同类型模型受影响无显著差异,错误答案有完整解释且模型自信,不对照答案难以发现错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 85%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28640 2026-08-03 cs.CL cs.CV 新提交 84%

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs

TokenSwap:多模态大语言模型中模态差距的基准测试与缩减

Andong Hua, Colton Bishop, Igor Mordatch, Arian Hosseini, Jindong Gu, Aleksandra Faust, Rebecca Roelofs, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文提出TokenSwap方法构建基准TokenSwap-Bench,发现42个多模态大语言模型普遍存在模态差距,推理模型差距更小,训练中引入TokenSwap可有效缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 84%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28775 2026-08-03 cs.SE 新提交 83%

Repository-Aware Metamorphic Relation Generation for Augmented Reality Applications using Large Language Models

基于大型语言模型的增强现实应用的仓库感知变形关系生成

Dibyendu Brinto Bose, Jiawei Qin, Chris Brown

专题命中 推理与问题求解 :large language model(title);language model(title)

AI总结 本文提出一种结合仓库级上下文与推理编排的流水线,利用大型语言模型生成优化的变形关系,在142个移动AR仓库数据集上验证了该方法可构建可靠的领域相关测试预言,能有效检测代码变异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15776 2026-08-03 cs.AI 版本更新 83%

NeurOWL: An LLM-Based Neural-symbolic Framework for Incomplete OWL Ontology Reasoning

NeurOWL:基于大语言模型的神经符号框架用于不完整OWL本体推理

Hui Yang, Jiaoyan Chen, Yiping Song, Renate Schmidt, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究不完整OWL本体的包含关系推理问题,提出NeurOWL框架,通过大语言模型和本体嵌入联合执行验证和溯因,利用形式与文本语义,在多领域真实本体上评估,展现强大稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01982 2026-08-03 cs.CV cs.AI q-bio.BM 版本更新 83%

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

MolSight: 一种用于统一化学图像理解的图感知视觉语言模型

Wenda Wang, Yihan Tong, Yuwei Hu, Xuchen Pan, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29175 2026-08-03 cs.SE 新提交 82%

Execution-First Synthetic Tool-Use Trace Generation for LLM Agents

面向LLM智能体的优先执行式合成工具使用轨迹生成

Hafsa Ouajdi, Francesco Giannuzzo, Alaa Boukhary, Paolo Papotti, Gerard Conangla, Adam Elwood

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对传统数据合成的局限,提出优先执行式框架SyntheticAgentTraceQA生成工具增强型智能体的监督数据,经四工具生态系统及Qwen模型验证,该框架可提升工具执行等性能,且揭示了掩码与全监督的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28629 2026-08-03 cs.AI 新提交 81%

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统

Konstantinos I. Roumeliotis, Ranjan Sapkota

机构 * University of the Peloponnese(伯罗奔尼撒大学) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 81%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 81%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06828 2026-08-03 cs.CV cs.AI 版本更新 79%

Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models

步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin

机构 * The KOW Company(KOW公司) University of Dhaka(达卡大学) American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。

Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新 78%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29241 2026-08-03 cs.IR cs.AI cs.CL 新提交 73%

RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

RecHarness:用于自进化推荐系统的多臂老虎机路由智能体框架

Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao, Shuwen Kang, Chi Lu, Wenjin Wu, Peng Jiang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RecHarness是一种多臂老虎机路由智能体框架,用于自动化优化推荐系统模型,通过分离方向选择与假设生成、引入跳盆机制提升稳定性,在多任务测试及在线A/B测试中均实现性能提升。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29211 2026-08-03 cs.CL 新提交 70%

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

何时该放弃:诊断与训练大语言模型以中止无效推理

Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Fandong Meng

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Weixin AI, Tencent Inc(腾讯微信人工智能)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对大语言模型在超能力任务上产生无效推理的问题,提出CaRL方法对齐模型行为与能力边界,实验验证其可减少无效推理且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10475 2026-08-03 cs.AI 版本更新 70%

PEMAND: Persona-Enriched Multi-Agent Negotiation for Household Decision-Making

PEMANT:面向旅行的个性化多智能体谈判

Yuran Sun, Mustafa Sameen, Yaotian Zhang, Rongguan Gu, Mrunal Vibhute, Chia-yu Wu, Yuanyuan Lei, Xilei Zhao

机构 * Department of Civil and Costal Engineering, University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PEMANT框架,结合行为理论与多智能体谈判,改进家庭旅行决策建模,提升预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29374 2026-08-03 cs.RO 新提交 50%

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

SAGP:基于粗区域VLM推理的语义 affordance 引导抓取规划

Muhayy Ud Din, Irfan Hussain

机构 * Khalifa University(哈利法大学) KU Center for Autonomous Robotic Systems (KUCARS)(KU自主机器人系统中心(KUCARS))

专题命中 推理与问题求解 :language model(abstract)

AI总结 SAGP是一种无训练的抓取规划框架,通过粗区域抽象层结合VLM推理与几何规划,在保持纯几何抓取高成功率的同时,提升了抓取的功能适用性,尤其适用于非对称带把手物体。

Comments Accepted in ICAME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29045 2026-08-03 cs.CV 新提交 50%

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

基于情感异质图推理与多任务联合学习的自适应情感视频描述

Junbo Wang, Liangyu Fu, Yuke Li, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对现有情感视频描述方法情感先验处理的缺陷,提出基于情感异质图与多任务联合学习的SAGML框架,实现了更鲁棒的情感视频描述性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17481 2026-08-03 econ.GN q-fin.EC 版本更新 50%

Universalization and the Origins of Fiscal Capacity

普遍化与财政能力的起源

Esteban Muñoz-Sobrado

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本文提出一个基于普遍化推理的税收合规与财政能力模型,探讨道德内化如何扩大税基并提升财政能力。

Journal ref Journal of Economic Behavior & Organization 249 (2026) 107696

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 65 篇

2607.29389 2026-08-03 cs.LG cs.SE 新提交 93%

Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies

基于大语言模型的流体系统仿真代码生成:模型与提示策略的基准测试

Jan Marius Stürmer, Jascha Knack, Tobias Koch, Andreas Weinmann

机构 * German Aerospace Centre (DLR)(德国航空航天中心) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究通过系统比较10种大语言模型与6种提示策略,评估其将流体系统模型图表示转换为WNTR、Modelica代码的能力,为相关设计流程提供指导,同时指出仿真保真度仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30219 2026-08-03 cs.AI cs.CL cs.LG cs.SE 版本更新 92%

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架

Buğra Alperen Uluırmak, Rifat Kurban

机构 * Erciyes University(埃里切耶大学) Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。

Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29064 2026-08-03 cs.LG cs.AI 新提交 92%

Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

基于警方事故叙述文本,对比前沿大语言模型与官方事故数据库编码的基准测试

Sudhir Bharati, Rajendra K C Khatri, Sudip Bharati

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究以阿肯色州2015-2025年的致命事故数据为对象,对比6种前沿大语言模型与官方事故数据库的编码效果,为事故编码领域的LLM应用提供了基准评估依据。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28710 2026-08-03 cs.CY 新提交 91%

Structured AI Demonstrations and Student LLM Use in Engineering Mechanics: Study Design and Preliminary Results

工程力学中的结构化AI演示与学生大语言模型(LLM)使用:研究设计与初步结果

Shuang Geng, Helen Lallos-Harrell, Jiya Ashar, Thomas J. McKenna, Annwesa Dasgupta, Caleb Farny, Emma Lejeune

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对工程力学课程设计了含九次结构化AI演示的方法论框架,结合调查工具分析学生LLM使用情况,为工程教育应对LLM融入提供实证研究基础。

Comments 47 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29431 2026-08-03 cs.AI 新提交 91%

ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

ModelEquivBench:LLM生成优化模型的多关系验证评估系统

Penglin Zhu, Jungang Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08804 2026-08-03 cs.CY cs.CL cs.LG 91%

Estimating Item Difficulty Using Large Language Models and Tree-Based Machine Learning Algorithms

利用大语言模型和基于树的方法进行项目难度估计

Pooya Razavi, Sonya Powers

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究利用大语言模型和基于树的方法预测K-5数学和阅读评估项目的难度,发现基于特征的方法在预测准确性上优于直接估计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03322 2026-08-03 cs.CL cs.AI 版本更新 91%

Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery

大语言模型能否推导新知识?一种动态生物知识发现基准

Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出DBench-Bio,一种动态生物知识发现基准,通过三阶段流程评估AI的新知识发现能力,揭示当前模型在知识发现上的局限性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 90%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 90%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28643 2026-08-03 cs.HC cs.CL 新提交 90%

To Facilitate or not to Facilitate: Human and LLM Facilitator Tendencies in Online Discussions

是否促进:在线讨论中的人类与大语言模型(LLM)促进者倾向

Dimitris Tsirmpas, Katerina Korre, John Pavlopoulos

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究创建PEFK语料库,对比人类与LLM的在线讨论促进倾向,发现LLM过度急于促进,训练ModernBert分类器修正效果优于LLM替代设置。

Comments For the moderators: The acronym package may complain that some "acro" references are undefined. These references are, in fact, defined and the readability of the article remains the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28814 2026-08-03 cs.CL cs.AI cs.LG 新提交 89%

Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

顺应阻力:偏好优化的大型语言模型(LLM)咨询师可在动机访谈中权衡目标坚持性与关系调谐

Weiying Chen, Junlong Shen, Zhexuan Tang

专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究基于动机访谈准则构建双轴评估框架,通过偏好优化训练LLM咨询师,发现惩罚对抗会降低目标坚持性,惩罚妥协无显著效果,仅提示控制可提升关系调谐且无目标坚持性代价。

详情

展开后加载摘要…

URL PDF HTML 收藏