arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2607.16050 2026-07-20 cs.LG 新提交 74%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14541 2026-07-17 cs.AI 新提交 74%

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理

Lingyun Yang, Yuxiao Wang, Shenghao Liang, Linfeng Yang, Daocheng Ying, Chunbo You, Rui Zhang, Luping Wang, Yinghao Yu, Guodong Yang, Liping Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。

Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12338 2026-07-15 cs.AI 新提交 74%

How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks

多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析

Wei-Jung Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。

Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19491 2026-06-19 cs.LG stat.ML 新提交 74%

Algebraic Dead Directions in LayerNorm Transformers: A Forward-Pass-Only Diagnostic at LLM Scale

LayerNorm Transformer 中的代数死方向:一种仅需前向传播的大语言模型规模诊断方法

Tejas Pradeep Shirodkar, P. J. Narayanan

机构 * IIIT, Hyderabad(海得拉巴国际信息技术学院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 本文发现 LayerNorm 的逆尺度方向是后最终归一化中心激活协方差矩阵的精确代数核,可仅从参数中读取死方向,无需前向或后向传播,并在 14 个预训练模型上验证了其有效性。

Comments 34 pages, 7 figures, 6 tables. Empirical companion to arXiv:2606.05957

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17564 2026-06-17 cs.CV cs.AI 新提交 74%

Geometric Consistency Protocol for Foundation Model Features in Multi-View Satellite Imagery

多视图卫星图像中基础模型特征的几何一致性协议

Qiyan Luo, Jie Yang, Yingdong Pi, Lekang Wen, Mi Wang

机构 * Hubei Province Key Research and Development Program(湖北省重点研发计划) LIESMARS Special Research Funding(测绘遥感信息工程国家重点实验室专项研究基金) National Science Fund for Distinguished Young Scholars(国家杰出青年科学基金)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 针对卫星多视图重建中传统2D全局匹配的误导性,提出基于有理函数模型(RFM)的几何忠实评估协议,通过RPC投影3D一致性度量和几何约束密集匹配代理,揭示语义一致性与几何定位的解耦,并证明在RPC一致评估下2D骨干网络仍具竞争力。

Comments The manuscript is accepted as Oral Presentation in IEEE International Geoscience and Remote Sensing Symposium(IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07623 2026-06-09 cs.LG cs.LO 新提交 74%

Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models

上下文确定性有限证书与语言模型中涌现的阈值理论

Faruk Alpay, Hamdi Alakkad

机构 * Bahcesehir University(巴切谢希尔大学)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 提出用有限语义证书验证上下文条件语言模型行为,证明有限域线性任务族中确定性准则,并证明阈值涌现的反幻象定理,将阈值度量与语义置信度分离。

Comments 40 pages; ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16975 2026-08-19 cs.CL cs.LG 新提交 73%

Margin-Regularized Structured Semantic Alignment for Brain-Language Correspondence

用于脑-语言对应关系的边际正则化结构化语义对齐

Jiaqi Wang, Huawen Hu, Shu Zhang

机构 * School of Computer Science and Technology, Northwestern Polytechnical University(西北工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文针对脑-语言解码的模糊性问题,提出MD-SigLIP框架,通过边际正则化结构化语义对齐实现基于检索的解码,在全词汇与子集评估下均取得最优检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14763 2026-08-18 eess.IV cs.AI cs.CV cs.LG 新提交 73%

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习

Yuhao Huang, Yuanji Zhang, Yuhuan Lu, Dong Ni, P. Ellen Grant, Davood Karimi

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。

Comments 17 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-18 cs.AI cs.CL cs.MA 新提交 73%

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15286 2026-08-18 cs.LG cs.AI 新提交 73%

No Task Fails Every Time: Why One-Shot Audits Are Structurally Blind to Agent Damage

没有任务每次都失败:为什么单次审计在智能体损伤问题上存在结构性盲区

Shiven Khurdi

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出AgentRelBench工具,发现单次智能体审计易遗漏损伤对,模型能力提升会减少损伤任务,部分模型存在宣称弃权却执行不可逆操作的情况,且所有发现均按预注册标准执行。

Comments 25 pages, 4 figures, 16 tables, 6 appendices. Code, task suite, released per-run verdicts, and a one-command reproduction of every reported number: https://github.com/shivenkk/agentrelbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14999 2026-08-18 cs.CL cs.AI 新提交 73%

RamseyGadgets: A Graph Construction Dataset for LLMs

RamseyGadgets:面向大语言模型(LLMs)的图构造数据集

Zohair Raza Hassan, Deepak Pandita

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出新型图构造数据集RamseyGadgets,评估5个开源LLMs在其70个拉姆齐良图问题上的表现,发现LLMs在困难问题上准确率仅37.70%,Gemma-4-31B性能最优,还可用于确定提升LLMs表现的提示类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13608 2026-08-17 cs.AI cs.CR cs.LG 新提交 73%

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

基于缩放假设的无标签智能体学习控制器能力评估

Aryan Luthra, Kshitij Jain, Siddharth Arya, Bobby Filar, Anna Bertiger

机构 * Georgian

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。

Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13566 2026-08-17 cs.LG cs.AI cs.SE 新提交 73%

Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

勿宣称面向基准的优化可提升通用编码能力——需要多样化评估

Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov

专题命中 评测与基准 :foundation model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 该研究指出少量编码基准的优化无法提升通用编码能力,通过案例研究验证了基准排名难泛化、跨任务迁移差等问题,呼吁采用差异化评估与持续基准维护。

Comments Accepted to the DL4Code workshop @ ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11683 2026-08-13 cs.AI cs.CL 新提交 73%

FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents

FrontierFinance:用于衡量金融智能体前沿智能的具有挑战性的基准

Yuhao Zhang, O. Ozan Koyluoglu, Thejas Venkatesh, Richard Diehl Martinez, Vishank Bhatia, Arash Alidoust, Ashwin Paranjape

机构 * Samaya AI(萨马亚人工智能公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究推出覆盖投资者全流程的FrontierFinance基准,评估发现工具框架影响智能体表现,Samaya内部系统最优,开源模型Kimi K3成本更低且接近专有模型,最难用例为筛选与发现等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10268 2026-08-12 cs.LG cs.AI cs.CY 新提交 73%

Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

面向大语言模型的人权基准测试:一种试点方法

Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee, Matilda Wysocki, Malcolm Langford, Caitlin Kraft Buchman

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了首个经专家验证的人权基准HumRightsBench,调整IRAC框架为IRAP,通过真实场景测试LLMs的人权推理能力,发现模型准确率差异显著,可推动AI评估科学发展。

Comments Best paper, honorable mention, at the ICML 2026 Workshop on AI4Law, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10258 2026-08-12 cs.CL cs.AI 新提交 73%

TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

TAF-MED:声明自我治疗意图下大语言模型的多轮安全拒绝崩溃

Waleed Jamil, Raphael Schmitt

机构 * Independent Researcher(独立研究者) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心医学院普通实践研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出TAF-MED医疗安全基准,评估8个大语言模型的多轮医疗对话安全表现,发现多数模型会在后续对话中出现安全拒绝崩溃,自动评判工具与医生标注一致性较高,将公开基准支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 73%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 73%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 73%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07542 2026-08-11 cs.AI cs.LG cs.MA cs.RO 新提交 73%

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

不会发生漂移的AI科学家:四足机器人导航研究循环中的偏好、结构与可证伪发现

Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一款基于自研究范式的AI科学家,通过新增实验卡片、专门子智能体和偏好神谕kkanbu的组件,解决自主研究循环漂移问题,在四足机器人导航实验中验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07537 2026-08-11 cs.NE cs.AI cs.CL cs.HC cs.MA 新提交 73%

An evolutionary model of animats with VLM-based subjective evaluation

基于视觉语言模型(VLM)主观评估的动物机器人进化模型

Shota Miyazaki, Takaya Arita, Reiji Suzuki

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出将VLM主观评估融入遗传算法的框架,使虚拟软体机器人同步进化形态与运动,实验显示该方法可加快种群收敛,且VLM主观选择的结果与人类评估倾向相似。

Comments 18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review

Journal ref Shota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07530 2026-08-11 cs.AI cs.CL cs.DB 新提交 73%

NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation

NL2SHACL-Bench:面向自然语言到SHACL翻译的基准套件

Yuchen Zhou, Niels Bobet, Maribel Acosta

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NL2SHACL-Bench基准套件,评估了四个最先进大语言模型的NL2SHACL翻译能力,发现当前模型能生成语法有效SHACL,但复杂逻辑与结构模式的语义等价约束生成仍有不足,该基准可衡量领域进展。

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06111 2026-08-07 cs.CL cs.AI 新提交 73%

Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers

超越序列顺序:面向Transformer的句法感知位置嵌入

Haris Riaz, Hyungji Kim, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出句法感知位置嵌入SiPE,将句法先验注入Transformer,使模型在SyntaxGym、GLUE基准分别提升10.3%、8.2%,困惑度降9.0%,在句法监督与推理成本间建立新帕累托前沿。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06027 2026-08-07 cs.CL cs.AI cs.HC 新提交 73%

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

FormBharo:为印度农村设计和评估用于对话式表单填写的语音助手

Aman Dalmia, Sanskriti Midha, Jigar Doshi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对印度农村无法读写的人群开发了语音助手FormBharo,结合LLMs与规则控制完成表单填写,发布了相关基准数据集,通过端到端评估确定最优模型配置以平衡准确性、成本与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 73%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05163 2026-08-07 cs.CL cs.LG 新提交 73%

Where Privacy Risk Lives in English-Source Multilingual RAG: A Stage-Decomposed Audit Across Five Query Languages

英语源多语言检索增强生成(RAG)系统的隐私风险所在:五种查询语言下的阶段分解审计

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对英语源多语言RAG系统,通过含五种查询语言的两阶段防御审计发现,非英语语言仍存在残留PII泄露,附加黄金文档可阻断多数残留单元,后续计划开展独立MT与非Qwen判别器的复现工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04374 2026-08-06 cs.CL cs.AI 新提交 73%

FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation

FinReportBench:衡量与提升机构级财务报告生成能力

Yinghao Tang, Tan Zhenwei, Yiyao Wang, Wanli Gu, Xiaolu Zhang, Jun Zhou, Wei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinReportBench基准,发现大型语言模型生成机构级财务报告的瓶颈在于报告身份认同与机构完整性,通过基准引导的技能蒸馏可显著提升模型相关指标。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 73%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03464 2026-08-05 cs.AI cs.CL cs.HC 新提交 73%

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

ChartAnno:评估多模态大语言模型的图表标注生成能力

Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01724 2026-08-04 cs.CL cs.AI cs.HC 新提交 73%

TIDES: A Longitudinal Bilingual Dataset for Modeling Multi-Party Social Dynamics

TIDES:用于建模多方社会动态的纵向双语数据集

Heechan Lee, Jeonggyu Kang, Junho Myung, Jaywoong Jeong, Juho Kim, Joseph Seering

机构 * KAIST(韩国科学技术院) SkillBench

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有群体对话数据集无法捕捉团队长期社会动态的问题,推出TIDES纵向双语数据集,基于其微调模型提升下一个说话人预测性能,同时发现预测效果与话语自然度存在潜在不匹配。

Comments The first two authors hold equal contribution. Accepted to COLM 2026. Project website: https://tides.cstlab.org/

详情

展开后加载摘要…

URL PDF HTML 收藏