arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 877 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2605.09544 2026-05-12 cs.AI 77%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01008 2026-05-12 cs.CL 77%

MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL

MARS-SQL: 一种用于文本到SQL的多智能体强化学习框架

Haolin Yang, Jipeng Zhang, Zhitao He, Alexander Zhou, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 MARS-SQL通过多智能体框架解决文本到SQL任务中的逻辑与模式对齐问题,采用生成代理与验证机制提升交互学习效果,实现77.84%和89.75%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04665 2026-05-12 cs.CL 77%

Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs

句式转换导致的输出模式崩溃:当LLMs在语义等价输入下失衡

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现,当请求内容被重写时,大语言模型往往无法保持原任务格式,提出了提示变体输出模式崩溃现象,并通过PARACONSIST基准测试评估模型鲁棒性。

Comments Added a footnote; author order is alphabetical by last name

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 77%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18962 2026-05-12 cs.HC 75%

UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding

UniMind: 激活大型语言模型的统一多任务脑解码能力

Weiheng Lu, Zhouheng Yao, Jiamin Wu, Pengyu Zhu, Yuchen Zhou, Weijian Mai, Qihao Zheng, Wanli Ouyang, Chunfeng Song

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 UniMind通过引入大型语言模型解码复杂神经模式,提升多任务脑解码的泛化能力,实验表明其在十个数据集上平均提升12%。

Comments 19pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10622 2026-05-12 cs.CL cs.AI cs.LG 75%

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Thomas Schaaf, Esaú Villatoro-Tello, Ahmed Hassoon, Ricard Marxer, Petr Motlicek

机构 * Idiap Research Institute(Idiap研究 institute) Université de Toulon(里昂大学) Aix Marseille Univ(马赛大学) LIS(LIS实验室) Avignon University(阿维尼翁大学) Zenidoc University of Zurich(苏黎世Zenidoc大学) Stenograf Solventum CNRS & ILLS(Solventum CNRS与ILLs) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 SDialog工具包通过统一的对话生成、评估和可解释性框架,提供多代理模拟、综合评估、机制可解释性和音频生成功能,支持混合后端实验。

Comments Pre-print submitted to EACL System Demonstration (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09613 2026-05-12 cs.RO cs.CV 75%

SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation

SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应

Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi, Satya Sai Reddy, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);post-training(abstract)

AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11287 2026-05-12 cs.AR cs.SE 75%

Synthesis-in-the-Loop Evaluation of LLMs for RTL Generation: Quality, Reliability, and Failure Modes

LLM在RTL生成中的回路合成评估:质量、可靠性与故障模式

Weimin Fu, Zeng Wang, Minghao Shao, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu, Xiaolong Guo

专题命中 评测与基准 :LLM(title_cn);language model(abstract)

AI总结 本文评估32个语言模型在202个Verilog任务上的RTL生成能力,通过硬件质量指数衡量合成与实现质量,发现不同模型在HQI指标上的表现差异显著,揭示了专有模型与开源模型在合成故障上的系统性差异。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 75%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09119 2026-05-12 cs.LG cs.AI cs.CL 75%

Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity

个性化对齐再审视:用户多样性必要性和充分性

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington, Seattle, Washington, USA(华盛顿大学福斯特商学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了个性化对齐的理论条件,证明用户多样性是实现高效个性化识别的关键,提出用户多样性条件决定在线 regrets 和离线样本复杂度的最优速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08412 2026-05-12 cs.CV 75%

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

SYNCR: 一个具有合成接地的跨视频推理基准

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami

机构 * New York University(纽约大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10659 2026-05-12 cs.CL cs.AI cs.SI stat.ML 73%

When Can Digital Personas Reliably Approximate Human Survey Findings?

数字人设何时能可靠近似人类调查结果?

Mumin Jia, Yilin Chen, Divya Sharma, Jairo Diaz-Rodriguez

机构 * Department of Mathematics and Statistics(数学与统计学系) York University(约克大学) University Health Network(大学健康网络)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过LISS面板评估数字人设在不同架构和任务下的表现,发现其在稳定属性领域表现较好,但个体预测和多变量结构恢复能力有限,检索增强架构效果更依赖人类响应结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10529 2026-05-12 cs.AI cs.LG 73%

PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs

PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) School of Computing and Information Systems(计算与信息系) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) School of Computing Technologies(计算技术学院) Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Department of Systems Engineering and Engineering Management(系统工程与工程管理系) The Chinese University of Hong Kong(香港中文大学) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出PrimeKG-CL基准,基于九个权威生物医学数据库构建,包含时间快照、任务和多模态特征,评估六种持续学习策略在不同解码器上的性能,发现解码器选择和策略交互显著,仅DistMult能区分持久与过时知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08031 2026-05-12 cs.SD cs.AI cs.LG eess.AS 73%

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

AU-Harness:音频大语言模型的开放式工具包

Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash Shah, Shruthan Radhakrishna, Sathwik Tejaswi Madhusudhan, Vikas Yadav, Sai Rajeswar

机构 * ServiceNow University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 AU-Harness通过优化处理流程和并行执行,实现151%的速度提升,提供标准化提示协议和灵活配置,促进音频大语言模型的系统性发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23511 2026-05-12 eess.AS cs.AI cs.CL cs.SD 73%

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

MECAT:一个多专家构建的细粒度音频理解任务基准

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Xunying Liu, Junbo Zhang, Jian Luan

机构 * The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MECAT基准,通过集成专家模型分析与推理模型,提供细粒度音频描述和开放问题对,结合新指标DATE评估模型性能,评估现有音频模型的能力与局限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23009 2026-05-12 cs.LG cs.AI 73%

Position: Stop Evaluating AI with Human Tests, Develop Principled, AI-specific Tests instead

评估:停止用人类测试评估AI,改而开发基于AI的原理性测试

Tom Sühr, Florian E. Dorner, Olawale Salaudeen, Augustin Kelava, Samira Samadi

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ETH Zurich, Zurich(苏黎世联邦理工学院,苏黎世) University of Tübingen, Methods Center, Tübingen(图宾根大学,方法中心,图宾根) Massachusetts Institute of Technology, Cambridge(麻省理工学院,剑桥)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文指出,将AI性能评估等同于人类心理特质是理论和实证上的错误,呼吁开发专门针对AI的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09228 2026-05-12 cs.LG cs.AI 73%

ProactBench: Beyond What The User Asked For

ProactBench: 超出用户所要求的

Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

机构 * Boson AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 ProactBench研究对话主动性,通过三个阶段分解能力,设计代理对抗偏见,验证不同模型在恢复阶段的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08889 2026-05-12 cs.LG cs.CL cs.DL 73%

Machine Learning Research Has Outpaced Its Communication Norms and NeurIPS Should Act

机器学习研究已超越其沟通规范,NeurIPS应采取行动

Ajay Mandyam Rangarajan, Jeyashree Krishnan

机构 * Independent Researcher(独立研究员) Institute for Computational Biomedicine(计算生物医学研究所) University Hospital Aachen(亚琛大学医院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究发现NeurIPS摘要可读性下降,缩写密度增加,且更易读的论文更受引用。文章提出七项标准以提升可读性与影响力。

Comments 9 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08553 2026-05-12 cs.SE cs.AI cs.LG 73%

VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation

VeriContest:一个用于可验证代码生成的竞技编程基准

Zichen Xie, Mrigank Pawagi, Yuxin Liu, Aaditi Rai, Lize Shao, John Berberian, Sicong Che, Wenxi Wang

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Science(印度科学研究院) Rice University(里士曼大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VeriContest通过946个LeetCode和Codeforces问题,评估可验证代码生成的性能,揭示模型在生成规范和证明时的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08291 2026-05-12 cs.LG cs.AI cs.AR 73%

Graph Computation Meets Circuit Algebra: A Task-Aligned Analysis of Graph Neural Networks for Electronic Design Automation

图计算与电路代数的交汇:图神经网络在电子设计自动化中的任务对齐分析

Hyunmog Kim

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文探讨了图神经网络在电子设计自动化中的应用,通过任务对齐分析,揭示了不同任务与图神经网络架构的匹配问题,指出当前方法的局限性和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08254 2026-05-12 cs.LG cs.AI 73%

HyperTransport: Amortized Conditioning of T2I Generative Models

HyperTransport:T2I生成模型的 amortized 条件控制

Valentino Maiorca, Eleonora Gualdoni, Xavier Suau, Marco Cuturi, Luca Zappella, Pau Rodríguez

机构 * Apple(苹果公司)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 HyperTransport 通过超网络框架实现对T2I生成模型的amortized条件控制,结合连续可解释强度控制和跨模态条件,提升模型可控性与效率,验证结果在多个测试概念上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08234 2026-05-12 cs.LG cs.AI 73%

When Does Value-Aware KV Eviction Help? A Fixed-Contract Diagnostic for Non-Monotone Cache Compression

何时价值感知的KV驱逐有助于?非单调缓存压缩的固定合同诊断

Ruijie Zhang, Haozhe Liang, Da Chang, Li Hu, Fanqi Kong, Huaxiao Yin, Yu Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了价值感知KV驱逐在非单调缓存压缩中的有效性,通过固定合同诊断方法分析了驱逐策略在三个关键步骤中的表现,验证了其在不同基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08197 2026-05-12 cs.LG cs.AI 73%

ReplaySCM: A Benchmark for Executable Causal Mechanism Induction from Interventions

ReplaySCM:一个用于从干预证据中可执行因果机制归纳的基准

Serafim Batzoglou

机构 * Frontier LLMs(前沿大语言模型) Original, Extra Worlds, and Counterexample Audit (CEx)(原始、额外世界和反例审计)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 ReplaySCM通过不同设置测试模型从有限干预证据中归纳可执行因果机制的能力,评估可执行回放泛化,提升局部前驱模式覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08112 2026-05-12 cs.SE cs.AI cs.CE cs.LG cs.LO 73%

Context-Augmented Code Generation: How Product Context Improves AI Coding Agent Decision Compliance by 49%

上下文增强的代码生成:产品上下文如何通过49%提高AI编码代理的决策合规性

Drew Dillon, Kasyap Varanasi

机构 * Brief(简述)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个衡量决策合规性的基准,通过产品上下文检索系统提升AI编码代理的决策合规性,实验结果显示合规率从46%提升至95%。

Comments 16 pages, 3 figures, 16 tables. Benchmark repository: https://github.com/brief-hq/dcbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10845 2026-05-12 cs.CV cs.CL 70%

BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation

BabelDOC: 通过中间表示实现更好的布局保持PDF翻译

Qi Yang, Xiangyao Ma, Xiao Wang, Hao Wang, Rui Wang

机构 * School of Computer Engineering and Science, Shanghai University, Shanghai, China(1 上海大学计算机工程与科学学院,上海,中国) Funstory.ai Limited, Hong Kong SAR, China(2 Funstory.ai有限公司,香港特别行政区,中国) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(3 上海交通大学计算机科学与工程系,上海,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 BabelDOC通过中间表示框架实现布局保持的PDF翻译,解决语言处理与布局保持的矛盾,提升翻译精度和文档一致性。

Comments ACL 2026 System Demonstration paper. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10804 2026-05-12 cs.AI cs.CY cs.HC 70%

New AI-Driven Tools for Enhancing Campus Well-being: A Prevention and Intervention Approach

新的AI驱动工具提升校园福祉:一种预防与干预方法

Jinwen Tang

机构 * Graduate School(研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过AI工具提升校园福祉,开发TigerGPT和AURA提升反馈质量,利用ENS和PsychoGPT进行心理健康干预,结合SMMR提高评估准确性。

Comments PhD Dissertation, University of Missouri, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10763 2026-05-12 cs.AI cs.CR 70%

MATRA: Modeling the Attack Surface of Agentic AI Systems -- OpenClaw Case Study

MATRA:代理AI系统的攻击面建模——OpenClaw案例研究

Tim Van hamme, Thomas Vissers, Javier Carnerero-Cano, Mario Fritz, Emil C. Lupu, Lieven Desmet, Dinil Mon Divakaran

机构 * DistriNet, KU Leuven(DistriNet,根特大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Imperial College London(伦敦帝国理工学院) A*STAR Institute for Infocomm Research(A*STAR信息与通信研究机构)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MATRA框架,用于评估代理AI系统中已知威胁转化为具体风险的机制,通过OpenClaw案例展示如何利用攻击树和安全控制降低风险。

Comments Accepted for presentation at the 5th International Workshop on Designing and Measuring Security in Systems with AI (DeMeSSAI 2026), co-located with the 11th IEEE European Symposium on Security and Privacy (EuroS&P 2026), Lisbon, Portugal, July 10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10721 2026-05-12 physics.soc-ph cs.CL cs.MA 70%

Conformity Generates Collective Misalignment in AI Agents Societies

一致性在AI代理社会中产生集体偏离

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia

机构 * University of Konstanz(康斯坦茨大学) Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) Sapienza University of Rome(罗马大学) Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10480 2026-05-12 cs.AI 70%

ASIA: an Autonomous System Identification Agent

ASIA:一个自主系统识别代理

Dario Piga, Marco Forgione

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11233 2026-05-12 cs.CL 70%

CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis

CNSocialDepress:一种用于抑郁症风险检测和结构化分析的中文社交媒体数据集

Jinyuan Xu, Tian Lan, Xintao Yu, Xue He, Hezhi Zhang, Ying Wang, Pierre Magistry, Mathieu Valette, Lei Li

机构 * Ertim Inalco Milkuya Studio Sorbonne Université(索邦大学) IRD Lab(IRD实验室) Faculty of Psychology, Peking University(北京大学心理学系) Faculty of Psychology and Cognitive Science, Beijing Normal University(北京师范大学心理学与认知科学系) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CNSocialDepress数据集,用于中文社交媒体中抑郁症风险检测与结构化分析,包含44178条帖子及10306个抑郁症相关片段,支持多维度心理属性分析及NLP任务应用。

详情

展开后加载摘要…

URL PDF HTML 收藏