arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 68 篇

2605.23019 2026-05-25 cs.LG 92%

PACE: Two-Timescale Self-Evolution for Small Language Model Agents

PACE:小型语言模型代理的双时间尺度自我进化

Chen Ling, Pei Chen, Albert Guan, Jiaming Qu, Shayan Ali Akbar, Madhu Gopinathan, Erwin Cornejo

机构 * Amazon(亚马逊)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 提出PACE框架,通过双时间尺度协调低风险提示优化与高风险控制逻辑更新,使冻结的小型语言模型在无需权重更新或依赖前沿模型的情况下实现自主自我进化,在12个骨干-基准组合上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 92%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23497 2026-05-25 cs.CL 92%

Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering

询问老朋友:诊断和缓解基于LLM的法定问答中的时间故障模式

Max Prior, Andreas Schultz, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过构建包含312个专家验证的德国法定问答对基准,诊断并缓解了大型语言模型在法定问答中的两种时间故障模式(截止后过时和近因偏差),发现检索增强生成通过事实日期提取和版本过滤显著提升性能,而网络搜索存在不稳定性与近因偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23102 2026-05-25 stat.ML cs.LG stat.ME 92%

LLM Sparsity Prior for Robust Feature Selection

LLM 稀疏先验用于鲁棒特征选择

Caleb Skinner, Yihan Guo, Meng Li

机构 * Department of Statistics, Rice University(统计学系,里士满大学) Department of Computer Science, Rice University(计算机科学系,里士满大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出 LLM 稀疏先验 (LSP) 方法,通过将 LLM 生成的权重整合到 Spike-and-Slab 模型的先验包含概率中,并利用层次超先验动态调整权重影响,实现鲁棒的高维特征选择,在急性肾损伤数据集上提升了预测准确性和临床相关特征识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28048 2026-05-25 cs.CL cs.SI 92%

Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

稳定行为,有限变化:城市情感感知中LLM智能体的角色有效性

Neemias B da Silva, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过多角色提示生成LLM智能体,发现角色内行为稳定但角色间差异有限,且无角色模型在某些任务中表现更优。

Comments 8 pages, 8 figures. IEEE DCOSS - UrbCom

Journal ref IEEE DCOSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05364 2026-05-25 cs.SE 91%

Survey of LLM Agent Communication with MCP: A Software Design Pattern Centric Review

LLM智能体通信与MCP综述:以软件设计模式为中心的回顾

Anjana Sarkar, Soumyendu Sarkar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了经典软件设计模式如何增强基于LLM的智能体AI系统中通信的可靠性和可扩展性,重点分析了模型上下文协议(MCP),并探讨了中介者、观察者、发布-订阅和代理等模式在MCP兼容框架中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18788 2026-05-25 cs.CL 91%

BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models

BURMESE-SAN: 评估大语言模型的缅甸语NLP基准

Thura Aung, Jann Railey Montalan, Jian Gang Ngui, Peerat Limkonchotiwat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)

AI总结 提出首个全面评估大语言模型在缅甸语上理解、推理和生成能力的基准BURMESE-SAN,包含七个子任务,并通过母语者驱动构建确保语言自然性和文化真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23273 2026-05-25 cs.MA 90%

Self-Refining Topology Optimization via an LLM-Based Multi-Agent Framework

基于LLM多智能体框架的自优化拓扑优化

Hyunjee Park, Hayoung Chung

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 提出TopOptAgents多智能体系统,通过LLM协作与迭代自优化循环,自动化拓扑优化的决策与设计过程,尤其对文献覆盖不足的问题类效果显著。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 90%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17076 2026-05-25 cs.LG cs.AI cs.DC cs.MA 90%

S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination

S-Bus: 多智能体LLM状态协调的自动读集重建

Sajjad Khan

机构 * Sajjad Khan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出S-Bus中间件,通过服务端DeliveryLog机制在提交时从HTTP GET流量中重建每个智能体的读集,实现可观测读隔离(ORI)一致性,防止专用分片拓扑中的结构性竞态条件,并通过形式化证明和实验验证其安全性。

Comments v2: LLM judge validated against human annotator (Zahid Hussain, Mindgigs Peshawar) on PH-3 at strict kappa=0.93 (n=93, 96.8% agreement); over-claim refined to 32% (LLM) / 49% (human). Adds Exp.PG-Comparison Rust-Native and Workload-B chi2=1094.98. 24 pages, 23 tables. Annotation data attached as arXiv ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15482 2026-05-25 cs.CL 90%

FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models

FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准套件

Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

机构 * Lime FinTech(Lime金融科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出FINESSE-Bench,包含8个专业基准和3993个问题,通过分层设计(如CFA级别、CMT级别等)系统评估大语言模型从基础到专家级的金融能力,并引入基于LLM评判的自动评分方案。

Comments 21 pages, 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 90%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23465 2026-05-25 cs.CY 90%

IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings

IyàwóBench: 评估大型语言模型在尼日利亚初级卫生机构中对未分化发热性疾病的临床分诊准确性的基准

Anthonio Oladimeji Gabriel, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对西非初级卫生机构中未分化发热性疾病,构建了基于真实患者数据的合成临床病例基准IyàwóBench,评估六种LLM的分诊准确性和安全性,发现所有模型安全性达100%但准确性差异大,嵌入WHO指南的临床工程系统表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01253 2026-05-25 cs.SE 90%

TraceLLM: Leveraging Large Language Models with Prompt Engineering for Enhanced Requirements Traceability

TraceLLM:利用大型语言模型与提示工程增强需求可追溯性

Nouf Alturayeif, Irfan Ahmad, Jameleddine Hassine

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出TraceLLM框架,通过提示工程和示例选择,利用大型语言模型在零样本和少样本设置下提升需求可追溯性,在多个基准数据集上取得最优F2分数。

Journal ref Requirements Eng 31, 6 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23362 2026-05-25 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 90%

Instance-Optimal Estimation with Multiple LLM Judges on a Budget

预算限制下多LLM裁判的实例最优估计

Junghyun Lee, Sanghwa Kim, Yassir Jedra, Alexandre Proutière, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所) ICL EEE(国际计算机语言研究所电子工程系) KTH EECS(皇家理工学院电子工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预算限制下异构裁判的评估分配问题,提出基于乐观偏差方差估计的自适应算法EST-IVWE,并证明其达到实例最优的局部极小极大下界。

Comments 53 pages, 4 figures; the first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23175 2026-05-25 cs.CR cs.CL 90%

Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection

用于知识产权保护的具有最小语义失真的鲁棒LLM水印

Kieu Dang, Phung Lai, NhatHai Phan, Yelong Shen, Ruoming Jin

机构 * State University of New York at Albany(纽约州立大学阿尔巴尼分校) New Jersey Institute of Technology(新泽西理工学院) Microsoft(微软) Kent State University(肯特州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SAFESEAL框架,通过密钥条件锦标赛采样和对比检测器,在保持语义保真度的同时实现强可检测性、高实用性和鲁棒性,用于保护专有大语言模型的知识产权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23238 2026-05-25 cs.AI cs.GT cs.LG cs.MA 90%

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

GENSTRAT:迈向大型语言模型中的战略推理科学

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala

机构 * Princeton University(普林斯顿大学) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出GENSTRAT框架,通过程序化生成不完全信息博弈环境,结合能力剖面和锯齿度度量,系统评估大型语言模型的战略推理能力。

Comments 33 pages, 8 figures, 9 tables (4 figures, 2 tables in main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23332 2026-05-25 cs.CL 88%

Cultural Adaptation in Large Language Models for Political Discourse

大型语言模型在政治话语中的文化适应

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨大型语言模型在政治话语分析中的文化适应问题,提出通过翻译、话语和本体层面的形式化框架及评估矩阵,确保跨文化部署的可靠性和民主安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 88%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20087 2026-05-25 cs.CL cs.AI 88%

ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions

ThoughtTrace: 理解真实世界LLM交互中的用户想法

Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学) Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ThoughtTrace,首个大规模数据集,通过配对真实多轮人机对话与用户自述想法(提示原因和对助手回复的反应),揭示用户认知动态,并展示其在行为预测和个性化对齐中的价值。

Comments 53 pages, 23 figures, 4 tables. Project website: https://thoughttrace-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11053 2026-05-25 cs.CR cs.AI cs.LG 88%

Content-Aware Attack Detection in LLM Agent Tool-Call Traffic: An Empirical Study of Features, Architectures, and Evaluation Protocols

LLM Agent工具调用流量中的内容感知攻击检测:特征、架构与评估协议的实证研究

Sultan Zavrak

机构 * Department of Computer Engineering, Duzce University(杜兹大学计算机工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对MCP工具调用流量,提出基于图神经网络的攻击检测框架,通过内容嵌入和任务分离评估协议,实现AUROC超过0.89的检测性能,并揭示随机分割评估导致的高估问题。

Comments v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03070 2026-05-25 eess.SY cs.SE cs.SY 86%

ProOPF: Benchmarking and Improving LLMs for Professional-Grade Power Systems Optimization Modeling

ProOPF: 面向专业级电力系统优化建模的大语言模型基准测试与改进

Chao Shen, Zihan Guo, Xu Wan, Zhenghao Yang, Yifan Zhang, Wengi Huang, Jie Song, Zongyan Zhang, Mingyang Sun

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对电力系统优化建模中自动化翻译自然语言需求为可执行优化模型的问题,本文提出专业级最优潮流数据集ProOPF-D和基准ProOPF-B,用于评估和改进大语言模型在专业级OPF建模中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23712 2026-05-25 cs.CE cs.LG 83%

Operator Learning for Reconstructing Flow Fields from Sparse Measurements: a Language Model Approach

基于稀疏测量重建流场的算子学习:一种语言模型方法

Qian Zhang, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 提出一种利用语言模型架构的无网格算子学习框架,将流场重建转化为序列到序列学习任务,在四个基准数据集上以低于10%的观测数据实现了高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23219 2026-05-25 cs.LG cs.AI 82%

PaP-NF: Probabilistic Long-Term Time Series Forecasting via Prefix-as-Prompt Reprogramming and Normalizing Flows

PaP-NF: 通过前缀作为提示重编程和归一化流进行概率长期时间序列预测

Minju Kim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国Inha大学工业工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PaP-NF框架,利用前缀作为提示机制对齐连续时间序列表示与冻结的大语言模型,并基于归一化流解码器生成概率预测,在长期基准上捕获多模态不确定性并保持点预测精度。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00003 2026-05-25 cs.CL cs.AI cs.IR 82%

Tabular PDF Information Extraction with Local LLMs and Layout-Aware Parsing: A Reliability Evaluation

使用本地大语言模型和布局感知解析的表格PDF信息提取:可靠性评估

Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias, Kurnia Adi Cahyanto, Azhar Al Afghani, Musfi Yuliadi

机构 * Faculty of Engineering, Universitas Swadaya Gunung Jati(工程学院,Swadaya Gunung Jati大学) University of California, Irvine(加州大学伊维奇分校) UNIR, La Rioja(UNIR,拉里奥ja) Universitas Diponegoro(迪波内戈罗大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了三种策略(纯LLM、混合确定性-LLM、基于Camelot的管道)在从学术表格PDF中提取结构化信息时的可靠性,发现混合方法在准确性和效率上表现最佳。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23715 2026-05-25 cs.CL 81%

NLG Evaluation: Past, Present, Future

NLG评估:过去、现在与未来

Ehud Reiter

机构 * Dept of Computing Science University of Aberdeen(计算科学系大学阿伯丁)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文回顾了自然语言生成(NLG)评估从1990年至今的演变,包括LLM-as-Judge等最新方法,并展望了未来影响、质量和安全评估的重要性。

Comments Will appear in Proceeedings of RetroEval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16027 2026-05-25 cs.AI 81%

Deja Vu in Plots: Leveraging Cross-Session Evidence with Retrieval-Augmented LLMs for Live Streaming Risk Assessment

绘图中的既视感:利用检索增强的大语言模型跨会话证据进行直播风险评估

Yiran Qiao, Xiang Ao, Jing Chen, Yang Liu, Qiwei Zhong, Qing He

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CS-VAR框架,通过检索增强的大语言模型指导轻量级模型利用跨会话行为证据,实现高效、可解释的直播风险实时评估。

Comments SIGIR'26 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20088 2026-05-25 cs.CY 80%

Towards an Evaluation Methodology for AI in Second Language Education: Lessons Learned from Developing L2-Bench

面向第二语言教育中人工智能的评估方法论:从开发L2-Bench中汲取的经验教训

James Edgell, Wm. Matthew Kennedy, Isaac Pattis, Ben Knight, Danielle Carvalho, Elizabeth Wonnacott

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种结合教学理论和社会技术评估方法的迭代方法论,用于构建L2-Bench基准,以全面评估AI在第二语言教育中的能力,并通过试点验证展示了其有效性和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV 79%

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23052 2026-05-25 cs.CL cs.AI 79%

DreamerNLplus: Interpretable Modeling of Mental Health Dynamics from Social Media Timelines using Hybrid Rule-Based and RAG Methods

DreamerNLplus: 使用混合规则和RAG方法从社交媒体时间线进行可解释的心理健康动态建模

Maryia Zhyrko, Daisy Monika Lal, Erik van Mulligen, Lifeng Han

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿高级计算机科学研究所(LIACS),莱顿大学) School of Computing and Communications (SCC), Lancaster University(计算与通信学院(SCC),兰卡斯特大学) Department of Medical Informatics, Erasmus University Medical Center Rotterdam(医学信息学系,埃因霍温医学中心鲁特万分校) Biomedical Data Sciences, Leiden University Medical Center(生物医学数据科学,莱顿大学医学中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出DreamerNLplus混合框架,结合规则与RAG方法,解决CLPsych 2026共享任务中的心理状态建模、时间变化检测和序列级总结问题。

Comments Accepted by CLPsych2026. CLPsych 2026 will be held at ACL in San Diego July 4th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏