arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2605.15213 2026-05-18 cs.IR cs.AI 92%

An LLM-RAG Approach for Healthy Eating Index-Informed Personalized Food Recommendations

一种基于LLM-RAG的健康饮食指数指导的个性化食品推荐方法

Yibin Wang, Yanjie Yang, Grace Melo Guerrero, Rodolfo M. Nayga, Azlan Zahid

机构 * Department of Biological and Agricultural Engineering, Texas A&M AgriLife Research(生物与农业工程系,德克萨斯A&M农业生命研究)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合标准化营养数据库与大语言模型的LLM-RAG框架,通过健康饮食指数(HEI)指导实现个性化食品推荐,实验结果显示HEI平均提升6.45,用户HEI超过50的比例提升至61.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12601 2026-05-18 cs.LG 92%

Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers

重新思考LLM路由的预测建模:当简单kNN胜过复杂学习路由

Yang Li

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过简单性视角重新审视LLM路由,发现经过调优的kNN方法在多种任务中优于现有学习路由方法,引入标准化基准测试和多模态数据集,揭示嵌入空间局部性属性使非参数方法在样本复杂度更低的情况下实现强路由决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 92%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12869 2026-05-14 cs.CR cs.AI 92%

Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis

利用生存分析量化LLM在反复攻击下的安全退化

Zvi Topol

机构 * MuyVentive, LLC(MuyVentive公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用生存分析评估LLM在持续对抗压力下的安全退化,揭示不同模型在多次攻击下的脆弱性差异,为模型开发者提供评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00238 2026-05-14 cs.CL 92%

Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory

基于项目反应理论的LLM自动简答评分能力与响应难度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(德意志教育研究所 | 列支敦士登教育研究所) Faculty of Computer Science, Goethe University Frankfurt(法兰克福歌德大学计算机学院) Chemnitz University of Technology(化学工业大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于项目反应理论的LLM自动简答评分评估框架,分析评分准确率与响应难度的关系,揭示不同模型在评分表现上的差异及中间标签崩溃问题。

Comments accepted at BEA 2026, the 21st Workshop on Innovative Use of NLP for Building Educational Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12422 2026-05-13 cs.CL cs.CY 92%

Predicting Disagreement with Human Raters in LLM-as-a-Judge Difficulty Assessment without Using Generation-Time Probability Signals

预测在LLM-as-a-Judge难度评估中与人类评分者的分歧

Yo Ehara

机构 * Yo Ehara

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种无需生成时间概率信号的方法,通过构建嵌入空间预测LLM生成的难度评分与人类评分者的分歧,实验表明其在预测分歧上的AUC优于基于概率的基线方法。

Comments Accepted to Educational Data Mining (EDM) 2026 (Poster/Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12147 2026-05-13 cs.CR cs.LG 92%

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

PrivacySIM: 评估LLM对用户隐私行为的模拟

James Flemings, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PrivacySIM评估框架,通过对比1000名用户的真实响应,评估LLM在模拟用户隐私行为方面的表现,发现隐私人格特征对模拟质量有提升作用,但最佳模型仅达到40.4%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 92%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 92%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09350 2026-05-12 cs.AI 92%

CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing

CHAINTRIX:一个多管道LLM增强框架用于自动化智能合约安全审计

Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CHAINTRIX通过结合LLM与确定性结构表示,提升智能合约审计效率,检测86/120高危漏洞,召回率71.7%,优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09227 2026-05-12 cs.CL 92%

Two Ways to De-Bias an LLM-as-a-Judge: A Continuous-Score Comparison of Hierarchical Bayesian Calibration and Neural-ODE Score Transport

用LLM作为裁判的两种去偏方法:对分层贝叶斯校准和神经ODE分数传输的连续分数比较

Andrea Morandi

机构 * Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了两种校正方法以减少LLM作为裁判的偏见,发现数据预算决定了方法选择,两种方法在不同锚点数量下表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06635 2026-05-08 cs.CL 92%

Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

被引用但未验证:解析和评估LLM深度研究代理中的源归属

Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S(普华永道商业技术与创新办公室,美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个源归属评估框架,通过AST解析器大规模评估LLM生成的Markdown报告中的引用,从链接有效性、内容相关性和事实准确性三个维度验证引用可靠性,揭示了表面引用质量与事实可靠性之间的关键断层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06527 2026-05-08 cs.CL 92%

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

STALE:LLM代理能否知道其记忆已不再有效?

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun

机构 * Wuhan University(武汉大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 STALE基准测试评估LLM代理在新证据出现时修订存储信念的能力,揭示了现有模型在处理隐含冲突和更新状态时的不足,提出三种探查框架并提出CUPMem原型以改进状态感知记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06445 2026-05-08 cs.SE cs.AI 92%

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

约束衰减:后端代码生成中LLM代理的脆弱性

Francesco Dente, Dario Satriani, Paolo Papotti

机构 * EURECOM University of Basilicata(巴利卡塔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理在多文件后端生成中处理结构约束的能力,发现随着约束累积,性能显著下降,且框架敏感性导致不同环境下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06279 2026-05-08 cs.SE cs.AI 92%

Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

正确的代码,易受攻击的依赖项:一项大规模的LLM指定库版本测量研究

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao

机构 * Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences, Beijing, China(智能软件研究中心,软件研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Key Laboratory of System Software (Chinese Academy of Sciences), Beijing, China(中国科学院系统软件重点实验室,北京,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM生成代码中库版本的安全性和兼容性风险,发现版本选择存在系统性偏差,且版本选择影响漏洞暴露和兼容性故障。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06054 2026-05-08 cs.AI cs.HC 92%

Visual Fingerprints for LLM Generation Comparison

用于LLM生成比较的视觉指纹

Amal Alnouri, Andreas Hinterreiter, Christina Humer, Furui Cheng, Marc Streit

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) ETH Zürich(苏黎世联邦理工学院) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过可视化方法比较不同生成条件下的LLM输出,揭示模型行为的一致性模式,提升提示设计和模型评估效率。

Comments Submitted to the Short Paper track at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18823 2026-05-08 cs.CL 92%

EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation

EvalSense:一种用于领域特定LLM(元)评估的框架

Adam Dejl, Jonathan Pearson

机构 * Imperial College London(伦敦帝国学院) NHS England Transformation Directorate(英格兰国家健康服务转型 Directorate)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvalSense框架,用于构建领域特定的LLM评估套件,通过交互式指南和元评估工具提高评估方法的可靠性与灵活性。

Comments Accepted to EACL 2026 System Demonstrations

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 3: System Demonstrations), 480-491. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 92%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00706 2026-05-04 cs.CL 92%

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

FinSafetyBench:评估LLM在现实金融场景中的安全性

Yutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang, Liwen Zhang, Hailiang Huang, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究重点实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FinSafetyBench,一个双语红队基准,用于测试LLM对违反金融合规请求的拒绝能力,揭示了对抗性提示绕过合规保障的关键漏洞及中文环境下更严重的易受攻击性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00468 2026-05-04 cs.CL 92%

ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?

ReLay:为更好的理解而定制的LLM生成的通俗摘要,但代价是什么?

Joey Chan, Yikun Han, Jingyuan Chen, Samuel Fang, Lauren D. Gryboski, Alexandra Lee, Sheel Tanna, Qingqing Zhu, Zhiyong Lu, Lucy Lu Wang, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Virginia(弗吉尼亚大学) University of Colorado Anschutz(科罗拉多大学安舒茨分校) Johns Hopkins University(约翰霍普金斯大学) University of Chicago Pritzker School of Medicine(芝加哥大学普ritzker法学院) National Library of Medicine, National Institutes of Health(国家医学图书馆,国家卫生研究院) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReLay研究通过评估五种LLM在两种个性化方法中的表现,探讨了个性化通俗摘要对理解提升与安全性的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00382 2026-05-04 cs.SE cs.AI cs.SI 92%

Social Bias in LLM-Generated Code: Benchmark and Mitigation

LLM生成代码中的社会偏见:基准测试与缓解

Fazle Rabbi, Lin Ling, Song Wang, Jinqiu Yang

机构 * Concordia University(康科德大学) Lassonde School of Engineering, York University(York大学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究LLM生成代码中的社会偏见问题,通过SocialBias-Bench基准测试发现四种主流模型存在严重偏见,提出Fairness Monitor Agent (FMA)有效降低偏见并提升代码正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21564 2026-05-01 cs.CL 92%

Measuring Opinion Bias and Sycophancy via LLM-based Persuasion

通过基于LLM的说服测量意见偏见和阿谀奉承

Rodrigo Nogueira, Giovana Kerche Bonás, Thales Sales Almeida, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出llm-bias-bench方法,通过模拟多轮交互发现LLM在争议性话题上的真实立场,揭示辩论比直接提问更易引发阿谀奉承,且模型在持续争论中更倾向于模仿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11224 2026-04-29 cs.SE cs.CL 92%

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

Agent-Diff:通过代码执行基于状态差的评估来基准测试LLM代理在企业API任务上的表现

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

机构 * Minerva University(Minerva大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Agent-Diff框架,通过代码执行和基于状态差的评估,评估LLM代理在企业API任务中的性能,提供了九个LLM在224个任务上的基准测试,并通过消融实验评估框架的鲁棒性。

Comments Pre-Print. Under review for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24477 2026-04-29 cs.CR cs.AI cs.MA 92%

GAMMAF: A Common Framework for Graph-Based Anomaly Monitoring Benchmarking in LLM Multi-Agent Systems

GAMMAF:用于LLM多智能体系统基于图的异常监控基准测试的通用框架

Pablo Mateo-Torrejón, Alfonso Sánchez-Macián

机构 * University Carlos III of Madrid(卡洛斯三世大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GAMMAF框架,用于评估LLM多智能体系统中的异常检测方法,通过生成合成数据集和动态隔离攻击节点,验证了其在拓扑扩展性和执行效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27106 2026-04-29 cs.CL 92%

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

评分轮盘:LLM作为裁判框架中的自不一致

Rajarshi Haldar, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示LLM作为裁判框架在不同运行中评分不一致的问题,探讨通过规范指南提升其评估效果的可行性。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23090 2026-04-28 cs.AI 92%

Towards Automated Ontology Generation from Unstructured Text: A Multi-Agent LLM Approach

从非结构化文本自动生成本体:一种多智能体LLM方法

Abid Talukder, Maruf Ahmed Mridul, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多智能体LLM方法,通过领域特定保险合同实验,验证了在本体生成中规划优先、任务驱动的架构能提升结构质量和查询性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22597 2026-04-27 cs.AI 92%

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

重新思考数学推理评估:一种超越符号刚性的LLM-as-a-Judge框架

Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky

机构 * Tel-Aviv University(特拉维夫大学) Amazon Prime Video(亚马逊Prime视频) Ben-Gurion University(巴内尔·戈里翁大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种稳健灵活的LLM-as-a-Judge框架,用于评估模型生成答案的准确性,超越传统符号数学比较的局限,提升数学推理评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20131 2026-04-23 cs.CL 92%

Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives

谁的故事被讲述?LLM在生命叙事中的位置性与偏见

Melanie Subbiah, Haaris Mian, Nicholas Deas, Ananya Mayukha, Dan P. McAdams, Kathleen McKeown

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Department of Psychology, Northwestern University(西北大学心理学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究LLM在生命叙事抽象分析中的伦理与有效性,提出基于总结的管道以揭示LLM在解读叙事时的偏见,识别种族和性别偏见并呼吁未来研究中使用该分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15037 2026-04-23 cs.SE cs.AI 92%

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

CircuChain: 解构LLM电路分析中的能力与合规性

Mayank Ravishankara

机构 * Independent Researcher(独立研究员) San Francisco, CA, USA(美国加州旧金山)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CircuChain通过设计控制/陷阱问题对,评估LLM在电路分析中遵循指令与物理推理能力的差异,揭示模型能力与约束对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15319 2026-04-23 cs.HC cs.AI 92%

Explainable Iterative Data Visualisation Refinement via an LLM Agent

通过LLM代理的可解释迭代数据可视化细化

Burak Susam, Tingting Mu

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM代理的自动化方法,通过结合定量评估与人类洞察,实现高维数据可视化优化,生成高质量可视化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏