arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 174 篇

2608.01624 2026-08-04 cs.CL cs.LG 新提交 81%

Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models

并非维度,而是范数:无梯度语言模型权重扰动的关键因素

Taeyeong Kim, Ahhyun Kim, TaeHyeon Kim, Unggi Lee

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究探究无梯度语言模型权重扰动的关键因素,发现全权重搜索非必需,扰动范数是核心有效因素,其安全区域可跨模型与尺度迁移,优化方向聚焦于扰动强度的确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00011 2026-08-04 cs.CL cs.AI 新提交 81%

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 DLLM-TTS 框架,将 TTS 建模为基于 X-Codec2 的条件块离散扩散,通过块内掩码扩散与并行预测实现高效语音生成,在 Seed-TTS-eval 基准上取得良好性能,兼具实用性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16451 2026-08-04 cs.CL cs.CV cs.LG physics.ao-ph 81%

SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future

SynopticBench:在生成未来天气预报讨论上评估视觉-语言模型

Timothy B. Higgins, Antonios Mamalakis, Chirag Agarwal

机构 * Department of Environmental Sciences(环境科学系) School of Data Science(数据科学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SynopticBench数据集和SPACE评估框架,用于评估视觉-语言模型在生成天气现象描述中的性能,揭示现有评估指标的局限性。

Comments Accepted for presentation at Climate Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01494 2026-08-04 q-fin.PM q-fin.RM 新提交 80%

Conformal Kelly: Conformal Prediction Intervals as the Scale in Fractional Kelly Position Sizing

共形凯利:将共形预测区间用作分数凯利头寸规模的尺度

Robert Jacob Ryan

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出将共形预测区间与分数凯利结合用于投资组合头寸规模确定,经6年测试表现优于被动基准,还引入风险控制优化回撤,相关配置经预注册和LLM智能体搜索验证。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00567 2026-08-04 econ.GN q-fin.EC 新提交 80%

Optimal Inflation Rate: A Meta-Analysis

最优通胀率:一项元分析

Matej Opatrny, Martin Opatrny, Tomas Havranek, Zuzana Irsova, Mojmir Hampl

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究通过LLM辅助的可重复元分析,利用777项估计值发现最优长期通胀率约为0.6个百分点,远低于多数央行的2%目标,且明确了研究间差异的核心驱动因素。

Comments 62 pages, 4 figures. Also available as CEPR Discussion Paper 21629. Data, code, and extraction prompts: https://meta-analysis.cz/inflation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03188 2026-08-04 cs.CR 版本更新 80%

Dependency-Aware Privacy for Multi-turn Agents

多轮智能体的依赖感知隐私保护

Divyam Anshumaan, Sarthak Choudhary, Nils Palumbo, Somesh Jha

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对多轮 LLM 智能体交互的隐私泄露问题,提出 RootGuard 方法,通过一次清理根值并确定性计算后续发布,在多轮交互中提升隐私-效用权衡,医疗数据实验显示其误差远低于独立噪声方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01544 2026-08-04 econ.EM cs.CV 新提交 80%

Measuring Product Quality Using Images: The CLIP Q-Score and an Application to Real Estate

利用图像衡量产品质量:CLIP Q分数及其在房地产中的应用

Fabian Slonimczyk, Danila Karapsin

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出CLIP Q分数这一基于对比语言-图像预训练的开源图像产品质量衡量方法,其可预测房地产市场价格与流动性,且与LLM评估结果一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00608 2026-08-04 cs.LG 新提交 79%

From field-scale to large-scale spectral libraries: Tabular foundation models in soil spectroscopy

从田间尺度到大规模光谱库:土壤光谱学中的表格基础模型

Viacheslav Barkov, Jonas Schmidinger, Robin Gebbers, Martin Atzmueller

机构 * Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究针对土壤光谱预测难题,对比多种模型与降维方法,发现结合偏最小二乘潜在变量的表格基础模型TabPFN在田间及大规模光谱库任务中表现最优,为光谱校准模型选择提供了循证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14896 2026-08-04 cs.SE cs.AI cs.MA 版本更新 79%

StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试

Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00848 2026-08-04 cs.CL 版本更新 79%

MetaHOPE: A Metaphor-Oriented Evaluation Framework for Analysing MT and LLM Translation Errors

MetaHOPE:面向隐喻的评估框架用于分析机器翻译和大语言模型翻译错误

Jiahui Liang, Lifeng Han

机构 * Centre for Linguistics, Humanities, Leiden University(莱顿大学人文学院语言学中心) LIACS, Leiden University(莱顿大学LIACS) BDS, Leiden University Medical Centre(莱顿大学医学中心BDS)

专题命中 评测与基准 :LLM(title,abstract_cn);分类 cs.CL

AI总结 提出MetaHOPE框架,基于错误严重性标注隐喻翻译错误,通过人工标注语料评估GoogleMT、GPT5.4和Hunyuan-7b在英汉互译中的表现,并构建双语平行资源。

Comments To appear in the Proceedings of the 9th International Conference on Natural Language and Speech Processing (ICNLSP 2026), Trento, Italy, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新 79%

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02300 2026-08-04 cs.CV 新提交 78%

A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

通用视觉语言模型(VLM)可指导天文基础模型更好地识别星系形态

Dichang Zhang, Jiaqi Deng, Yixuan Shao, Yuanpeng Liu, Jiali Cui, Zhiqiang Lao, Heather Yu, Liang Peng, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Technology Sydney(悉尼科技大学) Futurewei Technologies(华为主机技术公司)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究提出用通用视觉语言模型(VLM)作为弱监督教师,指导天文基础模型Zoobot提升星系形态识别性能,可高效适配未来大型天文巡天任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01661 2026-08-04 cs.CV 新提交 78%

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析

Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen

机构 * Shenzhen University(深圳大学) Shandong Artificial Intelligence Institute(山东省人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) Tianjin University of Technology(天津理工大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00925 2026-08-04 cs.CV 新提交 78%

Look Up and Look Back: Hidden Attention and Latent Orientation in a Frozen Foundation Model for Panoramic SLAM

观察与回溯:用于全景SLAM的冻结基础模型中的隐式注意力与潜在方向

Zhuang Xiong, Guohao Zhang, Chen Zhang, Zheyu Jiang, Yuchao Mei, Qingshan Xu, Wenbing Tao

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对全景SLAM的相机倾斜、尺度漂移等问题,基于冻结全景几何基础模型的隐式线索提出HALO-SLAM,在五个基准的125个序列上实现100%序列成功率,ATE显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00884 2026-08-04 cs.SE 新提交 78%

Documentation vs. Code Patterns: What Drives LLM-Based Exception Oracle Generation?

文档与代码模式:什么驱动基于大语言模型的异常预言生成?

Soneya Binta Hossain, Matthew B. Dwyer, Tasfia Tasnim

专题命中 评测与基准 :LLM(title,abstract)

AI总结 该研究通过干预式与归因引导的替换消融实验,发现基于大语言模型的异常预言生成(TOG)的高准确率多源于捷径信号而非结构化异常文档,挑战了准确率反映语义稳健性的假设,提出需从证据依据角度评估TOG系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00787 2026-08-04 cs.SE 版本更新 78%

The Rise of Language Models in Mining Software Repositories: A Survey

语言模型在软件仓库挖掘中的兴起:综述

Miguel Romero-Arjona, Saman Barakat, Ana B. Sánchez, Sergio Segura

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文综述了语言模型在软件仓库挖掘中的应用,分析了85篇论文,探讨了模型的应用方式、分析的 artifacts 类型、模型演变及可重复性,提出分类并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 77%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02157 2026-08-04 cs.LG cs.AI 新提交 76%

RamanPFN: learning from Raman spectral structure with a tabular foundation model

RamanPFN:基于表格基础模型学习拉曼光谱结构

Xingyu Pan, Huan Wang, Jinjia Guo, Zhenlin Zhao, Siming Dong, Jixi Lu

机构 * Beihang University(北京航空航天大学) Cleer Science(Cleer科技公司)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 RamanPFN在TabPFN推理前编码拉曼光谱依赖关系,经74个公开拉曼数据集的150项任务评估,可降低回归与分类误差,是高维拉曼测量与可复用表格推理的有效接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00785 2026-08-04 cs.MA 新提交 75%

HIERA: Hierarchical Multi-Agent Relevance Assessment for Content Discovery Systems

HIERA:面向内容发现系统的分层多智能体相关性评估框架

Pritom Saha Akash, Phanideep Gampa, Chao Shen, Ying Chen, Sheikh Muhammad Sarwar

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对内容发现系统人工标注的问题,提出分层多智能体相关性评估框架HIERA,通过四个专用智能体的分层协调,在五个数据集上较11个基线方法取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交 75%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14657 2026-08-04 cs.CL cs.AI cs.LG 版本更新 75%

OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset

OpenDebateEvidence:一个大规模论证挖掘与摘要数据集

Allen Roush, Yusuf Shabazz, Arvind Balaji, Peter Zhang, Stefano Mezza, Markus Zhang, Sanjay Basu, Sriram Vishwanath, Mehdi Fatemi, Ravid Shwartz-Ziv

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出源自美国竞技辩论界的大规模OpenDebateEvidence数据集,经实验验证微调大语言模型可实现论证性抽象摘要,旨在推进计算论证并公开数据集供研究使用。

Comments Published to the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01724 2026-08-04 cs.CL cs.AI cs.HC 新提交 73%

TIDES: A Longitudinal Bilingual Dataset for Modeling Multi-Party Social Dynamics

TIDES:用于建模多方社会动态的纵向双语数据集

Heechan Lee, Jeonggyu Kang, Junho Myung, Jaywoong Jeong, Juho Kim, Joseph Seering

机构 * KAIST(韩国科学技术院) SkillBench

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有群体对话数据集无法捕捉团队长期社会动态的问题,推出TIDES纵向双语数据集,基于其微调模型提升下一个说话人预测性能,同时发现预测效果与话语自然度存在潜在不匹配。

Comments The first two authors hold equal contribution. Accepted to COLM 2026. Project website: https://tides.cstlab.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01042 2026-08-04 cs.SE cs.AI cs.HC cs.LG 新提交 73%

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体

Tezan Sahu, Himani Arora

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。

Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01004 2026-08-04 cs.LG cs.AI cs.SE 新提交 73%

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线

Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das

机构 * Microsoft(微软) Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。

Comments Extended abstract accepted at the SERI 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交 73%

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28488 2026-08-04 cs.CL cs.AI cs.MA 版本更新 73%

Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification

courtroom 风格多智能体辩论与渐进式 RAG 和角色切换用于争议性主张验证

Masnun Nuha Chowdhury, Nusrat Jahan Beg, Umme Hunny Khan, Syed Rifat Raiyan, Md Kamrul Hasan, Hasan Mahmud

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 PROClaim 框架,通过结构化对抗辩论和角色切换提升争议性主张验证的可靠性,实验显示其在 Check-COVID 数据集上准确率达 81.7%。

Comments Under review, 29 pages, 7 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07086 2026-08-04 cs.SE cs.AI cs.CL 版本更新 73%

RAG Strategies for Natural Language-Based SQL Query and REST API Call Generation

评估用于基于自然语言的SQL和API调用生成的检索增强生成变体

Tim Schlippe, Simon Martin, Michael Marketsmüller

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了三种RAG变体在生成SQL和API调用任务中的性能,发现CoRAG在混合文档环境下表现最佳,检索策略设计对自然语言接口至关重要。

Comments preprint of conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02415 2026-08-04 cs.CL 新提交 72%

Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes

大语言模型中无训练与基于训练的意图分类:准确性、鲁棒性与失败模式

Nan Chen, Zhouhao Yang, Soufiane Hayou

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);分类 cs.CL

AI总结 本研究系统对比LLMs中无训练与基于训练的意图分类方法,发现两类方法在简单基准上性能饱和,基于训练的方法在难分类任务占优,无训练方法对混合与对抗性提示更鲁棒。

Comments Accepted at the Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00393 2026-08-04 cs.HC 新提交 71%

MolecularCanvas: LLM-assisted Small-Molecule Drug Discovery via Structure-Guided Constraints

MolecularCanvas:基于结构引导约束的大语言模型辅助小分子药物发现

Haoyu Dong, Rui Sheng, Shuhao Zhang, Yushi Sun, Dingyang Wu, Hanxiang Chao, Olexandr Isayev, Huamin Qu, Yuyang Wu, Yanna Lin

专题命中 评测与基准 :LLM(title)

AI总结 该研究针对现有GenAI分子设计工具与专家工作流程适配差的问题,推出交互式系统MolecularCanvas,整合多类约束与工具,经用户验证可有效辅助小分子药物的迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02569 2026-08-04 cs.AI cs.DC cs.OS 新提交 70%

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架

Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan Stojkovic

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏