arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-16 至 2026-06-16 共收录 352 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 56 篇

2606.16723 2026-06-16 cs.AI 新提交 70%

AgentFairBench: Do LLM Agents Discriminate When They Act?

AgentFairBench: LLM智能体在行动时是否存在歧视?

Triveni Morla, Rohith Reddy Bellibaltu, Manpreet Singh, Manmeet Singh Kapoor

机构 * Florida International University(佛罗里达国际大学) Boston University(波士顿大学) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度帕纳吉印度理工学院计算机科学与工程系)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出AgentFairBench基准,通过反事实匹配集和偏差传导框架,评估LLM智能体在招聘、贷款和医疗分诊中的行动公平性,发现统计量级不匹配会夸大歧视,而匹配后Claude Haiku无显著人口统计效应。

Comments Submitted to IEEE Access

Journal ref Under Review (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16558 2026-06-16 cs.AI cs.RO cs.SY eess.SY 新提交 70%

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning

ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * Universität der Bundeswehr München(慕尼黑联邦国防军大学) Hochschule für angewandte Wissenschaften Landshut(兰茨胡特应用科学大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对混合交通中环岛场景的不确定性,提出ROSA-RL框架,结合Transformer预测冲突区域占用概率与强化学习,实现安全高效的环岛入口速度协调。

Comments 8 pages, 2 figures, 2 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15503 2026-06-16 cs.AI cs.CY cs.MA cs.NE 新提交 70%

Synthetic Counteradaptation: A Principle of Human-AI Co-evolution

合成反适应:人机共同进化的一个原理

Ivar Frisch, Jackie Kay, Philip Moreira Tomei

机构 * Spectral Circuits Research Independent Researcher(独立研究者) AI Objectives Institute(AI Objectives研究所)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出合成反适应概念,描述人机通过相互适应策略和行为实现共同进化,并分析围棋、混合动机社交和地缘政治模拟等案例。

Comments 15 pages, 1 figure. Published in Antikythera (MIT Press), February 2025

Journal ref Antikythera Journal, MIT Press, February 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13909 2026-06-16 cs.GT cs.AI 版本更新 70%

TERMS-Bench: Diagnosing LLM Negotiation Agents Beyond Deal Rate

TERMS-Bench: 在交易率之外评估大语言模型谈判代理

Erica Zhang, Fangzhao Zhang, Aneesh Pappu, Batu El, Jose Blanchet, Susan Athey, Jiashuo Liu, James Zou

机构 * Stanford School of Engineering(斯坦福大学工程学院) Stanford Department of Economics(斯坦福大学经济系) Stanford Graduate School of Business(斯坦福商学院)

专题命中 多智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 TERMS-Bench通过博弈论框架评估谈判代理,揭示其在交易率之外的性能差异,如盈余提取、线索使用和合规性。

Comments Project Site: https://terms-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16735 2026-06-16 cs.RO 新提交 67%

Pride and Prejudice: Toward an Information-Theoretic Framework for Mutually Communicative Driver Behavior Modeling

傲慢与偏见:迈向相互通信的驾驶员行为建模的信息论框架

Tingjun Li, Nan Xu, Shuo Feng, Hassan Askari, Bruno Henrique Groenner Barbosa, Konghui Guo

机构 * State Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与仿生国家重点实验室) Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心) Department of Engineering, Brock University(布鲁克大学工程系) Department of Automatics, Federal University of Lavras(拉夫拉斯联邦大学自动化系)

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 针对自动驾驶与人类驾驶车辆间意图误读导致的安全与效率问题,提出基于信息论的隐式相互通信模型,结合贝叶斯说服博弈与信息论奖励,在NGSIM数据集上降低强制换道预测误差达20%。

Comments 16 pages, 10 figures. Accepted for the IEEE Transactions on Intelligent Transportation Systems (T-ITS), June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16116 2026-06-16 eess.SY cs.MA cs.RO cs.SY math.DS 新提交 67%

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints

非对称输入与时变输出约束下的分布式安全一致性

Abhinav Sinha, Shashi Ranjan Kumar

机构 * Guidance, Autonomy, Learning, and Control for Intelligent Systems (GALACxIS) Lab, Department of Aerospace Engineering and Engineering Mechanics, University of Cincinnati(智能系统引导、自主、学习与控制实验室,航空航天工程与工程力学系,辛辛那提大学) Intelligent Systems and Control (ISaC) Lab, Department of Aerospace Engineering, Indian Institute of Technology Bombay(智能系统与控制实验室,航空航天工程系,印度班加罗尔理工学院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 针对单积分多智能体系统,提出一种结合障碍坐标变换的分布式控制律,同时满足非对称执行器约束和时变输出安全约束,实现渐近同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15073 2026-06-16 cs.NI 新提交 67%

Towards Ubiquitous 6G Computing and Networking Convergence: Architecture and Mechanism for Cross-Domain Resource Coordination

迈向普适6G计算与网络融合:跨域资源协调的架构与机制

Yang Li, Xing Zhang, Yan Zhang, Wenbo Wang

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 针对6G异构计算网络需求,提出基于分层多智能体强化学习的跨域协调架构与编排机制,显著降低能耗并提升任务满意度。

Comments This paper is accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06555 2026-06-16 cs.CL cs.AI cs.LG cs.MA 版本更新 67%

It's About Time: Temporal References in Emergent Communication

关于时间:涌现通信中的时间指代

Olaf Lipinski, Adam J. Sobey, Federico Cerutti, Timothy J. Norman

机构 * University of Southampton(索姆塞特大学) The Alan Turing Institute(艾伦·图灵研究所) University of Brescia(布雷西亚大学)

专题命中 多智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究涌现通信中时间指代缺失问题,发现仅改变损失函数不足,需修改架构(分批方法)才能使时间指代涌现,95%以上代理成功,为提升通信效率奠定基础。

Comments 23 pages main body and 31 pages supplementary material, 9 figures in main body. Code available at https://github.com/olipinski/TRG

Journal ref Journal of Artificial Intelligence Research 86, Article 11 (June 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09831 2026-06-16 cs.AI cs.LG cs.MA cs.SI 版本更新 62%

Interpretation as Linear Transformation: A Cognitive-Geometric Model of Concepts and Meaning

解释作为线性变换:概念与意义的认知几何模型

Chainarong Amornbunchornvej

机构 * National Electronics and Computer Technology Center(国家电子与计算机技术中心)

专题命中 多智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个几何框架,通过线性映射和向量空间建模异构智能体间的概念传递、动机与影响,揭示误解与概念消亡的结构条件,并给出领导力的可达性解释。

Comments The revised draft w.r.t. reviewer comments. The code is at https://github.com/DarkEyes/Cognitive-Geometry

Journal ref Minds and Machines, Volume 36, Issue 3, Article number 36, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07277 2026-06-16 cs.CL cs.AI cs.MA 62%

Speaking Your Language: Spatial Relationships in Interpretable Emergent Communication

说出你的语言:可解释的涌现交流中的空间关系

Olaf Lipinski, Adam J. Sobey, Federico Cerutti, Timothy J. Norman

机构 * University of Southampton(索姆塞特大学) The Alan Turing Institute(艾伦·图灵研究所) University of Brescia(布雷西亚大学)

专题命中 多智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了智能体如何通过空间关系交流,展示了其能发展出表达观察部分关系的语言,实现90%以上的准确率,并证明该语言可被人类解读。

Comments Accepted at NeurIPS 2024. 18 pages, 3 figures

Journal ref In Advances in Neural Information Processing Systems (Vol. 37, pp. 140113-140137) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06404 2026-06-16 cs.LG 版本更新 57%

Near-Optimal Regret for Distributed Adversarial Bandits: A Black-Box Approach

分布式对抗性赌博机问题的近最优遗憾:一种黑盒方法

Hao Qiu, Mengxiao Zhang, Nicolò Cesa-Bianchi

机构 * University of Iowa(爱荷华大学)

专题命中 多智能体 :agent(abstract);分类 cs.LG

AI总结 针对分布式对抗性赌博机问题,提出基于延迟反馈黑盒归约的算法,实现遗憾上界显著改进,并给出匹配下界,证明问题难度分解为通信代价和赌博机代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16984 2026-06-16 cs.HC 新提交 50%

From 911 to Hospital: Challenges and Opportunities for AI Integration in Emergency Medical Services

从911到医院:人工智能整合到紧急医疗服务中的挑战与机遇

Emily Hou, Marelyn Gonzalez, Andrew L. Kun, Osnat Mokryn, Orit Shaer

专题命中 多智能体 :workflow(abstract)

AI总结 本研究通过访谈25名美国EMS临床医生,分析现有技术如何支持紧急服务流程,并探讨未来AI支持的机遇与担忧,提出增强分布式认知和情境意识的五项AI设计原则。

Comments Accepted for publication in the Proceedings of CHIWORK 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 39 篇

2606.09039 2026-06-16 cs.AI 新提交 90%

Agent Economics: An Entropy-Controlled Pluralistic Alignment Framework for Preventing Artificial Hivemind in Autonomous Agents

Agent经济学:一种熵控制的多元对齐框架以防止自主智能体中的蜂群思维

Cheonsu Jeong

机构 * AX Center, SAMSUNG SDS(三星SDS AX中心)

专题命中 工作流自动化 :agent(title,title_cn);autonomous agent(title,abstract);分类 cs.AI

AI总结 提出行为协议框架(BPF),通过心智化社会智能、多元对齐和可验证执行内核三个模块,在闭环架构中控制熵以保持策略多样性,提升自主智能体经济的稳定性、效率和可信度。

Comments 15 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15363 2026-06-16 cs.AI 新提交 87%

APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents

APEX: 自适应原则提取——面向生产AI智能体的三层自进化框架

Ya-Chuan Chen, Tien-Jen Lai, Hsiang-Wei Hu

机构 * Grace AI Technology

专题命中 工作流自动化 :AI agent(title,abstract);agent(abstract,abstract_cn);workflow(abstract);分类 cs.AI

AI总结 提出APEX框架,通过三层协同进化(提示修复、原则蒸馏、工作流拓扑选择)提升AI智能体性能,在15节点计算集群上实现健康评分+90%。

Comments 8 pages, 1 figure, 4 tables. Evaluated on a production 15-node compute fleet with 114 real task traces. Code available at https://aispark.airlive.com/joe-hackathon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15116 2026-06-16 cs.HC 新提交 85%

Graph of Trace: Visualizing Execution Traces of Scientific Agent

追踪图:科学智能体执行轨迹的可视化

Tianci Gao, Haoxuan Li, Jianhe Li, Tianxiang Zhao, Runze Shi, Weiran Wang, Zezhao Wu, Lu Mi

专题命中 工作流自动化 :agent(title,abstract);AI agent(abstract);workflow(abstract)

AI总结 提出一种监控与可视化框架,通过记录细粒度执行事件并组织为有向图,实时展示科学智能体的工作流结构,提升可解释性与人机协作效率。

Comments Accepted to ACL 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22560 2026-06-16 cs.DC cs.AI cs.LG 版本更新 81%

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

RollArt: 可分解的多任务智能体强化学习规模化训练

Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Tongyi Lab, Alibaba(阿里云实验室)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出RollArt系统,通过将强化学习流水线分解到异构硬件上,实现多任务智能体RL的高效训练,相比现有系统减少1.31-2.05倍训练时间。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16649 2026-06-16 cs.AI 新提交 79%

The Integrator Advantage: Controlled Agentic AI for Small and Medium-Sized Companies

集成优势:面向中小企业的受控代理型人工智能

Christopner Koch, Joshua A. Wellbrock

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出代理型AI对中小企业的近期价值在于受控部分自主性,而非完全自主或减员,并给出集成框架以提升生产力。

Comments 10 pages, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15291 2026-06-16 cs.AI 新提交 79%

A Formal Framework for Declarative Agentic AI in Business Process Analysis

业务流程分析中声明式智能体AI的形式化框架

Mohammad Azarijafari, Luisa Mich, Michele Missikoff

机构 * University of Trento(特伦托大学) Istituto di Analisi dei Sistemi ed Informatica (IASI) “Antonio Ruberti”, National Research Council (CNR)(国家研究委员会(CNR)安东尼奥·鲁贝蒂系统分析与信息学研究所(IASI))

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 提出基于AGO方法的形式化框架,通过集合论和数学逻辑定义智能体、目标和对象实体及其交互,构建业务流程知识库以支持结构化查询、增量更新和自动生成工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12025 2026-06-16 cs.AI 新提交 79%

Human-Enhanced Loop Modeling (HELM): Agent-Based Finite Element Modeling of Concrete Bridge Barriers

人类增强循环建模(HELM):基于智能体的混凝土桥梁护栏有限元建模

Quankai Wang, Yulin Xie, Tongfei Yang, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI

AI总结 提出HELM框架,通过人机协作将有限元建模分解为可验证的检查点,在MASH TL-4和TL-5条件下将自主建模成功率从20%提升至75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16839 2026-06-16 cs.SE 新提交 70%

Towards LLM Accelerated Rapid Reviews for Software Tool Discovery -- Case for Log Anomaly Detection

面向软件工具发现的LLM加速快速综述——以日志异常检测为例

Jesse Nyyssölä, Hamza Bin Mazhar, Alexander Bakhtin, Matteo Esposito, Nana Reinikainen, Yuqing Wang, Ying Song, Davide Taibi, Mika Mäntylä

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 提出一种结合LLM筛选和编码代理的流水线,用于快速识别和运行软件工具,在日志异常检测案例中实现高效综述。

Comments 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04243 2026-06-16 cs.LG cs.AI 版本更新 62%

Automated ultrasound doppler angle estimation using deep learning

基于深度学习的自动化超声多普勒角度估计

Nilesh Patil, Ajay Anand

机构 * Goergen Institute for Data Science(戈尔根数据科学研究所) University of Rochester Medical Center(罗切斯特大学医学中心) University of Rochester(罗切斯特大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于深度学习的自动化多普勒角度估计方法,使用2100张颈动脉超声图像及预训练模型,平均绝对误差3.9°-9.4°,最佳模型误差低于临床可接受阈值,可避免正常速度误判为狭窄。

Journal ref Annu Int Conf IEEE Eng Med Biol Soc. 2019 Jul;2019:28-31

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16989 2026-06-16 cs.GT cs.AI cs.CY 新提交 57%

Stable Menus of Public Goods: AI-Enabled Progress

公共物品的稳定菜单:AI驱动的进展

Sara Fish

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 以EC 2025论文的开放问题为测试平台,实验评估AI辅助研究流程的有效性,发现提供人类直觉提示和自动多轮交互有助于提升LLM表现,但LLM略逊于一年级博士生。

Comments Accepted to the EC'26 Workshop on AI-Driven Research in EconCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16985 2026-06-16 stat.ML cs.LG eess.SP nlin.CD stat.ME 新提交 57%

Dynestyx: A Probabilistic Programming Library for Dynamical Systems

Dynestyx: 一个面向动态系统的概率编程库

Daniel Waxman, Dmitry Batenkov, John Feser, Andy Zane, Eli Bingham, Youssef Marzouk, Matthew E. Levine

机构 * Basis Research Institute(Basis研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 提出dynestyx库,通过统一接口支持状态空间模型的先验指定、混合效应推断及状态与参数估计,实现贝叶斯动态系统分析。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16489 2026-06-16 cs.LG 新提交 57%

BRICKS-WM: Building Reusability via Interface Composition Kinetics for Structured World Models

BRICKS-WM:通过接口组合动力学构建结构化世界模型的可重用性

Shaowei Zhang, Jiahan Cao, Xunlan Zhou, Shenghua Wan, De-Chuan Zhan

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 提出BRICKS-WM框架,将全局动力学分解为通过潜在接口交互的独立模块(如智能体和背景),实现冻结背景模块跨智能体重用,避免从头训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16201 2026-06-16 cs.SE cs.CE 新提交 57%

Q-READY: Predictive Feasibility Assessment for Hybrid Quantum-Classical Applications

Q-READY:混合量子-经典应用的预测性可行性评估

Tao Yue, Man Zhang

专题命中 工作流自动化 :workflow(abstract);分类 cs.SE

AI总结 提出Q-READY方法,基于模型驱动工程进行混合量子-经典应用的可行性预测评估,通过结构化流程和系统级模型支持仿真与决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16122 2026-06-16 cs.AI 新提交 57%

Thinking with Visual Grounding

视觉锚定思维

Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交 57%

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16075 2026-06-16 cs.LG cs.CV 新提交 57%

AME: A Multi-Type Contributor Attribution Framework in Generative AI Markets

AME:生成式AI市场中的多类型贡献者归属框架

Yang Shi, Songwen Pei, Yang Gao, Bingxue Zhang

机构 * University of Shanghai for Science and Technology(上海理工大学) Fudan University(复旦大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 针对生成式AI中多阶段协作的价值分配问题,提出AME框架,整合异构数据贡献评估、数据权利映射和可信执行,实现与人类判断一致的低成本价值分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16014 2026-06-16 cs.HC cs.AI cs.MA 新提交 57%

Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDP

编排现实:从角色扮演到活生生的、可玩的游戏世界——作为参数化动作POMDP的LLM驱动世界模拟

Yuhang Huang, Chenmiao Li, Chaowei Fang

机构 * The University of Tokyo(东京大学) Individual Researcher(个人研究员)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 提出编排现实框架,将LLM驱动的游戏世界形式化为参数化动作POMDP,通过单例编排代理维护规范JSON状态,实现数值状态、叙事声音和规则逻辑的统一协调。

Comments 9 pages, 2 figures. Work in progress. Yuhang Huang and Chenmiao Li contributed equall

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16003 2026-06-16 cs.AI 新提交 57%

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成

Yifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen Hindriks, Qingzhi Liu, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。

Comments Accepted by findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏