arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2368 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 275 篇

2606.23671 2026-08-19 cs.CL 版本更新 57%

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

LLM 能否可靠地自我报告对抗性预填充,以及如何实现?

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

机构 * KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21693 2026-08-19 cs.LG 版本更新 57%

TiMi: Empower Time Series Transformers with Multimodal Mixture of Experts

TiMi: 通过多模态专家混合增强时间序列变换器

Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 TiMi通过多模态专家混合机制,利用大语言模型生成未来推断以提升时间序列预测的因果推理能力,实现多模态数据的有效整合与高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03570 2026-08-19 cs.CL 版本更新 57%

How Do Large Language Models Learn Concepts During Continual Pre-Training?

大型语言模型在持续预训练中如何学习概念?

Barry Menglong Yao, Sha Li, Yunzhi Yao, Minqian Liu, Zaishuo Xia, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) UCLA(加州大学洛杉矶分校) Meta AI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究揭示了大型语言模型在持续预训练中概念学习的动态机制,通过分析概念电路揭示了概念获取、遗忘及相互作用的规律,为设计更可解释的训练策略提供依据。

Comments 19 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01375 2026-08-18 cs.CY cs.AI 版本更新 57%

Beyond Access: Guided LLM Scaffolding for Independent Learning in Undergraduate Statistics

超越访问:引导式LLM支架在本科统计学自主学习中的应用

Mohammad Amanlou, Yasaman Amou-Jafari, Fereshte Bagheri, Fatemeh Boloukazari, Mehrad Liviyan, Elahe Khodaverdi Nadrabadi, Shahab Sherafat, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, University of Tehran, Iran(伊朗塔里哈大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University, Iran(伊朗卡塔姆大学泰赫兰高级研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过准实验比较无LLM、无限制LLM和引导式LLM三种条件,发现引导式LLM使用能促进以推理为导向的交互模式,提升无辅助测验表现,并改善自我评估校准,表明LLM作为教育工具需通过支架设计实现推理伙伴而非答案获取工具。

Comments 10 pages. Accepted at the 34th International Conference on Computers in Education (ICCE 2026), Asia-Pacific Society for Computers in Education (APSCE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09562 2026-08-18 cs.CV cs.AI 版本更新 57%

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

分割一切模型中的提示工程:方法、应用与新兴挑战

Yidong Jiang, Jiangtong Li, Daiwei Cheng

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13049 2026-08-18 cs.CY cs.AI 版本更新 57%

Assessing AI-Generated vs. Human-Authored Spear Phishing SMS Attacks: An Empirical Study

评估AI生成与人类撰写的鱼叉式网络钓鱼短信攻击:一项实证研究

Jerson Francia, Derek Hansen, Benjamin Schooley, Matthew Taylor, Shydra Valynn Murray, Rebekah Cornelius, Greg Snow

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究对比GPT-4与新手学生撰写的个性化钓鱼短信,发现AI生成消息引发点击意图比例略高,工作相关消息更易诱导点击,参与者无法准确判断消息来源,还验证了TRAPD的价值与局限。

Comments 33 pages, 8 figures, and 5 tables. Revised to match the peer-reviewed version published in the Journal of Cybersecurity and Privacy

Journal ref J. Cybersecur. Priv. 2026, 6(4), 129

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12921 2026-08-17 cs.MA cs.AI 版本更新 57%

Discovering Efficient and Explainable Communication Topologies for LLM-based Multi-Agent Systems via Causal Inference

通过因果推理发现基于大语言模型的多智能体系统的高效且可解释的通信拓扑

Junzhi Li, Peng He, Qirui Ji, Wei Wang, Lixiang Liu, Chuxiong Sun

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对基于LLM的多智能体系统通信拓扑可解释性不足的问题,提出模型无关框架E2-Explainer,通过因果推理识别关键通信子图,在保持任务性能的同时降低了通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28026 2026-08-17 cs.AI 版本更新 57%

BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

当选择成为先验:用于科学图表多选问答的对比解码

Taeyun Roh, Suhyeong Park, Dongyoung Lee, Eunyeong Jo, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(高丽大学) Konkuk University(建国大学) Myongji University(明知大学) AIGEN Sciences

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 57%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08567 2026-08-14 cs.LG 版本更新 57%

Neural Message Passing on Structural Interaction Graphs for Fully-Inductive Graph Neural Networks

面向全归纳图神经网络的结构交互图上的神经消息传递

Omer Yom-Tov, Avigdor Gal

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出SIGIL框架,通过结构交互图和关系消息传递网络实现图特征的统一表示,可用于全归纳链接预测,还能统一多种图基础模型设计范式。

Comments 7 pages, 1 figure in the main body. 12 pages, 5 figures in appendix. Submitted to AAAI 2027 (main track) and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07316 2026-08-14 cs.MA cs.AI cs.DC 版本更新 57%

Certifiable Semantic Agreement Among LLM Agents: What the Admissibility Instrument Decides

面向拜占庭鲁棒的大语言模型智能体协作的分层认证语义承诺

Haoran Xu, Lei Zhang, Iadh Ounis, Xianbin Wang

机构 * University of Glasgow(格拉斯哥大学) University of Western Ontario(西部 Ontario 大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出H-CSC协议,将基于嵌入的终结性信号转换为三种类型输出(语义承诺、判决承诺或显式中止),实现大语言模型智能体拜占庭协作的最终性控制,在语义投毒和拜占庭攻击下保持低角度偏差和高中止率。

Comments 43 pages, 5 figures, 20 tables, 1 algorithm. Substantial revision: new title, new framing, new downstream-audit experiment; supersedes v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21106 2026-08-12 cs.AI 版本更新 57%

AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction

AttriMem:用于智能体记忆学习的归因引导过程反馈

Qinfeng Li, Yuntai Bao, Xinyan Yu, Hongze Chen, Yanming Liu, Huifeng Zhu, Yier Jin, Jintao Chen, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体有效构建记忆难的问题,提出AttriMem框架,通过用token级对最终答案贡献的局部奖励增强全局结果奖励,以学习记忆构建策略,实验表明该框架性能优于多种基线,具有泛化性且稳定了RL优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03793 2026-08-12 cs.CL cs.CV 版本更新 57%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28803 2026-08-12 cs.CV cs.LG 版本更新 57%

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16382 2026-08-12 cs.CL 版本更新 57%

LiFT: How to Enable In-Context Learning for Longitudinal Modelling

LiFT:指令微调是否通过增强上下文学习提高大型语言模型的纵向建模能力?

Iqra Ali, Talia Tseriotou, Mahmud Elahi Akhter, Yuxiang Zhou, Maria Liakata

机构 * Queen Mary University of London(伦敦玛丽女王大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LiFT框架通过统一的指令方案整合多种纵向建模任务,利用渐进增加的时间难度课程和少样本结构进行训练,提升模型对历史上下文的有效利用,实验显示其在不同参数规模模型上均优于基础模型的上下文学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15770 2026-08-12 cs.CV cs.LG 版本更新 57%

Concept Labels Are Not Enough: Rethinking Concept Bottleneck Models through Representation Integrity

通过解耦概念瓶颈缓解多媒体识别中的虚假背景偏差

Gaoxiang Huang, Songning Lai, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出轻量解耦概念瓶颈模型LDCBM,通过滤波分组损失和联合概念监督提升视觉模式与概念的对齐,实验证明其在概念和分类准确率上优于现有CBMs,且计算复杂度更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30716 2026-08-11 cs.CV cs.AI 版本更新 57%

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

用于病例级病理学概要报告生成的简单令牌高效视觉语言模型

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, Canada(计算机科学与软件工程系(CSSE),康科迪亚大学,蒙特利尔,加拿大) Axe Cancer, Centre de recherche du CHUM, Université de Montréal, Montreal, Canada(Axe癌症,CHUM研究中心,蒙特利尔大学,蒙特利尔,加拿大) Institut de recherche en immunologie et cancérologie (IRIC), Université de Montréal(免疫学与癌症研究所(IRIC),蒙特利尔大学) Mila - Quebec AI Institute, Montreal, Canada(魁北克AI研究所(Mila),蒙特利尔,加拿大)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种简单令牌高效的视觉语言模型,通过5倍放大率的512×512补丁和两阶段监督训练,在有限GPU内存下实现病例级多WSI病理报告生成,显著降低序列长度并提升效率。

Comments DeLTA 2026 Conference Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02704 2026-08-11 cs.CL 版本更新 57%

InfMem: Learning System-2 Memory Control for Long-Context Agent

InfMem: 面向长上下文智能体的系统2记忆控制

Xinyu Wang, Mingze Li, Peng Lu, Xiao-Wen Chang, Lifeng Shang, Jinping Li, Fei Mi, Prasanna Parthasarathi, Yufei Cui

机构 * McGill University(麦吉尔大学) Noah's Ark Lab(诺亚实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 InfMem通过预思考-检索-写作协议实现系统2风格的控制,有效提升超长文档推理的准确率并减少推理时间。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19766 2026-08-11 cs.CL 版本更新 57%

PAM: Training Policy-Aligned Moderation Filters at Scale

PAM:在大规模上训练策略对齐的 moderation 过滤器

Masoomali Fatehkia, Enes Altinisik, Mohamed Osman, Husrev Taha Sencar

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11534 2026-08-11 cs.CV cs.CL cs.MM 版本更新 57%

HFS: Holistic Query-Aware Frame Selection for Efficient Video Understanding

HFS: 为高效视频推理的全局查询感知帧选择

Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。

Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10119 2026-08-11 cs.AI 版本更新 57%

Intelligence Foundation Model: A New Perspective to Approach Artificial General Intelligence

智能基础模型:一种新视角来实现通用人工智能

Borui Cai, Yao Zhao

机构 * Hangzhou International Innovation Institute, Beihang University, China(北京航空航天大学杭州国际创新研究院) Victoria University, Melbourne, Australia(墨尔本维多利亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出智能基础模型,通过模拟生物神经系统的动态过程和神经元输出预测,为实现通用人工智能提供新的视角和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 57%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27540 2026-08-10 cs.AI 版本更新 57%

In-Context Examples Suppress Scientific Knowledge Recall in LLMs

上下文示例抑制大语言模型中的科学知识回忆

Chaemin Jang, Woojin Park, Hyeok Yun, Dongman Lee, Jihee Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现上下文示例会削弱大语言模型对科学知识的回忆能力,使模型更依赖经验模式匹配而非预训练知识。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10921 2026-08-07 cs.CL 版本更新 57%

Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering

仅追踪所需:面向长文档问答的结构感知按需超图记忆

Xiangjun Zai, Xingyu Tan, Chen Chen, Xiaoyang Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) CSIRO(澳大利亚联邦科学与工业研究组织) University of Wollongong(伍伦贡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出DocTrace,一种多智能体RAG框架,通过查询触发的知识组织、文档结构感知和经验引导推理,解决长文档问答中知识组织成本高、结构利用不足和推理经验无法复用的问题,在三个数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02347 2026-08-06 cs.AI 版本更新 57%

Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

带分层记忆的Mamba:解决长序列建模中的表示瓶颈

Qinwen Wang, Jieping Luo, Aoxiang Qin, Ruoyu Zhao, Jianxiong Tang, Wei Zhang, Zhichao Lu, Luziwei Leng

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) BrainGalaxy

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出分层记忆Mamba(HMM),通过分层记忆机制解决Mamba类循环线性注意力模型的长序列表示瓶颈,在两项任务上提升性能且参数和训练开销增加极少。

Comments 19 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 57%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02486 2026-08-05 cs.CV cs.CL 版本更新 57%

VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

VLMs需要词语:视觉语言模型倾向于通过语义锚点而非视觉细节进行推理

Haz Sameen Shahgir, Xiaofu Chen, Yu Fu, Erfan Shayegani, Nael Abu-Ghazaleh, Yova Kementchedjhieva, Yue Dong

机构 * University of California, Riverside(加州大学河滨分校) MBZUAI(穆桑人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究发现视觉语言模型在需要细粒度视觉感知的任务中表现不佳,因其依赖语义锚点而非视觉细节。通过实验验证,模型在可命名实体上表现更佳,而Logit Lens分析显示其能恢复语义标签。任务特定微调可提升性能,无需语言先验。

Comments Accepted at the Conference on Language Modeling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24341 2026-08-04 cs.AI 版本更新 57%

Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Agent

使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应

Weijie Xia, Stefanie Horian, Hanyue Huang, Queena K. Qian, Jie Yang, Pedro P. Vergara

机构 * Mistral AI(米斯特拉尔人工智能公司) Ollama(奥拉马)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07666 2026-08-04 cs.CR cs.AI 版本更新 57%

SoK: DARPA's AI Cyber Challenge (AIxCC): Competition Design, Architectures, and Lessons Learned

SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训

Cen Zhang, Younggi Park, Fabian Fleischer, Yu-Fu Fu, Jiho Kim, Dongkwan Kim, Youngjoon Kim, Qingxiao Xu, Andrew Chin, Ze Sheng, Hanqing Zhao, Michael Pelican, David J. Musliner, Jeff Huang, Jon Silliman, Mikel Mcdaniel, Jefferson Casavant, Isaac Goldthwaite, Nicholas Vidovich, Matthew Lehman, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德克萨斯大学) Smart Information Flow Technologies (SIFT)(智能信息流技术公司) Kudu Dynamics(Kudu动态公司) Microsoft(微软)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。

Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏