5276 条条目 · 106 个活跃源
2026年9月24日
04:00
arXiv cs.AI

从对齐到访问控制:生成式AI策略执行框架

生成式AI安全机制滞后致事故频发,本文系统剖析策略执行现状,提出分析方法并呼吁改进。

04:00
arXiv cs.AI

基于影像组学条件调制的 RenalCLIP 特征用于透明细胞肾细胞癌分类

以影像组学经 FiLM 调制 RenalCLIP 特征并保留直接残差,提升透明细胞肾细胞癌 CT 分类的内外部 AUC。

04:00
arXiv cs.AI

TraceVIC:基于代码演化因果推理识别漏洞引入提交

TraceVIC用时间图因果推理代码演化,追踪根因代码历史并排序漏洞引入提交;F2最多提升28.7%,79个漏洞中识别78个有效VIC。

04:00
arXiv cs.AI

塞壬之歌:当近端背景语境盖过远处证据

近邻陷阱:远端证据被近端无关背景淹没;LYRA重分配注意力提升长上下文表现,发布ProxBench。

04:00
arXiv cs.AI

基于LLM的代码漏洞修复中的指标失效:实证研究与变更感知筛选

编译率不可靠,多由评测环境与数据假象决定,与修复质量脱钩;提出变更感知筛选diff_F1,主张基于执行的评估。

04:00
arXiv cs.AI

AI 能否为产品设计节省时间?一项针对 AI“提示词到设计”工作流的随机对照实验

随机对照实验显示,Figma Make 使设计任务完成时间缩短约20%,产品经理受益更大。

04:00
arXiv cs.AI

Glucose-ML:用于开发鲁棒AI解决方案的纵向糖尿病数据集合集

发布Glucose-ML合集,含10个公开纵向糖尿病CGM数据集,覆盖多国多类人群,建立血糖预测基准,助力稳健AI开发。

04:00
arXiv cs.AI

SAGE:面向结构感知联想记忆的自演化智能体图记忆引擎

图记忆作为动态长期记忆,写者构建、读者检索反馈,自演化提升多跳问答与检索效率。

04:00
arXiv cs.AI

BixBench3:在科研级计算生物学任务上评测AI智能体

BixBench3评测AI智能体端到端完成计算生物学研究的能力:20项任务中前沿模型得分仅0.00–0.48,数据量越大、步骤越多,表现越差。

04:00
arXiv cs.AI

ScholarStack:面向科学智能体的分层研究资产编排与跨任务复用

该系统将论文集编译为分层可溯源研究资产,支持科学智能体跨任务复用,提升跨论文任务质量并降低查询开销。

04:00
arXiv cs.AI

多智能体大语言模型辩论究竟改变了什么?对分歧与答案质量的分层分析

多智能体辩论易改变智能体的表态,但缺乏持久立场变化与最终答案质量提升的证据。

04:00
arXiv cs.AI

重写而非仅蒸馏:面向持续视觉语言模型后训练的参考驱动修订

让模型以专家答案为参考修订自身错误轨迹,校验通过后微调,新任务提升56.9分且遗忘降低11.3倍。

04:00
arXiv cs.AI

知识库驱动的实体集分类扩展导航

知识库驱动的实体集分类扩展中,提出扩展图并形式化节点可比性推理,揭示复杂度边界,支持局部增量导航。

04:00
arXiv cs.AI

基于纠缠引导与代理约束缓解大语言模型遗忘中的过度遗忘

提出EGUP框架,用样本间/内纠缠动态调整遗忘强度,并以代理约束软正则化,缓解过度遗忘,改善遗忘-效用权衡。

04:00
arXiv cs.AI

ELEMENT:基于最大熵的分幕式与终身探索

提出 ELEMENT,融合终身与分幕熵最大化,用 kNN 图估计熵,提升状态覆盖与无监督预训练。

04:00
arXiv cs.AI

FedNIA:面向联邦学习数据投毒缓解的噪声诱导激活分析

提出FedNIA,无需中心测试集,注入噪声分析客户端激活,检测排除恶意客户端,抵御多种联邦学习投毒攻击。

04:00
arXiv cs.AI

激励与切割层选择如何影响拆分联邦学习中的数据贡献?

用Stackelberg博弈分析拆分联邦学习中激励与切割层选择对数据贡献的影响,均衡可最大化双方效用。

04:00
arXiv cs.AI

OV-MAP:面向机器人的开放词汇零样本3D实例分割地图

提出OV-MAP,融合开放特征与2D掩码投影,实现机器人零样本3D实例分割。

04:00
arXiv cs.AI

基于偏好向量的自适应有用性-无害性对齐

提出偏好向量框架,训练单项偏好模型,提取行为偏移并在测试时动态合并,实现可控可扩展的有用-无害对齐。

04:00
arXiv cs.AI

WebArxiv:面向arXiv任务的多模态网页智能体可复现评估基准

提出WebArxiv基准,含510个静态可复现任务,评估发现现有网页智能体在学术检索与推理上仍具挑战。

04:00
arXiv cs.AI

基于文本保持技术的微调大语言模型数据溯源审计

以不可见Unicode字符构建"线索—回复"标记,黑盒审计微调数据使用,0假阳性下真阳性率达96.7%。

04:00
arXiv cs.AI

动态生物相关环境中的实时自主磁性微型机器人导航

提出长程规划与短程反应控制闭环框架,实现磁性微型机器人在动态生物环境中实时自主导航。

04:00
arXiv cs.AI

基于分层约束的元模型引导模型生成

提出元模型引导的分层约束模型生成方法,协同生成时约束与生成后验证,在汽车电子实验中通过验收与校验。

04:00
arXiv cs.AI

STAR-VAE:面向可控分子生成的可扩展隐变量Transformer

STAR-VAE融合双向编码器与自回归解码器,经性质条件化与轻量微调,实现有效、新颖且可控的分子生成。

04:00
arXiv cs.AI

多模态大语言模型驱动的上下文感知无人机应急着陆点选择框架

提出融合遥感与多模态大模型的无人机应急着陆点评估框架,粗到细识别语义风险,构建ELSS基准。

04:00
arXiv cs.AI

辐射场引导预训练:利用无标签无线信号规模化定位模型

RFRP自监督预训练耦合定位大模型与射频辐射场,用无标签信号,定位误差降超40%。

04:00
arXiv cs.AI

用博弈论强化学习寻找接吻数

将接吻数问题转为合作矩阵补全博弈,用强化学习改进15个保持数十年的强界并发现新几何结构。

04:00
arXiv cs.AI

迈向教师与生成式人工智能的协同互动

提出教师—AI协作五层级框架,分析生成式AI对教师能力的替代、补充与增强,并展望二者协同决策。

04:00
arXiv cs.AI

迈向 AI×DB 工作负载的高效编排

将AI操作融入数据库引擎,统一编排关系与AI算子,协同优化、调度与缓存复用,NeurEngine原型验证性能优势。

04:00
arXiv cs.AI

通过几何性质发现数据流形几何

反向直接学习交换性、时间一致性与共同参考等几何性质,用无监督目标恢复数据流形切空间和全局结构。

04:00
arXiv cs.AI

预训练表征噪声线性探测中的谱过拟合

冻结预训练特征线性探测仍会谱过拟合噪声标签,中间PCA秩可恢复干净精度,宜作诊断。

04:00
arXiv cs.AI

模型作为AI原生MBSE的受治理接口:读侧充分性与写侧可准入性

论文以阿波罗11号模型为例,指出模型可读不足,提出读侧充分性、写侧可准入性的认知充分性架构与受治理查询框架。

04:00
arXiv cs.AI

参数化稠密-稀疏融合的混合检索:在 BEIR SciFact 上用 Qdrant 调优排序-分数混合

在SciFact上网格调优稠密-稀疏混合排序参数,最优配置nDCG@10达0.753,优于稠密BGE与等权RRF,系数需按数据集重调。

04:00
arXiv cs.AI

天王星:构建面向具身智能的下一代仿真基础设施

以关节轨迹为条件的自回归扩散仿真器,支持流式无限推演、24FPS生成与多本体多视角统一控制。

2026年9月23日
04:00
arXiv cs.AI

当LLM智能体读不懂“气氛”:面向关系型社交推理的ReAdapt

ReAdapt为LLM智能体引入显式社交状态与Adapt修正步骤,使其依据关系证据调整决策,显著提升社交推理表现。

04:00
arXiv cs.AI

Ovis-Embedding:推动通用全模态嵌入的前沿

提出Ovis-Embedding全模态嵌入模型,统一文本、图像、视频与音频,在多项基准上达到最优。

04:00
arXiv cs.AI

现有预条件器能否提升生物医学表格基础模型学习?——基于 TabPFN 优化的实证研究

在59个生物医学数据集上评测五种AdamW预条件策略微调TabPFN v2.5,发现原始AdamW表现最优,现有曲率感知预条件器无稳定提升。

04:00
arXiv cs.AI

4DGS-JEPA:面向动态高斯泼溅的时序组合式联合嵌入预测

提出4DGS-JEPA,以时序组合联合嵌入预测动态高斯泼溅,支持多视野因果预测与递归推演。

04:00
arXiv cs.AI

Lean Pool:一个由 AI 维护的形式化数学档案库

Lean Pool 是形式化数学资源库,由 AI 智能体自主扩充、维护与优化。

04:00
arXiv cs.AI

面向胶质母细胞瘤(GBM)生存预测的准确且可解释超图神经网络

提出融合层超图、概念瓶颈与EST正则的多模态框架,用于GBM生存预测,兼顾准确与可解释。

04:00
arXiv cs.AI

MedGate-Fusion:融合首诊语义叙述与生理生物标志物的前瞻性卒中风险分层

多模态门控模型融合首诊叙事与10项生理标志物,基于CPCSSN十万余患者,实现五年卒中风险分层。

04:00
arXiv cs.AI

X-Planner:面向具身智能的事件结构化任务规划

提出X-Planner规划前端,统一具身推理监督与表示,支持离散事件与潜在思维链,实机执行优于基线。

04:00
arXiv cs.AI

注意力作为路由图:单次前向传播的实时电路提取

将注意力视为单次前向的路由图,保留通向答案的少量路由;消融这些边比随机消融更伤模型,成本极低。

04:00
arXiv cs.AI

ZeroGate:面向受治理 AI 智能体运行时的信任保持快速路径

ZeroGate分离审批与本地准入,用短时通行证和原子nonce实现可审计快速路径,但非净加速。

04:00
arXiv cs.AI

让智能体更一致:技能应为重复任务形成习惯

智能体重复任务不一致;提出技能习惯化:挖掘确定性技能门控复用,提升一致性、省词元,但错误亦稳定复现。

04:00
arXiv cs.AI

使用 Wiki LLM 索引提升机器学习课堂学习效果的潜力

对比同一课程语料,LLM 编译的维基索引在跨单元概念关联上明显优于向量 RAG,且可溯源引用。

04:00
arXiv cs.AI

从装饰性到承重性:任务难度塑造思维链的因果作用

思维链的承重性随任务难度变化:简单任务被绕过,困难任务中错误逐步传播,为思维链监督带来结构性挑战。

04:00
arXiv cs.AI

鲁棒失败,保守修复:从跨模型失败中进行文本知识蒸馏

提出RFCR蒸馏法,从跨模型失败中提取规则并收紧适用边界,在BBH上准确率提升2.75个百分点。

04:00
arXiv cs.AI

异构批处理的高效迭代检索

Orthrus在统一推理循环中异构批处理嵌入与生成,吞吐提升1.28–4.52倍,p99延迟降55.8%。

04:00
arXiv cs.AI

从离线代理到在线决策:对话式AI的分层参与度评估框架

提出分层离线代理框架,可实验前预测对话AI在线参与度;冻结后113组F1达81.1%,原始仅34.3%,无误判。