5280 条条目 · 106 个活跃源
2026年9月23日
04:00
arXiv cs.AI

GroundedGEO:审计生成式搜索排名中的证据缺口

构建证据配对基准与声明级重排器,审计生成式搜索排名中文本难辨真伪证据的缺口。

04:00
arXiv cs.AI

你已经看够了:面向机器的质量约束图像编码

面向机器的图像编码中,约束人眼质量至目标水平,余量提升任务性能;较无约束优化省22.82%码率且不增复杂度。

04:00
arXiv cs.AI

WILSON——用于患者级分析和诊断文本生成的病理学基础模型框架

WILSON以多放大合成图像建模病例,经病理报告监督,实现患者级诊断分析与文本生成,性能优、计算省。

04:00
arXiv cs.AI

基准评测 Neural Defend ARCAS 1B:一个基础多模态深度伪造检测模型

跨基准评测 Neural Defend ARCAS 1B,不调参,区分原生与汇总指标,揭示覆盖与类别差异,强调可追溯协议而非排名。

04:00
arXiv cs.AI

Rachel:通用语言模型指导并修正逆合成路线

Rachel让通用LLM无需搜索策略即可指导并修正逆合成路线,并在多个基准高比例闭环。

04:00
arXiv cs.AI

基于FinBERT的金融情感分析及其在股票走势预测中的应用

用FinBERT情感分析与LSTM预测股市走势,效果优于BERT、LSTM及ARIMA。

04:00
arXiv cs.AI

儿童如何设计并推理可信赖的AI聊天机器人

8-18岁儿童设计119个聊天机器人;年幼者视可信为达成目的,年长者重透明校准,提炼七维设计。

04:00
arXiv cs.AI

VLAQuantBench:视觉-语言-动作模型训练后量化的闭环评估

VLAQuantBench闭环评测VLA训练后量化,精度选择依赖层范围、格式与校准,给出具体配置。

04:00
arXiv cs.AI

间接临界转变:AI智能体群体中的社会攻击面

间接临界转变可借中间平衡态降低对抗少数阈值、绕过多数要求,凸显AI智能体群体的社会攻击面。

04:00
arXiv cs.AI

面向地月空间轨道相对运动的Transformer启发轨迹优化

提出双向推理ART-TWIN,从初末状态各生成轨迹弧并在中点拼接,为地月交会对接的序列凸规划热启动,加速收敛、提升可行性。

04:00
arXiv cs.AI

3D场景交互理解中的几何与语义耦合

提出Segment-Snap,耦合部件与把手的几何及语义以理解3D交互,无需运动回归,显著提升运动与把手AP。

2026年9月22日
04:00
arXiv cs.AI

大语言模型中的自指:递归自我改进的内省阈值

类比冯·诺依曼复杂度阈值,论证LLM可持续递归自我改进依赖内省;当前模型仅有准内省,受结构瓶颈所限。

04:00
arXiv cs.AI

基于自嵌入隐写术的免训练部分语音篡改主动防御

利用自嵌入隐写,将压缩语音嵌入自身,无需训练即可检测并恢复部分深度伪造语音,补充被动防御。

04:00
arXiv cs.AI

ASLEval:测量 LLM 智能体会话中的隐私暴露位移

提出隐私暴露位移与ASLEval框架,揭示局部评估漏报暴露,主张基准兼顾隐私与任务效用。

04:00
arXiv cs.AI

PAVE:面向世界-动作策略的预测对齐与价值引导进化

PAVE 将预测对齐与价值引导进化用于世界-动作策略,在三个仿真基准上取得最佳综合性能。

04:00
arXiv cs.AI

位置至关重要:令牌缩减与混洗下 ViT 拆分推理中的特征反演攻击

ViT拆分推理中,令牌混洗仅有表面隐私,令牌缩减仍会泄露;SARA可重建图像,轻量边缘防御可有效抵御且保持精度。

04:00
arXiv cs.AI

保持在攻击路径上:面向长时程自动化渗透测试的结构化状态

提出Intentest,将长时程状态外化为事实-意图DAG,引导渗透测试,CTF成功率88.2%,难题75%。

04:00
arXiv cs.AI

从瞬时情绪推断到持续情绪支持:一项纵向研究中陪伴智能体的评估

19人14天1093次会话评测PAIR:情绪估计贴合自评效价,引导后效价提升,感知帮助随时间渐增。

2026年9月21日
04:00
arXiv cs.AI

检测大语言模型中的幻觉:追踪受损上下文共享的拓扑特征

利用注意力图拓扑与曲率检测大模型幻觉,发现受损上下文共享是关键成因。

04:00
arXiv cs.AI

AI辅助精神科问诊的临床医生本位质量保障

构建临床医生本位的AI精神科问诊评估平台,以患者模拟器试点:LLM信息回收率高,但无据推断多、安全关切少。

04:00
arXiv cs.AI

TinyCeNN-LM:以受CeNN启发的细胞循环层实现预训练注意力的质量门控转换

提出质量门控后训练转换,用CeNN启发循环层替换预训练注意力,接受/回滚验证,保质量减缓存,非通用加速。

04:00
arXiv cs.AI

解耦微调大语言模型中的内部表征变化与因果重要性

微调改变LLM内部表征,但关键组件层分布与最大表征变化层不相关;跨任务组件重叠未必迁移,甚至性能下降。

04:00
arXiv cs.AI

智能体能否借助更高层次的抽象设计出更好的芯片?

AHRR融合智能体HLS设计与HLS后RTL精化,11项基准上较直接RTL设计平均提速2.6倍。

04:00
arXiv cs.AI

在类ARC任务中利用测试时任务嵌入进行隐式规则归纳

两步测试时训练先微调任务嵌入、再冻结它微调骨干,使嵌入更对齐潜在规则,提升ARC类任务表现。

04:00
arXiv cs.AI

LEGIT:面向可信AI智能体市场的资质认证协议

LEGIT协议融合认证、声誉与市场分配,将任务质量与成本绑定到智能体配置并签名存证,便于买家核验比较。

04:00
arXiv cs.AI

AI-GRACE:智能体AI的用例操作化框架——从组织目标与义务到部署能力与架构

提出AI-GRACE框架,连接组织治理与技术实施,涵盖目标义务、七域风险、保障控制证据,指导部署能力与架构。

04:00
arXiv cs.AI

PlaceReasoner-Beta:推理驱动的宏单元布局与基准测试

提出验证器引导的多智能体宏布局框架,将布局重构为闭环推理,并开源基准,布线后TNS最高降低61.2%。

04:00
arXiv cs.AI

CogGym:迈向人类与机器认知的大规模对比评估

CogGym标准化258个认知实验,评估50个大模型:模型越大越像人,但常识推理提升远慢于数学编程。

04:00
arXiv cs.AI

GameASG-Bench:面向游戏开发的自主软件生成基准测试

提出GameASG-Bench,将行为测试纳入游戏生成,含47项任务与L1/L2检查;九种智能体最高平均L2通过率93.2%,严格成功率仅55.3%,暴露合规缺口。

04:00
arXiv cs.AI

基于多粒度SSM的双兴趣序列产品推荐

提出双兴趣跨SSM模型,长短期兴趣分别用Mamba与时间调制SSM编码,残差融合提升推荐性能。

04:00
arXiv cs.AI

面向空中作战决策支持的离线多模态大语言模型

离线多模态大语言模型在无网受限空中作战中提供可溯源决策支持;试点显示得分媲美人类且耗时更短。

04:00
arXiv cs.AI

在寄存器上驾驶,在风险上推理:面向基于寄存器的端到端自动驾驶的风险感知占用

RRDrive引入风险感知占用表示,以全局结构引导和候选风险查询优化轨迹生成与选择,PDMS达0.951。

04:00
arXiv cs.AI

学习优化:AI原生网络缺失的架构层

学习优化是AI原生网络缺失架构层,将优化算法转为离线知识生成器,训练神经代理实现低延迟近优推理。

04:00
arXiv cs.AI

超越准确率:面向结构化虚假招聘帖子检测的质心引导对比损失

提出质心引导对比损失CGCL,以质心驱动top-k推拉统一分类与聚类,在EMSCAD上达SOTA。

04:00
arXiv cs.AI

通过L0正则化混合专家加速稠密大语言模型

提出L0-MoE,用L0正则化轻量混合专家加速稠密大模型,提速达2.5倍且性能几乎无损。

04:00
arXiv cs.AI

GUARD:通过引导式答案-推理蒸馏实现大型推理模型的自然遗忘

针对大型推理模型遗忘后轨迹缺失导致幻觉等问题,提出GUARD引导蒸馏方法,构建安全退出轨迹并引入自然遗忘推理评分,有效减少不安全泄露且保持推理效用。

04:00
arXiv cs.AI

面向时间序列异常检测的大语言模型生成特征池

用多模态大模型按领域生成时序异常检测特征池,与手工池互补,并集性能达0.588,匹配榜首。

04:00
arXiv cs.AI

Transformer 中的世界建模

机制分析表明,模型能表征路口街道、追踪位置并以目标罗盘导航,失败源于叠加特征干扰;世界建模能力分阶段涌现。

04:00
arXiv cs.AI

先倾听,再说话:基于听者面部反应的对话语音生成应答规划

提出ReACT-TTS,用听者预反应面部序列规划对话语音情感韵律;实验显示时间建模更优,可补益应答规划。

04:00
arXiv cs.AI

心电图海市蜃楼:揭示并缓解视觉语言模型在临床预测中对心电图利用不足的问题

提出“心电图海市蜃楼”:视觉语言模型临床预测中忽视或误用患者心电图,并用视觉提示微调有效缓解。

04:00
arXiv cs.AI

EnterpriseVal:量化企业级生成式AI的效能、可靠性与价值

提出企业用例级生成式AI评估系统EnterpriseVal,以指标、分级门槛和盲评判断落地价值与可靠性,并在银行试点验证。

04:00
arXiv cs.AI

接下来该问什么?部分证据下的检索感知问题学习

提出检索感知在线强化学习框架RAVEL,以问答-检索全流程排序反馈优化提问策略,在部分证据下逐轮提升检索性能。

04:00
arXiv cs.AI

AutoViewMem:面向对话长期记忆的自配置正交视图

将长期对话记忆组织为自配置、低重叠语义视图,在写入时解耦语义,提升长程问答与个性化。

04:00
arXiv cs.AI

语言模型的测谎测试:读取模型不愿揭示的知识

PIR探针从模型内部状态读出其是否知晓答案,无需参考模型,能区分隐瞒与无知,可支持审计与遗忘验证。

04:00
arXiv cs.AI

CodeMidas:从代码本身扩展智能体编码强化学习环境

CodeMidas仅以源码为输入构建可执行RL环境,生成5,545个任务,训练后多项编码基准显著提升。

04:00
arXiv cs.AI

Designer-RSI:从用户流量中演化程序性记忆,实现智能体图形设计

冻结模型借230余工具操作设计软件,程序记忆自主扩充修正;五轮无标注实验使成功率72.7%→99.3%。

04:00
arXiv cs.AI

可信的FinAInce:解析AI中介的金融建议如何被评判

285人随机实验:建议风格主导信息与安全评价,专家标签提升可信度,评价可预测质量、信任与采纳意愿。

04:00
arXiv cs.AI

基于位姿注意力的视觉导航Transformer

以相机位姿为位置编码,注意力依赖位姿差而非时序,HM3D点目标导航成功率达93.3%,抗噪更强。

04:00
arXiv cs.AI

用于scRNA-seq插补的混合计算智能框架:整合scRecover与随机森林

提出SCR-MF两阶段流程,结合scRecover检测与missForest插补,性能稳健,兼顾精度与效率。

04:00
arXiv cs.AI

用于日冕仪后波前控制的强化学习

采用强化学习实现日冕仪后波前控制,基于焦平面图像驱动变形镜,成功生成暗区并接近传统方法性能。