5891 条条目 · 106 个活跃源
2026年8月20日
04:00
ArXiv AI

Redakto——面向大语言模型的隐身标签页

Redakto开源工具可在文本输入LLM前匿名化,去除个人身份信息,支持假名化,本地部署,法律医疗领域评估显示效用不降。

04:00
ArXiv AI

任意格中杰卡德距离的三角不等式

模赋值下任意格中杰卡德距离满足三角不等式;相对补分配格需超模与对数子模,超模性必要。应用于量子信息、机器学习

04:00
ArXiv AI

按设计可缓存?为局部性训练混合专家路由器以对抗边缘内存带宽墙:一项预注册的阴性结果与系统测量研究

混合专家推理受内存带宽瓶颈制约;训练路由局部性可减少缺失但困惑度超标,预注册阴性;结合无训练重路由最佳。

04:00
ArXiv AI

UMER:面向通用多模态检索,通过成对感知判别推理统一嵌入与排序

通过成对感知判别推理统一嵌入与排序,联合对比嵌入与判别排名,互蒸馏提升通用多模态检索,并达最优。

04:00
ArXiv AI

大语言模型在不确定性下的偏好推理

大模型偏好推理面临信息不完整、解不存在的不确定性,无法区分确定与不确定情形,验证中亦出现校准偏差。

04:00
ArXiv AI

透明传感器诊断管道搜索中的候选命运核算

提出候选命运核算框架,记录诊断搜索中的候选状态,识别被遗漏的候选,确保审计透明且性能不减。

04:00
ArXiv AI

轻量级多模态模型能否估计LLM推理性能?面向计算最优文档推理的研究

提出基准BudgetDoc和1B参数DRB预测推理性能并动态分配预算多数配置下匹配或提升F1成本大降

04:00
ArXiv AI

CTIFoundry:面向网络威胁情报的智能体原生语料库脚手架

该框架为威胁情报构建结构化语料,通过类型化边与工具技能,使智能体基准得分提升0.19-0.28,且调用更少。

04:00
ArXiv AI

大语言模型的免训练推理时自我反思与成本受限早停

提出免训练推理协议EvoResearcher,通过自我批判修订与显式早停,在冻结模型上零梯度更新,以约2.1次生成达到同等精度,终止82-88%任务。

04:00
ArXiv AI

可验证弃权使供水管网中的AI漏损诊断可问责

可验证弃权使漏损定位可问责:数字孪生证伪,LLM审计,有据才派工。噪声下精度32%→96%,独立测试4/33全对。

04:00
ArXiv AI

ORBITER:面向智能体式末端配送的冲突感知决策

ORBITER通过决策点建模与LLM推理,实现冲突感知的末端配送决策,平均提升9.2%

04:00
ArXiv AI

SkillGate:长时程智能体中策略内技能选择训练

SkillGate分离信用通道,解决选择器信用饥饿,将9B策略成功率从40.8%提至53.2%,优于纯结果奖励。

04:00
ArXiv AI

微调随机机器:系统工程师视角下的人机工程运营模型

专家纠正LLM错误常随会话失效,问题在运维而非工具。提出七原则运营纪律,以错误循环为核心,含测量框架。

04:00
ArXiv AI

分组随机机器:精度而非能力,作为AI系统的前沿度量标准

前沿模型能力已饱和,真正差异在精度:重复任务输出一致性。可低成本测量,区分系统性偏差与随机散乱,指导改进。

04:00
ArXiv AI

超越文本记录:检测潜在多智能体通信中的隐蔽协调

提出可验证潜在对齐框架,监测隐空间通信,AUROC达0.993,白盒干预降低合谋低报价47.3个百分点。

04:00
ArXiv AI

《2026年全球负责任人工智能指数:概念框架与方法论》

提出全球负责任AI指数第二版方法:五维度38指标,分三大支柱,权重60/10/30,含URAI惩罚扣分,支持跨国比较。

04:00
ArXiv AI

熵约束的自适应随机量化

提出熵约束自适应随机量化(ECASQ),在熵预算与无偏约束下最小化MSE,给出最优及近似动态规划算法。

04:00
ArXiv AI

TokenPowerSandbox:面向能效感知LLM服务的证据门控CPU优先筛选

令牌功率沙箱提出证据门控CPU优先筛选用于能效感知LLM服务H100能量误差6-7%但延迟需门控验证

04:00
ArXiv AI

Eureka:面向科学发现的任务条件化元智能体编排

任务条件化元智能体架构,以动态义务图与宏智能体编排,递归任务全过、零误纳,推动科学发现。

04:00
ArXiv AI

机器学习技术用于自闭症诊断与治疗的系统综述:挑战与机遇

该综述评估2017-2023年55项研究,监督学习主导,深度学习扩展,需整合多模态数据提升诊断治疗。

04:00
ArXiv AI

人工智能能从医学中学到什么?生成类比与可靠的机器学习系统

机器学习在医学中广泛应用但存在不确定性,通过生成类比借鉴临床转化标准,以可靠主义诠释,形成新的机器学习可靠主义。

04:00
ArXiv AI

生物与人工神经网络之间的双向表征对齐

通过调整表征几何结构,双向可预测性提升55%,前向与反向预测趋于对称。

04:00
ArXiv AI

量子优势有多大?网络入侵检测中量子机器学习的公平、校准与噪声感知基准及归因审计

网络入侵检测中量子机器学习优势多为经典预处理与正则化所致;严格审计后,仅少数量子内核任务显著胜过经典基线。

04:00
ArXiv AI

FairGlucose:一个CGM公平性基准揭示群体水平验证中隐藏的亚组差异

构建CGM公平基准,发现群体准确率掩盖亚组差异:T1D误差高6 mg/dL,所有模型均如此,应默认亚组报告。

04:00
ArXiv AI

AI提示词如何揭示人类行为的结构

提出一种用人工智能提示词刻画人类行为的方法,发现风险厌恶、策略复杂性和信任三维度即可匹配,且能预测新情境行为。

04:00
ArXiv AI

SeisEvo:基于智能体的地震数据重建算法进化

SeisEvo用LLM多智能体进化重建算法,输出白盒算子,较经典方法SNR提升3.49/7dB。

04:00
ArXiv AI

任务条件化最小权限学习用于可执行终端与MCP代理

提出后训练框架教4B模型选择最小权限,越权错误从4.56%降至0.79%,安全成功率升至98.48%。

04:00
ArXiv AI

一道闸门不够:为智能体AI组合带状态的行动前控制

修复会改变其他控制依据,需再门控;两种修复算子不交换,影响控制语义。

04:00
ArXiv AI

LLaMA 3.1 8B中结构感知数值推理的机制可解释性

研究Llama 3.1-8B数值序列建模,发现其内部计算并存储一阶差分,以类似归纳电路机制实现预测。

04:00
ArXiv AI

向量符号策略梯度

提出向量符号策略梯度(VSPG),用超向量表示动作,更新等价于优势加权捆绑,兼具核记忆与鲁棒性保证。

04:00
ArXiv AI

ERASE:加速现代推荐系统训练的早期反向传播调度

利用前向-前向解耦机制提前反向传播,与后续前向并行,在点击率模型上提速9.51%且效果接近基线。

04:00
ArXiv AI

物理展开神经算子用于无线场建模

PU-HNO从低保真射线追踪预测高保真室内无线地图,逐步捕获传播效应,性能超越基线。

04:00
ArXiv AI

机器上由机器完成的科学:计算化学中的AI智能体

计算化学智能体数量激增,正迈向全自主AI科学家,自动化趋势不可逆转。

04:00
ArXiv AI

GCNO:用于无线信道物理压缩的格拉姆切比雪夫神经算子

提出基于物理的可变速率信道压缩器GCNO,识别主导传播路径,无需标签,精度更高或负载更低,且可迁移至未见天线数。

04:00
ArXiv AI

MorphoGP:潮汐影响下平衡海滩剖面预测的非参数框架

提出MorphoGP框架,基于对比学习分类与高斯过程专家预测潮汐海滩剖面,误差降59.3%,RMSE达0.297米。

04:00
ArXiv AI

面向IoT环境的机器学习服务(MLaaS)性能漂移检测

针对物联网中MLaaS数据分布变化与更新导致性能漂移,提出黑盒漂移检测框架,精度提升22-25%,漏检率降9%。

04:00
ArXiv AI

CentaurBench:评测LLM在辅助与自动化真实工作任务上的能力基准

统一框架评估LLM辅助与自动化,排名相关性低,自动化能力非辅助质量代理,且辅助未必有益。

04:00
ArXiv AI

不确定时变奖励的定向越野问题:日常服务机器人的框架与基准

提出不确定时变奖励定向越野问题,分析规划时域与自适应的权衡,服务机器人基准显示长时域加在线自适应有效。

04:00
ArXiv AI

基于变点感知的PPG血压估计评估与重校准

提出基于变点检测的PPG血压估计评估框架,发现模型在血压波动时性能显著下降,并引入针对性重校准以提升鲁棒性。

04:00
ArXiv AI

去噪感知反演:揭示噪声保护文本嵌入中的隐私风险

提出去噪感知反演方法,融合残差去噪器与生成式反演,重建质量大幅提升,表明简单高斯扰动不足以保护嵌入隐私。

04:00
ArXiv AI

SIDScope:生成式推荐中语义ID接口的诊断资源

生成式推荐语义ID接口诊断资源,多信号评估映射健康,揭示前缀对齐与路径计数偏差,刷新后需单独交接验证。

04:00
ArXiv AI

$O_2$的MCFL性质的加强

针对字符串元组分解,给出比现有定理更强的刻画,强化了$O_2$为多重上下文无关文法的证明。

04:00
ArXiv AI

遗忘、可塑性与共同观察:持续学习的第三个维度

持续学习中,共同观察数据是独立于遗忘和塑性的第三因素;同时观察有益泛化,重放优势源于重获该收益。

04:00
ArXiv AI

SkillForge:面向项目特定问题解决的自蒸馏智能体

SkillForge通过合成项目特定问题并蒸馏为技能,主动获取项目知识,显著提升问题解决性能。

04:00
ArXiv AI

可解释架构的图形化设计

提出一种基于Penrose张量记号的图形语言,用于设计可解释AI架构,可全局概览并直接对应PyTorch代码。

04:00
ArXiv AI

欧洲气候雄心面临审视:基于深度学习排放预测的证据

深度学习预测显示,欧盟2030年排放将超目标35%,电力部门进展达标,交通部门严重滞后。

04:00
ArXiv AI

DA-WAM:用于驾驶世界模型的决策对齐未来潜变量

提出DA-WAM,统一预测表示、动作条件未来建模与轨迹评分,实现决策对齐,NAVSIM上SOTA。

04:00
ArXiv AI

面向插值的连续时间序列离散化与掩码扩散训练

提出掩码扩散时序插值模型,直接预测原值并引入随机离散化,鲁棒性和扩展性优于现有方法。

04:00
ArXiv AI

驾驭持续学习:超越模型参数的持续适应

提出驾驭持续学习,在冻结模型外演化提示/记忆等组件,用守卫式更新实现防遗忘与能力积累,相对基线提升超10%

04:00
ArXiv AI

叶值坐标化:梯度提升集成的精确对比解释

叶值坐标化使对比解释精确;补救方法重构误差6.2e-15,可行改动下有效性58%优于基线41%。