更多特征并非更多证据:基于 Jev 的免训练人体活动识别的局限
Jev免训练人体活动识别远逊监督模型;更多数值特征反降性能;传感器到模型接口是评估关键。
RA-CFGCache:从分支级准则到无分类器引导下的引导风险控制
提出RA-CFGCache,在无分类器引导下融合分支误差与传播风险,在线控制缓存,改善效率与保真权衡。
随机策略基线缺失下,程序化生成泛化差距究竟衡量了什么?动作规则、收敛性与缺失的随机下限
强化学习泛化差距常缺参照,应报告同关卡随机策略下限;动作规则与收敛口径会显著改变结论。
MERID:基于递归自我改进智能体的多模态探索用于重度抑郁症分析
MERID利用递归自我改进智能体,联合优化多模态表示、融合与预测器,在抑郁症检测与严重度估计基准上最优。
激活流:为引导而制造激活
ActFlow无需微调,仅凭k个正确标签合成激活,将沙袋式锁定模型的准确率从0.05提升至0.85。
大型语言模型在被训练预测自身准确率时学会不同形式的元认知
模型置信度分双信号:近训练分布追踪准确率,其他领域追踪输出一致性;后者早现可泛化,前者晚现且局限。
简单扩散语言模型作为少步生成器比报道的更有效
少步生成潜力被次优采样器掩盖:适度锐化无需重训,旧模型16步超越1024步,且需联合评估质量与多样性。
欧盟《人工智能法案》合规检查器的实证研究与评估
实证评估12款欧盟AI法案合规检查器:质量参差,仅能早期指引,易致虚假合规,并提出设计原则。
具无分布风险保证的更快块扩散推理服务
Redline用校准数据选配置,在风险预算内控制相对参考的失败概率,并部署最快通过者以加速块扩散推理。
共享自回归上下文可能扭曲合成数据中的变量关系
大模型批量生成使前序答案成上下文,扭曲合成数据变量关系并夸大相关性,请求构造影响数据效度。
论高效推理中的词元价值不平等
CoT推理词元价值高度不均,对数概率可区分核心与冗余词元;TokenProbe压缩冗余词元,省76%用量并保持质量。
量化误差是谱平坦的:单次随机探针即可作为校准、无数据的敏感度估计器,并应用于面向预算目标的混合精度量化
量化误差谱平坦,单随机高斯探针可无校准无偏估计敏感度,RAM按字节预算分配混合精度位宽。
Transolver 真的需要 Transformer 吗?
该模型无需 Transformer,切片/反切片全局混合才是关键,并提出高效实现。
NSV-Shift:面向语音到语音模型中非言语发声理解与响应适应的对比基准
NSV-Shift对比基准:评估语音到语音模型的非言语发声理解与响应适应,发现模型检测强于情绪解读与差异化回应。
CAESAR:通过自主嵌入空间凝聚式重组进行聚类
无需预设簇数K,CAESAR重组预训练嵌入空间,拉近互近邻、推开非近邻,文本与图像聚类均超越强基线。
ChronoSRL:面向自监督强化学习的时间几何
赋予评论家嵌入时间几何,按到达目标时间训练,并借助生存强化学习提升策略,在导航与四足任务上超越基线。
优先进行重复式LLM评估以发现隐藏故障
预算约束下先浅评,再依据失败倾向优先深查零失败提示,显著提升隐藏故障发现。
被困于自身的采样轨迹:理解联邦在线策略蒸馏中的聚合—采样反馈
联邦在线蒸馏受聚合延迟拖累,学习率敏感掩盖协作收益;提出FedTOPS自适应更新,六项推理基准提升4.56–14.57个百分点。
组合式目标:在结构中学习结构
提出组合目标,测量图像部件与交互;观察者所见比关系标记更关键,谱多样性、可预测性、下游效用各自独立。
SlopBench:我们能在多大程度上按“AI 废话”给语言模型排名?一项重复性 AI 写作的多领域基准
SlopBench用112项任务评测18个模型近2万输出,按四项表层特征评分;重加权后排名不稳,仅一项排名无歧义。
面向论述性文本语义相似度分析的高层文本预处理:框架与实证演示
提出高层文本预处理,用规则分离论述结构与核心主张;实验显示可降低语义相似度虚高,并提出语义扩散指数。
超越单智能体与一致性:通过条件渐进剪枝为多智能体辩论正名
提出条件渐进剪枝(CPP),轻量利用多轮辩论,在严格成本下超越单智能体、一致性及现有MAD框架。
学习年龄:预测误差的时间持续性作为学习信号
提出“学习年龄”,度量预测错误的持续时间,区分持续欠学习与短暂失误,用于离线与流式训练的样本重加权。
DimPO:基于偏好优化的注意力降维
DimPO以偏好优化加top-k交叉熵离线学习Q/K投影,降注意力维度;实验表明保留关键注意力排序与集中度比复现完整分布更重要。
系统1决策能自洽吗?一项概率一致性研究
Jev与Laya分类概率不一致:粗细预测分歧大,准确率反向变动,提升或伴随校准恶化。
OTROPE:面向大语言模型的基于最优传输的鲁棒离策略评估
提出免似然OTROPE,以最优传输在语义空间校正分布偏移,双稳健评估LLM,性能稳定超越基线。
HyperZip:基于超网络个性化扩散大模型的高效数据压缩
HyperZip借助超网络与多词元预测适配扩散大模型,实现高压缩率、高吞吐的数据压缩。
面向缓解大型推理模型中的欺骗性安全对齐
提出DSAR指标量化推理与答案的安全不一致,并用SARA强化学习法缓解且保持有用性。
DynamicHOI:面向物理感知手物交互重建的耦合动力学
提出物理感知重建框架DynamicHOI,耦合手物动力学并以驱动先验抑制力学不合理运动,提升重建性能。
在线通用增量学习:迈向任意时刻的类别与领域无关适应
提出Online VIL:类与域无边界在线共变;TopFlow以域无关流匹配与全局拓扑保持实现SOTA。
DARE:以双路径自回归感知编辑缓解幻觉
提出DARE混合编辑框架,融合文本、图像对比与自回归感知信号,减少LVLM物体幻觉且保持感知性能。
CheatBench:衡量AI智能体中的奖励作弊行为
发布基准CheatBench,跨领域衡量AI智能体的作弊行为,助力测量并减少此类风险。
从表面到体积:面向蛋白质表示学习的配准几何
提出Protein-TetSphere残基级配准体积表示,统一拉普拉斯坐标并融合表面与化学信息,在口袋、界面与结合剂设计上均获提升。
StateTape:面向长程编程智能体的动作条件化证据生命周期建模
仓库建模为符号级代码图,磁带标记写入影响的符号,随代码变更重写智能体上下文,清除失效记录、召回所需信息。
事件边界处的预见:评估视频世界模型中的物理预测
基于62段自由落体视频提出事件锚定评测,发现视频世界模型能触发后果却常延迟,时序合理不等于物理一致。
错觉真相还是单纯曝光?基于大语言模型的社交媒体模拟中的模型依赖性重复效应
四款LLM社媒模拟中重复效应因模型而异:或现错觉真相、或单纯曝光、或无效应;温度无影响。
重新构想视频动态
RVD通过自监督重建,从视觉上下文中解耦出可编辑的动态令牌,实现语言引导的动态编辑与重渲染。
ThuRunel:面向结构化咨询对话的动态解耦
提出ThuRunel咨询智能体,以动态解耦衔接共情引导与专家判断两阶段,提升信息采集与转介质量。
面向数据系统的 AI 软件工厂
构建 AI 软件工厂,加速数据系统研发全周期并以元数据自我改进;微软部署实现 3 倍工程效率、22 倍 token 效率。
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
提出ThinkingGuard,逐步风险归因检测多模态大模型隐式危害,构建TriggerBench
面向连接组学突触检测与校对的视觉语言模型基准评测
视觉语言模型在连接组学突触检测与校对:零样本近随机,微调后开源模型追平专家,跨物种合并错误识别更优。
PILLAR:面向增强检索的隐私保护倒排索引词法查找
PILLAR是隐私保护RAG系统,用稀疏PIR倒排索引过滤加稠密重排,服务器不知查询词与访问模式。
时间步加权:实现有效基于ELBO的流匹配强化学习的隐藏关键
研究ELBO流匹配强化学习的时间步加权,发现其有效权重取决于奖励与学习阶段,并提出更优加权策略。
RewardExplainer:从反事实偏好反馈中学习奖励模型解释
提出RewardExplainer,借反事实反馈训练可复用解释器,生成可干预评分机制,提升忠实度并助力去偏。
迈向大语言模型中信念稳定性的分级度量
提出分级信念稳定性指标,基于内部表征估计条件信念,发现低稳定性信念更易在对话挑战下动摇。
医学视觉语言模型为何未充分利用其视觉编码器:皮肤科视角
医学视觉语言模型未充分利用视觉编码器,皮肤科中编码器显著更强;描述后决策与编码器辅助重排可改善。
Opera:面向长周期编程智能体的语言评论家框架
Opera将每次纠正作为持久批注并跟踪至问题解决,择机审查、诊断并核验反馈,显著提升编程智能体解决率。
SCCM:面向ERP稠密特征对应的球面一致粗匹配
SCCM通过球面先验在粗匹配阶段校正ERP的拓扑、度量与面积三重畸变,显著提升稠密特征匹配精度。
直觉向量
冻结视觉模型嵌入的潜在向量算术可支持跨领域隐式规则推理,无需微调或生成模型。
FM-ReID:面向目标重识别的选择性竞争令牌路由
提出FM-ReID,以选择性竞争令牌路由挖掘局部判别线索,联合整体表示提升多类目标重识别。