隐藏而非删除:网络如何抑制纠缠特征
线性擦除会毁掉密集叠加中的纠缠特征;网络以镜像/影子解抑制非删除,标量补丁可恢复,解释LLM遗忘复现。
DMM-Align:面向2D-3D配准的双角色扩散闭环优化
提出DMM-Align闭环框架,以双角色扩散与可微几何反馈协同优化匹配和位姿,提升低重叠遮挡下的配准鲁棒性。
EBRL:基于多粒度资源管理的异步具身强化学习
EBRL是异步具身强化学习训练系统,通过异步流水线调度与细粒度CPU/GPU资源管理,吞吐提升1.3-3.47倍,收敛加速2.5倍。
“AI正变得过于像人”:青少年如何在日常生活中体验与协商AI
青少年AI讨论激增,聚焦真实性、控制权、人际关系与人类角色,体现对AI边界的协商。
超越不安全检测:面向多轮LLM安全失效的反事实锚定证据归因
针对多轮LLM安全失效,构建分层证据监督数据集,训练轻量归因模型定位责任轮次与词元,F1达0.988,误报低于1%。
视觉-语言上下文学习中的性别偏见
性别化示例会将视觉语言模型偏见导向示例性别,损害另一性别表现;用合成图像替换真实示例图像可减轻偏见。
TraceVIC:基于代码演化因果推理识别漏洞引入提交
TraceVIC用时间图因果推理代码演化,追踪根因代码历史并排序漏洞引入提交;F2最多提升28.7%,79个漏洞中识别78个有效VIC。
塞壬之歌:当近端背景语境盖过远处证据
近邻陷阱:远端证据被近端无关背景淹没;LYRA重分配注意力提升长上下文表现,发布ProxBench。
FleXray:通用临床X射线分割
FleXray用物理生成X光数据,实现全身60个解剖结构的通用分割,推动临床X光定量分析。
委托式错位:多智能体结构如何放大LLM安全风险
多智能体委托使个体安全对齐失效,责任扩散与角色顺从将拒绝转为危害,显著放大LLM安全风险。
基于LLM的代码漏洞修复中的指标失效:实证研究与变更感知筛选
编译率不可靠,多由评测环境与数据假象决定,与修复质量脱钩;提出变更感知筛选diff_F1,主张基于执行的评估。
AI 能否为产品设计节省时间?一项针对 AI“提示词到设计”工作流的随机对照实验
随机对照实验显示,Figma Make 使设计任务完成时间缩短约20%,产品经理受益更大。
A2M:MCP生态中基于轨迹优化的智能体劫持
A2M两阶段框架优化工具元数据与执行轨迹,劫持MCP智能体,恶意调用率93.6%,成功率74.4%。
Glucose-ML:用于开发鲁棒AI解决方案的纵向糖尿病数据集合集
发布Glucose-ML合集,含10个公开纵向糖尿病CGM数据集,覆盖多国多类人群,建立血糖预测基准,助力稳健AI开发。
有限域情境演算理论中关于时间的可判定推理
常用时间表示在有限域情境演算中不可判定;引入时钟与受限后继状态公理,使可达性可判定,并用于 Golog。
带并列与不完全偏好的稳定婚姻问题:ASP、SAT、ILP、CP与局部搜索方法的实证比较
研究SMTI三变体:最大基数、性别平等、平均主义,实证比较ASP、SAT、ILP、CP与局部搜索。
小型语言模型是智能体AI的未来
小型语言模型足够强、更适用且更经济,是智能体AI未来;通用对话宜用异构多模型系统。
ScoutNeRV:通过ScoutNet快速编码基于网格的视频INR
轻量侦察网络按内容选预训练专家初始化HiNeRV,加速优化,37轮达36.92dB,9.25倍提速。
基于参考的开放式文本生成连贯性与多样性分析
提出基于参考的框架,从轨迹对齐、摘要比较与参考似然考察连贯性和多样性,发现其可反映但不等同质量。
面向大规模交通预测的局部异质性与跨区域上下文学习
提出LoReST,双粒度建模节点邻域与路网区域,融合局部异质性与跨区域上下文,预测精度显著提升。
少六层:Whisper 编码器剪枝与无标签恢复
Whisper编码器剪去6层,免定制推理;无标签蒸馏恢复,四语WER从21.9%降至20.1%。
全模态生而平等,但视频更平等:弥合联合视频生成中的交叉注意力差距
联合扩散模型存在互惠对应差距:模态到视频的对应弱于视频到模态。RecCAR通过KL正则化对齐弱方向,提升视频-动作和视频-音频生成质量。
从情感分类到可行动且负责任的反馈:2015—2026年NLP在学生评教中的范围综述与证据图谱
范围综述421项显示,NLP学生评教从情感分类转向反馈,但可行动性断层:A2+达61.3%,A3+仅11.6%;情感分析主流,公平指标稀缺。
GaussianDS:面向场景理解的深度监督语义高斯泼溅
提出深度监督语义3DGS,联合优化外观、深度与语义,抑制语义漂移,在LERF与3D-OVS上刷新最优。
RelCheck:面向VLM幻觉纠正的双证据空间定位
提出免训练后校正管线RelCheck,融合场景图三元组与边界框空间谓词,构建三层视觉知识库,显著改善MLLM空间关系幻觉纠正。
后门留下结构痕迹:FedMAST用于联邦学习中的后门检测与遏制
提出FedMAST,利用结构、谱与历史痕迹检测并遏制联邦学习后门,平均ASR 1.51%,主任务准确率94.84%。
TopoGS:面向大规模3D高斯泼溅的拓扑感知锚点特征聚合
TopoGS借八叉树拓扑聚合锚点特征,区分有效父子关系并软加权,提升大规模场景渲染质量与效率。
审讯对话的可控属性特定摘要生成
提出CASPER,以思维链属性提示和迭代评估提升审讯对话摘要的事实一致性与完整性。
面向全身衰减校正的几何锚定 PET 感知多模态伪 CT 合成:BIC-MAC 挑战赛
挑战赛提出GeoPACT:以NAC-PET为空间参考,融合MRI与定位像,经衰减图及PET响应监督,滑窗生成全身伪CT,实现无CT衰减校正。
基于ResNet-LSTM-CBAM与DCT混合网络的空频域视频伪造检测系统
提出融合空频域特征的ResNet-LSTM-CBAM+DCT视频伪造检测模型,多项基准数据集实验验证其优越性能。
UVU:通过视觉-语言统一自回归范式提升多模态理解
UVU将视觉监督引入预训练,以连续视觉编码和像素级码本统一自回归生成,提升多模态理解。
Pheno-GS:表型景观尺度的测地 Sinkhorn
提出Pheno-GS,融合图正则、非平衡最优传输与批量计算,高效计算大规模噪声数据的测地传输距离,500个分布提速超200倍。
风险可控的 KV 缓存淘汰:从内存预算到风险目标
将KV缓存淘汰建模为部署风险控制,按目标风险与置信要求认证保留策略,未过则回退全KV;同一合同可致不同淘汰或回退。
带降噪与偏差校正的隐私保护去中心化优化
提出PRDO,以同批梯度差递归降噪,用精确扩散纠偏;非凸收敛不依赖均匀异构,查询灵敏度更低,实验精度提升。
Groundbench:多分辨率多边形定位揭示视觉语言模型的几何差距
同一数据改测五档顶点多边形,最强模型框IoU 88.2,直接多边形仅57.7,暴露输出几何差距。
FLEET:从 Logits 熵到文本生成中的增强轨迹
FLEET为LLM引入记忆,以稀疏轨迹调整logits,同精度提速3倍并提升复杂编码准确率。
基于风险敏感与评论家一致性正则化的鲁棒对抗强化学习
提出RACER框架,以风险敏感视角改进对抗强化学习,自适应调节扰动并正则化评论家一致性,提升鲁棒性与稳定性。
VIVAS:以视觉-语言统一自回归监督激活 VLM 预训练中的视觉感知
VIVAS以统一视觉语言词表和自回归监督,增强VLM细粒度视觉感知,在39项多模态基准达SOTA。
评估大语言模型生成的学生写作反馈中的反馈焦点与教学适应性
研究LLM写作反馈焦点与教学适应性,发布FeedType基准;其类型覆盖广,但分布和适应性不及教师。
你被告知了多少?测量同行评审中的外部信息
提出自条件化信息论估计器,测量评审外部信息,高精度区分代写与润色。
NS-ATTENTION:视觉Transformer中注意力输出的牛顿-舒尔茨变换
提出NS-Attn,无参变换视觉Transformer注意力输出,降低谱集中度并提升有效秩,多个模型和数据集上平均提升0.25-0.83个百分点。
MENO:内存高效的神经算子
MENO是基于流形函数编码器的PDE求解器,内存与分辨率无关,支持任意几何离散,泛化强、精度高。
AgentHazard:评估计算机使用代理有害行为的基准
AgentHazard基准含2653个实例,评估计算机使用代理的累积性有害行为。实验发现当前系统高度脆弱,Claude Code攻击成功率达73.63%。
SAGE:面向结构感知联想记忆的自演化智能体图记忆引擎
图记忆作为动态长期记忆,写者构建、读者检索反馈,自演化提升多跳问答与检索效率。
BixBench3:在科研级计算生物学任务上评测AI智能体
BixBench3评测AI智能体端到端完成计算生物学研究的能力:20项任务中前沿模型得分仅0.00–0.48,数据量越大、步骤越多,表现越差。
ScholarStack:面向科学智能体的分层研究资产编排与跨任务复用
该系统将论文集编译为分层可溯源研究资产,支持科学智能体跨任务复用,提升跨论文任务质量并降低查询开销。
多智能体大语言模型辩论究竟改变了什么?对分歧与答案质量的分层分析
多智能体辩论易改变智能体的表态,但缺乏持久立场变化与最终答案质量提升的证据。
极限核 Q(λ):弥合短视界与长视界
提出极限核Q(λ)离策略价值估计器,融合n步截断与极限核长视界近似,复杂度同n步,长视界任务优于基线。
重写而非仅蒸馏:面向持续视觉语言模型后训练的参考驱动修订
让模型以专家答案为参考修订自身错误轨迹,校验通过后微调,新任务提升56.9分且遗忘降低11.3倍。
TARL:面向长期智能体可执行记忆管理的事务感知可靠账本
TARL将记忆更新细化为五种可执行动作,借对比式训练提升动作预测与状态恢复,减少记忆污染并保留冲突证据。