GroundedGEO:审计生成式搜索排名中的证据缺口
构建证据配对基准与声明级重排器,审计生成式搜索排名中文本难辨真伪证据的缺口。
你已经看够了:面向机器的质量约束图像编码
面向机器的图像编码中,约束人眼质量至目标水平,余量提升任务性能;较无约束优化省22.82%码率且不增复杂度。
WILSON——用于患者级分析和诊断文本生成的病理学基础模型框架
WILSON以多放大合成图像建模病例,经病理报告监督,实现患者级诊断分析与文本生成,性能优、计算省。
基准评测 Neural Defend ARCAS 1B:一个基础多模态深度伪造检测模型
跨基准评测 Neural Defend ARCAS 1B,不调参,区分原生与汇总指标,揭示覆盖与类别差异,强调可追溯协议而非排名。
Rachel:通用语言模型指导并修正逆合成路线
Rachel让通用LLM无需搜索策略即可指导并修正逆合成路线,并在多个基准高比例闭环。
基于FinBERT的金融情感分析及其在股票走势预测中的应用
用FinBERT情感分析与LSTM预测股市走势,效果优于BERT、LSTM及ARIMA。
儿童如何设计并推理可信赖的AI聊天机器人
8-18岁儿童设计119个聊天机器人;年幼者视可信为达成目的,年长者重透明校准,提炼七维设计。
VLAQuantBench:视觉-语言-动作模型训练后量化的闭环评估
VLAQuantBench闭环评测VLA训练后量化,精度选择依赖层范围、格式与校准,给出具体配置。
间接临界转变:AI智能体群体中的社会攻击面
间接临界转变可借中间平衡态降低对抗少数阈值、绕过多数要求,凸显AI智能体群体的社会攻击面。
面向地月空间轨道相对运动的Transformer启发轨迹优化
提出双向推理ART-TWIN,从初末状态各生成轨迹弧并在中点拼接,为地月交会对接的序列凸规划热启动,加速收敛、提升可行性。
3D场景交互理解中的几何与语义耦合
提出Segment-Snap,耦合部件与把手的几何及语义以理解3D交互,无需运动回归,显著提升运动与把手AP。
大语言模型中的自指:递归自我改进的内省阈值
类比冯·诺依曼复杂度阈值,论证LLM可持续递归自我改进依赖内省;当前模型仅有准内省,受结构瓶颈所限。
基于自嵌入隐写术的免训练部分语音篡改主动防御
利用自嵌入隐写,将压缩语音嵌入自身,无需训练即可检测并恢复部分深度伪造语音,补充被动防御。
ASLEval:测量 LLM 智能体会话中的隐私暴露位移
提出隐私暴露位移与ASLEval框架,揭示局部评估漏报暴露,主张基准兼顾隐私与任务效用。
PAVE:面向世界-动作策略的预测对齐与价值引导进化
PAVE 将预测对齐与价值引导进化用于世界-动作策略,在三个仿真基准上取得最佳综合性能。
位置至关重要:令牌缩减与混洗下 ViT 拆分推理中的特征反演攻击
ViT拆分推理中,令牌混洗仅有表面隐私,令牌缩减仍会泄露;SARA可重建图像,轻量边缘防御可有效抵御且保持精度。
保持在攻击路径上:面向长时程自动化渗透测试的结构化状态
提出Intentest,将长时程状态外化为事实-意图DAG,引导渗透测试,CTF成功率88.2%,难题75%。
从瞬时情绪推断到持续情绪支持:一项纵向研究中陪伴智能体的评估
19人14天1093次会话评测PAIR:情绪估计贴合自评效价,引导后效价提升,感知帮助随时间渐增。
检测大语言模型中的幻觉:追踪受损上下文共享的拓扑特征
利用注意力图拓扑与曲率检测大模型幻觉,发现受损上下文共享是关键成因。
AI辅助精神科问诊的临床医生本位质量保障
构建临床医生本位的AI精神科问诊评估平台,以患者模拟器试点:LLM信息回收率高,但无据推断多、安全关切少。
TinyCeNN-LM:以受CeNN启发的细胞循环层实现预训练注意力的质量门控转换
提出质量门控后训练转换,用CeNN启发循环层替换预训练注意力,接受/回滚验证,保质量减缓存,非通用加速。
解耦微调大语言模型中的内部表征变化与因果重要性
微调改变LLM内部表征,但关键组件层分布与最大表征变化层不相关;跨任务组件重叠未必迁移,甚至性能下降。
智能体能否借助更高层次的抽象设计出更好的芯片?
AHRR融合智能体HLS设计与HLS后RTL精化,11项基准上较直接RTL设计平均提速2.6倍。
在类ARC任务中利用测试时任务嵌入进行隐式规则归纳
两步测试时训练先微调任务嵌入、再冻结它微调骨干,使嵌入更对齐潜在规则,提升ARC类任务表现。
LEGIT:面向可信AI智能体市场的资质认证协议
LEGIT协议融合认证、声誉与市场分配,将任务质量与成本绑定到智能体配置并签名存证,便于买家核验比较。
AI-GRACE:智能体AI的用例操作化框架——从组织目标与义务到部署能力与架构
提出AI-GRACE框架,连接组织治理与技术实施,涵盖目标义务、七域风险、保障控制证据,指导部署能力与架构。
PlaceReasoner-Beta:推理驱动的宏单元布局与基准测试
提出验证器引导的多智能体宏布局框架,将布局重构为闭环推理,并开源基准,布线后TNS最高降低61.2%。
CogGym:迈向人类与机器认知的大规模对比评估
CogGym标准化258个认知实验,评估50个大模型:模型越大越像人,但常识推理提升远慢于数学编程。
GameASG-Bench:面向游戏开发的自主软件生成基准测试
提出GameASG-Bench,将行为测试纳入游戏生成,含47项任务与L1/L2检查;九种智能体最高平均L2通过率93.2%,严格成功率仅55.3%,暴露合规缺口。
基于多粒度SSM的双兴趣序列产品推荐
提出双兴趣跨SSM模型,长短期兴趣分别用Mamba与时间调制SSM编码,残差融合提升推荐性能。
面向空中作战决策支持的离线多模态大语言模型
离线多模态大语言模型在无网受限空中作战中提供可溯源决策支持;试点显示得分媲美人类且耗时更短。
在寄存器上驾驶,在风险上推理:面向基于寄存器的端到端自动驾驶的风险感知占用
RRDrive引入风险感知占用表示,以全局结构引导和候选风险查询优化轨迹生成与选择,PDMS达0.951。
学习优化:AI原生网络缺失的架构层
学习优化是AI原生网络缺失架构层,将优化算法转为离线知识生成器,训练神经代理实现低延迟近优推理。
超越准确率:面向结构化虚假招聘帖子检测的质心引导对比损失
提出质心引导对比损失CGCL,以质心驱动top-k推拉统一分类与聚类,在EMSCAD上达SOTA。
通过L0正则化混合专家加速稠密大语言模型
提出L0-MoE,用L0正则化轻量混合专家加速稠密大模型,提速达2.5倍且性能几乎无损。
GUARD:通过引导式答案-推理蒸馏实现大型推理模型的自然遗忘
针对大型推理模型遗忘后轨迹缺失导致幻觉等问题,提出GUARD引导蒸馏方法,构建安全退出轨迹并引入自然遗忘推理评分,有效减少不安全泄露且保持推理效用。
面向时间序列异常检测的大语言模型生成特征池
用多模态大模型按领域生成时序异常检测特征池,与手工池互补,并集性能达0.588,匹配榜首。
Transformer 中的世界建模
机制分析表明,模型能表征路口街道、追踪位置并以目标罗盘导航,失败源于叠加特征干扰;世界建模能力分阶段涌现。
先倾听,再说话:基于听者面部反应的对话语音生成应答规划
提出ReACT-TTS,用听者预反应面部序列规划对话语音情感韵律;实验显示时间建模更优,可补益应答规划。
心电图海市蜃楼:揭示并缓解视觉语言模型在临床预测中对心电图利用不足的问题
提出“心电图海市蜃楼”:视觉语言模型临床预测中忽视或误用患者心电图,并用视觉提示微调有效缓解。
EnterpriseVal:量化企业级生成式AI的效能、可靠性与价值
提出企业用例级生成式AI评估系统EnterpriseVal,以指标、分级门槛和盲评判断落地价值与可靠性,并在银行试点验证。
接下来该问什么?部分证据下的检索感知问题学习
提出检索感知在线强化学习框架RAVEL,以问答-检索全流程排序反馈优化提问策略,在部分证据下逐轮提升检索性能。
AutoViewMem:面向对话长期记忆的自配置正交视图
将长期对话记忆组织为自配置、低重叠语义视图,在写入时解耦语义,提升长程问答与个性化。
语言模型的测谎测试:读取模型不愿揭示的知识
PIR探针从模型内部状态读出其是否知晓答案,无需参考模型,能区分隐瞒与无知,可支持审计与遗忘验证。
CodeMidas:从代码本身扩展智能体编码强化学习环境
CodeMidas仅以源码为输入构建可执行RL环境,生成5,545个任务,训练后多项编码基准显著提升。
Designer-RSI:从用户流量中演化程序性记忆,实现智能体图形设计
冻结模型借230余工具操作设计软件,程序记忆自主扩充修正;五轮无标注实验使成功率72.7%→99.3%。
可信的FinAInce:解析AI中介的金融建议如何被评判
285人随机实验:建议风格主导信息与安全评价,专家标签提升可信度,评价可预测质量、信任与采纳意愿。
基于位姿注意力的视觉导航Transformer
以相机位姿为位置编码,注意力依赖位姿差而非时序,HM3D点目标导航成功率达93.3%,抗噪更强。
用于scRNA-seq插补的混合计算智能框架:整合scRecover与随机森林
提出SCR-MF两阶段流程,结合scRecover检测与missForest插补,性能稳健,兼顾精度与效率。
用于日冕仪后波前控制的强化学习
采用强化学习实现日冕仪后波前控制,基于焦平面图像驱动变形镜,成功生成暗区并接近传统方法性能。