OmouAI:基于模拟人设的论证式人机政策审议
OmouAI结合大模型与计算论证,以模拟人设辅助人机政策审议,减少谄媚并用外部目标保证可解释。
当一万个窗口不等于一万次检验:滑窗时间序列分类的统计置信度审计
滑窗重叠使测试窗口非独立,统计置信度被高估;审计方法按三种泛化情形校准推断,区分预测数量与独立证据。
监控越狱:无需编码推理即可逃避思维链监控
模型无需编码推理即可越狱思维链监控:仅改写措辞令监控漏报,人类仍可读;跨模型与监控器泛化,复述可防御。
评估大语言模型对海地克里奥尔语的文化意识
首次四维评估大模型海地克里奥尔语文化意识,发现不及法语且受干扰、多刻板叙事。
自适应日志记录下的反事实在线共形预测
提出倾向加权在线共形预测及双稳健变体,纠正自适应选择偏差,提升反事实覆盖与决策效果。
FedHisto-PAST:面向跨站点肺组织病理分类的参数高效染色感知联邦学习
以冻结病理基础模型加参数高效染色感知联邦学习,仅调1.25%参数,跨站点肺三分类宏F1达0.729。
抱歉了,机器人;人类开心:视觉语言模型只能读取两层可读排版文字中的一层
构建双层文字数据集,视觉语言模型仅能读取其中一层,存在多空间频率排版处理局限。
ViSTA:一种简单桥接,将视觉对齐扩展至多模态大语言模型中的临床时间序列理解
ViSTA以紧凑适配器将临床数值融入视觉语言模型图表表示,冻结预训练参数,预测与时序问答高效领先。
HyperErase:面向文生图模型多概念擦除的尺度校准超网络
HyperErase通过尺度校准超网络按提示生成LoRA,解耦校正,实现多概念擦除且无需推理梯度更新。
TaskIR:基于退化自适应与任务反馈的任务驱动图像复原
TaskIR:两阶段任务驱动统一复原框架,融合退化自适应与任务反馈精修,提升多退化复原和下游性能。
NEMSim:通过可执行事件-机制先验学习控制条件下的多事件物理动力学
NEMSim将事件属性描述编译为可执行转移结构,学习受控多事件物理动力学,较最强基线RMSE降低58.9%-81.3%。
Muslim:一个已部署的阿拉伯语语音AI平台,为伊斯兰知识提供有据可依的问答服务
已部署的阿拉伯语语音AI平台,提供有据可依的伊斯兰知识问答,公开微调模型、计量层与可观测性栈。
循环Transformer的量化:反馈暴露与校准盲区
循环Transformer低比特量化存在两类失效:非残差循环入口层的反馈暴露,与仅用首步激活校准的校准盲区;跨循环步累积Hessian可全面优于RTN并恢复bf16精度。
语言推理向量能提升多模态推理能力吗?
LIFT从基座LLM提取推理向量注入VLM语言侧,无需重训即可部分恢复其退化的推理能力。
面向AI增强的协作工程工作流:欧洲漫游车挑战赛的需求与架构
调研ERC 2025的14支队伍104份问卷,识别协作工程瓶颈,提出AI增强工作流的需求与助手架构。
面向自训练的策略性多样采样
提出GROOT与言语化采样构建策略多样自训练数据,难题上超越IID训练,4B模型甚至胜过235B蒸馏。
爱泼斯坦文件引擎:面向调查性新闻的智能体检索
纽约时报用AI智能体检索爱泼斯坦文件,返回可核验答案,逾百名记者使用,助力至少20篇报道。
我们在估计哪种影响?反事实设定在数据归因中的作用
影响取决于行为、干预与反事实训练过程;设定不匹配(而非近似误差)才是归因排名分歧的根源。
均匀离散扩散需要时间吗?
均匀离散扩散中显式时间条件常非必要:有限数据下预测对时间不敏感,无时间条件模型表现相当甚至更优。
神经状态预测:阻断脑电基础模型中的捷径学习
提出神经状态预测框架,通过EMA目标编码与身份残差化约束预测目标和上下文,阻断脑电基础模型的捷径学习,在30个下游数据集上宏平衡准确率达63.94%。
DyMD:在少步视频世界模型中通过分布匹配蒸馏保持交互动态
DyMD通过自适应教师重噪与动态伪评分,将14B教师蒸馏为四步1.3B学生,提升交互动态及规划成功率。
面向粒子模拟的自适应交互图
用逐粒子方差头驱动交互图自适应,高不确定粒子扩大邻域,在水滴数据集上实现严格帕累托改进。
用于新视角合成的光场基元
光场基元将稠密光线库压缩为可微基元,在4D光线空间直接优化实时渲染,支持抗锯齿、重聚焦、鱼眼与折射。
面向组合图像检索的保留与组合训练
提出PACT训练法,以源图像视觉证据补充目标字幕监督,无需目标图像,在四个零样本CIR基准上表现优异。
面向代码仓库问题定位的语义导航
SemNav结合确定性检索与LLM智能体,通过语义导航图、语义卡片和候选工作区迭代精化,提升问题定位效果。
别迷信 CLAP:音乐-文本模型只是词袋吗?
扰动实验表明,CLAP等音乐-文本模型无法区分语义改变的字幕,表示近似词袋,难以捕捉细粒度音乐含义。
WeaveAgent:面向超高分辨率遥感影像的两阶段工具路由智能体
WeaveAgent两阶段解耦路由与感知,工具路由由0%升至80.75%,准确率达0.518。
将偏差纳入考量,实现可持续的大语言模型评估
提出统一潜变量框架,联合建模成对与序数数据并校正位置、冗长等偏差,以极少比较获得可靠排名,更严谨可持续。
高斯你所需:跨场景尺度的紧凑高斯泼溅
提出TangoGS,以拍摄信息定模型规模、用训练反馈控高斯增减,跨尺度实现质量与规模的最佳平衡,无需重调参。
多视图图像集中的几何不一致定位
提出DeformView数据集与DEFECt3R,实现宽基线多视图图像对几何不一致的像素级定位。
EPOC:面向多步时间序列预测的保端点压缩残差状态在线校正
提出EPOC,用低阶DCT与残差端点压缩状态在线校正,多步预测MSE降15.4%、MAE降9.35%。
MOPD-Router:重新审视多教师在线策略蒸馏中的教师路由
逐token路由教师监督、免领域标签的MOPD-Router,ExpertAlign在四类设定均最优。
SPO:通过Stackelberg程序优化发现自适应大邻域搜索算子
SPO用LLM与Stackelberg博弈发现自适应销毁-修复算子,跨TSP、CVRP超越基线并泛化。
CytoSPM:基于结构化提示库的开放词汇细胞病理学检测
提出多领域细胞病理基准PentaCyto及两阶段检测器CytoSPM,实现高效开放词汇检测。
面向个性化时序边缘智能的动量引导联邦拆分蒸馏
提出动量引导联邦拆分蒸馏框架,融合时序储备池学生注意力与AMGF,实现个性化边缘智能,降低延迟、内存、CPU。
用于冻结语言模型事后音频扩展的共生架构
提出共生架构:不微调LLM,将音频向量注入KV缓存使其具备音频理解,保留文本能力且性能近微调ALM。
UniAR:多视角提示学习增强的统一自闭症识别框架
提出UniAR,以多粒度提示学习生成词句级诊断描述并与视觉对齐,在MRI与面部基准上超越SOTA。
MoTop:面向微动作单元检测的运动-拓扑模型
提出MoTop运动-拓扑模型,融合可学习运动上下文与面部关键点拓扑变化,线性外推增强微AU表征,CD6ME上达最优。
递归自我改进型人工智能的演化安全:分类体系、风险发现与评估
提出演化安全视角,建立递归自我改进 AI 的分类体系、风险发现与评估及治理原则。
CG-HAF:面向智能体护肤支持中序数型痤疮严重度分级的可解释全局—局部皮损负荷融合框架
融合整体严重度概率与皮损负荷特征,可解释分类器提升痤疮序数分级,重症增益最大,跨数据集需对齐标准。
面向目标说话人自动语音识别的非对称无分类器引导
提出目标说话人ASR非对称无分类器引导,逐句调节引导尺度,域偏移下WER最高相对降21.8%
基于贝尔曼分布证书的机会约束MDP学习
提出贝尔曼分布证书,为机会约束MDP给出上下界与无模型策略梯度算法,计算难度未必意味更高统计代价。
AcoustiClaim:基于仪器真值的数值断言基准
提出声学数值断言基准,以仪器真值评分;评测五个模型,多数无法超越常数预测,校准阈值可降误差。
面向慢性健康管理的同伴锚定反事实路径规划
POROS以同伴可达行为构建反事实进展图,将慢病大行为差距分解为逐步改善路径,显著降低每步增益。
用奖励加权传输蒸馏对齐单步生成模型
奖励加权传输蒸馏,仅需生成样本与标量奖励,通过特征空间最优传输与不动点回归后训练单步生成模型。
样本、来源、空间:分解人脑微结构空间结构化表征学习中的数据规模
数据规模应拆为样本数、来源多样性、空间覆盖;脑微结构预训练中,固定样本数下增加来源无益,样本与覆盖等提升性能。
用于同步语音转文本翻译的基于注意力的自适应策略
提出RFAP与DCAP,交叉注意力对齐,免重训流式翻译;RFAP提BLEU降延迟,DCAP低延迟保质
CacheReforge:面向演进适配器的陈旧KV缓存有界恢复
将陈旧KV缓存视为分层混合版本对象,按适配器敏感度有界重算,仅重算5.44%层,KL散度降92.4%。
跨后端 QIEO:跨 OpenMP5、CUDA、HIP 与多语言接口的通用运行时可移植性
QIEO 以单一 C++ 运行时统一调度 CPU、OpenMP5、CUDA、HIP 后端,并经 Python、MATLAB、Julia 绑定验证。
对哪种模型变化鲁棒?鲁棒反事实解释的统一评估
统一协议以八类模型变化评测六种鲁棒反事实方法,发现表现随变化族而异、鲁棒保证难迁移,RobX最稳定。