使用大语言模型理解临床认知对话
构建8250句认知评估对话语料,标注56类对话行为,并基准评测大模型的细粒度分类与生成能力。
评估自动语音识别中的机器遗忘
研究ASR机器遗忘:梯度上升法隐私-效用均衡好,复杂法过度遗忘,常规评估不足,序列与同时遗忘更差。
未知并非正常:将语言模型抽取与规则决策逻辑分离以计算临床风险评分
分离三态抽取与确定性决策逻辑,仅追问关键问题:提问减半、准确率99.4%,避免漏诊,小模型亦适用。
并非每一项都增添新结构:面向符号回归的 Sobolev 新颖性
提出项级Sobolev新颖性度量与无调参阈值,识别结构冗余,揭示符号回归差距,并可插件提升性能。
联合学习图结构与节点嵌入:面向异配节点分类的分类器无关重连
亲和度引导重连,联合估计图与嵌入,输出分类器无关的重连图与节点嵌入,异配分类平均提升5.8点
AnchorRep:通过表征排斥防御大语言模型跨模型对抗迁移
AnchorRep以表征排斥,让有害提示内部表征远离锚模型,跨模型迁移攻击成功率降至1.1%以下。
稳定动态低秩训练
提出SDLRT,通过补偿被忽略的奇异方向并稳定秩,解决动态低秩训练高压缩崩溃问题。
面向印度语言的词相似度数据集:标注与基线系统
发布六种印度语言人工标注词相似度数据集,并用最新模型给出三种语言基线。
基于预训练语言模型的近缘印欧语言间语言距离量化测量:以北日耳曼语支为例
用预训练模型从语义、正字、可预测性量化北日耳曼语距离,丹麦语-挪威语最近,与历史结论吻合。
忠实激活言语化:减少大语言模型表征解释中的幻觉
AVPO两阶段框架:从激活重构文本并评估,再以DPO优化,提升语义与字词保真,减少幻觉。
谁获得一个词元,它又承载着什么?大语言模型中不平等的姓名支持与概念可及性
匹配姓名并非等价词元输入;姓名支持不均会系统影响大模型概念可及性,并在招聘、贷款等任务中造成偏差。
面向最大公共边子图的等变神经原始-对偶分配
提出ENPDA,学习共享等变原始-对偶匹配策略,无需重训即可求解最大公共边子图,速度快约千倍且精度提升。
基于约束经验权重分布的量化感知预训练
提出无超参无内存开销的CEWT,约束权重经验分布为零均值高斯,抑制量化预训练振荡噪声,降低困惑度。
基于随机算子草图的极快紧凑二值图表示
超快二值图哈希:随机列采样近似高阶结构并标签安全传播;十数据集精度超无特征基线,亚秒生成适配脉冲网络
Distance-KV:利用相对距离实现高效长上下文推理
Distance-KV按层、注意力头和相对距离学习静态KV保留模式,免在线打分,128K下内存降65.4%、解码提速1.66倍,性能领先。
通过(高效的)LLM引导剪枝构建更优的最近邻图索引
提出LGP框架,用LLM推理剪枝改进ANN图索引,缓解几何-语义错配,提升检索性能。
ARCagent:面向临床问答的自适应检索校准智能体
针对ME/CFS指南矛盾,提出自适应检索校准智能体ARCagent,冲突感知重排证据,准确率达95.3%。
工程化简洁:简单的机制接口引导LLM智能体
比较拍卖与匹配界面发现,顺序界面显著减少出价偏差;说明收益与真实性可改善选择,但语言解释未必同步提升。
超越可读性:统一视频生成中的视觉文本渲染与原位编辑基准评测
提出VidScribe基准,覆盖四类视频文本生成与编辑,评测11系统,揭示编辑瓶颈并提供训练信号。
将推理路径重新思考为阶段结构化轨迹
提出PAIR:视推理路径为题内阶段结构化轨迹,按进度对齐阶段,仅同题同阶段比较成败轨迹,提取质量方向。
并非每次修正都有益:增益引导的持续测试时自适应
GAIN无反向传播,以增益决定历史修正强度,兼顾精度与校准,ImageNet-C达61.9%。
人格剂量:用于分级特质控制的校准激活引导
通过特质描述与请求强度,校准激活引导实现分级人格控制,提升核心特质表达并降低目标误差。
CrossTimeEdit:跨越十年的跨视角数据集与面向历史街景生成的奖励引导编辑
构建跨十年、11城、4.3万组的跨视角街景数据集,提出奖励引导编辑式生成模型,性能提升17.12%。
关系型基础模型在上下文学习中的支持集目标泄漏:影响、检测与缓解
关系型上下文学习中,支持集目标泄漏致性能下降;目标表泄漏最明显,积分梯度可检测并部分缓解。
从检索到推理:基于细胞绘画图谱的智能体作用机制预测
PhenoAIR将细胞绘画MOA预测转为校准证据推理,用可靠性感知多智能体精炼,优于检索与LLM基线。
关系型基础模型在上下文学习中的支持集目标泄漏:模型依赖性与评估可靠性
关系型上下文学习中支持集目标泄漏损害评估,效应依任务与模型而变并可反转结论,检测去除难恢复洁净评估。
AffectReveal:超越视觉表象的事件锚定情感识别
提出事件锚定情感识别,构建基准,并推出免调优框架AffectReveal,借事件证据校验提升识别。
超越二元偏好:面向肢体运动描述的分级偏好优化
提出FlexBench与GPA评分,设计GM-DPO分级偏好优化,减少肢体描述错误与幻觉。
OCA:面向图像到点云配准的ODE驱动交叉注意力
提出ODE驱动交叉注意力OCA,缓解图像到点云配准注意力歧义,召回率最高提升15%。
复用还是重学?地球观测基础模型的谱视角
谱诊断显示:地球观测模型微调时更新更大、保留预训练结构更少;预训练子空间保留处,少量参数微调即可媲美全量微调。
大语言模型并非随机鹦鹉:来自类人造语言任务的意义中介抽象证据
类人造语言任务表明,大模型无示例仍能依约束做意义中介抽象,反驳强随机鹦鹉假说。
FocusVTC:基于自适应分辨率的高效高性能视觉文本压缩
FocusVTC以自适应分辨率压缩视觉文本,2.9倍压缩下大幅提升性能并保持多模态能力。
安全算子:通过谱优化调节安全指令的表达
上下文token可吸收为乘性算子;其主特征值可连续调节安全指令影响,权衡攻击成功率与过度拒绝,实现帕累托改进。
SIFT:通过语义不变性与结构保真度微调增强时间序列基础模型
提出SIFT,用语义不变对抗增强与组件结构保真微调,缓解过拟合和均值陷阱,显著提升TSFM性能。
VLM4Cluster:视觉-语言预训练时代的深度聚类基准评测
VLM4Cluster基准评测17种方法与20个数据集,语言辅助聚类提升效果与泛化,细粒度场景增益有限。
ZK-LLM 下的比特:面向可验证隐私大模型推理的零知识友好量化评估
LLM零知识友好量化研究:激活精度比权重敏感,非线性查表易致效用退化;降位宽未必成比例节省证明开销。
为推理扩展视频生成:代价几何?
研究视频生成扩展能否推理隐藏信息及代价;MSE不保证推理,小模型低算力更准,符号监督显著提升。
用于高鲁棒性车载远程光电容积脉搏波的逐像素曝光
提出PixExpo:按循环曝光序列采集并逐像素非迭代融合,选取最接近rPPG目标强度的观测,大幅提升车载心率监测鲁棒性。
STAMP:无需目标数据预测分布外泛化能力
STAMP无需目标数据,仅用源域图像估计OOD性能:胸片相关性0.85,ImageNet上0.98。
MAS-OPD:面向多智能体系统的同策略蒸馏
MAS-OPD以角色优势特化与特权归因协调,将协作信息转为同策略蒸馏监督,实现清晰分工与高效协作。
同家族同策略蒸馏的缩放特性
研究同家族同策略蒸馏的缩放规律:弱到强迁移中学生峰值可超教师,峰值与迁移斜率服从幂律。
SALMONN-duo:面向全双工语音智能体的自适应双系统协同
提出自适应双系统全双工语音智能体:快系统实时交互并按需委派慢系统,提升推理与多轮任务表现,优化成本。
USA:面向语言智能体跨域在线策略蒸馏的更新感知SAM
USA将预热更新幅度转为逐坐标扰动半径,缓解跨域在线策略蒸馏更新耦合与负迁移,六方向均超单域基线逾4分。
面向开放式文本生成的连贯性感知分布评估
CHORD用冻结大模型隐状态与RBF-MMD比较文本分布,灵敏检测全局连贯缺陷,排名更贴合人类判断。
GUI 并非状态:诊断 GUI 世界模型中的状态混叠
GUI 世界模型仅凭可见界面会导致状态混叠;提出诊断基准与轻量状态恢复,可提升预测与下游性能。
BiasReducer:面向奖励模型的自适应偏差缓解
BiasReducer 轻量编辑奖励模型线性头,自适应选择并消减表面属性偏差,提升鲁棒性,减少冗长与迎合。
过度个性化是一种决策失败:大语言模型中的生成诱发应用偏差
LLM过度个性化是决策失败:生成目标诱发应用偏差,按logit减去偏差标量可减少泄漏并保持满足。
预测AI相关主要半导体企业供应链风险的财务影响:一种异构图补丁Transformer方法
提出异构图补丁Transformer,融合基本面与贸易、事件信号,预测116家AI半导体企业未来1-2季度财务变化,误差最低。
ReScraper:面向高效LLM预训练的统一网页数据抓取与清洗
0.6B模型ReScraper统一抓取与清洗网页,替代启发式规则,显著提升LLM预训练语料质量。
大规模脑电基础模型基准评测:来自两万次评估的经验
EEG-Arena 基准显示,脑电基础模型多数任务优于监督基线,扩大预训练数据是持续提升的关键方向。