错觉真相还是单纯曝光?基于大语言模型的社交媒体模拟中的模型依赖性重复效应
四款LLM社媒模拟中重复效应因模型而异:或现错觉真相、或单纯曝光、或无效应;温度无影响。
重新构想视频动态
RVD通过自监督重建,从视觉上下文中解耦出可编辑的动态令牌,实现语言引导的动态编辑与重渲染。
ThuRunel:面向结构化咨询对话的动态解耦
提出ThuRunel咨询智能体,以动态解耦衔接共情引导与专家判断两阶段,提升信息采集与转介质量。
面向数据系统的 AI 软件工厂
构建 AI 软件工厂,加速数据系统研发全周期并以元数据自我改进;微软部署实现 3 倍工程效率、22 倍 token 效率。
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
提出ThinkingGuard,逐步风险归因检测多模态大模型隐式危害,构建TriggerBench
面向连接组学突触检测与校对的视觉语言模型基准评测
视觉语言模型在连接组学突触检测与校对:零样本近随机,微调后开源模型追平专家,跨物种合并错误识别更优。
PILLAR:面向增强检索的隐私保护倒排索引词法查找
PILLAR是隐私保护RAG系统,用稀疏PIR倒排索引过滤加稠密重排,服务器不知查询词与访问模式。
时间步加权:实现有效基于ELBO的流匹配强化学习的隐藏关键
研究ELBO流匹配强化学习的时间步加权,发现其有效权重取决于奖励与学习阶段,并提出更优加权策略。
RewardExplainer:从反事实偏好反馈中学习奖励模型解释
提出RewardExplainer,借反事实反馈训练可复用解释器,生成可干预评分机制,提升忠实度并助力去偏。
迈向大语言模型中信念稳定性的分级度量
提出分级信念稳定性指标,基于内部表征估计条件信念,发现低稳定性信念更易在对话挑战下动摇。
医学视觉语言模型为何未充分利用其视觉编码器:皮肤科视角
医学视觉语言模型未充分利用视觉编码器,皮肤科中编码器显著更强;描述后决策与编码器辅助重排可改善。
Opera:面向长周期编程智能体的语言评论家框架
Opera将每次纠正作为持久批注并跟踪至问题解决,择机审查、诊断并核验反馈,显著提升编程智能体解决率。
SCCM:面向ERP稠密特征对应的球面一致粗匹配
SCCM通过球面先验在粗匹配阶段校正ERP的拓扑、度量与面积三重畸变,显著提升稠密特征匹配精度。
直觉向量
冻结视觉模型嵌入的潜在向量算术可支持跨领域隐式规则推理,无需微调或生成模型。
FM-ReID:面向目标重识别的选择性竞争令牌路由
提出FM-ReID,以选择性竞争令牌路由挖掘局部判别线索,联合整体表示提升多类目标重识别。
使用大语言模型理解临床认知对话
构建8250句认知评估对话语料,标注56类对话行为,并基准评测大模型的细粒度分类与生成能力。
评估自动语音识别中的机器遗忘
研究ASR机器遗忘:梯度上升法隐私-效用均衡好,复杂法过度遗忘,常规评估不足,序列与同时遗忘更差。
未知并非正常:将语言模型抽取与规则决策逻辑分离以计算临床风险评分
分离三态抽取与确定性决策逻辑,仅追问关键问题:提问减半、准确率99.4%,避免漏诊,小模型亦适用。
并非每一项都增添新结构:面向符号回归的 Sobolev 新颖性
提出项级Sobolev新颖性度量与无调参阈值,识别结构冗余,揭示符号回归差距,并可插件提升性能。
联合学习图结构与节点嵌入:面向异配节点分类的分类器无关重连
亲和度引导重连,联合估计图与嵌入,输出分类器无关的重连图与节点嵌入,异配分类平均提升5.8点
AnchorRep:通过表征排斥防御大语言模型跨模型对抗迁移
AnchorRep以表征排斥,让有害提示内部表征远离锚模型,跨模型迁移攻击成功率降至1.1%以下。
稳定动态低秩训练
提出SDLRT,通过补偿被忽略的奇异方向并稳定秩,解决动态低秩训练高压缩崩溃问题。
面向印度语言的词相似度数据集:标注与基线系统
发布六种印度语言人工标注词相似度数据集,并用最新模型给出三种语言基线。
基于预训练语言模型的近缘印欧语言间语言距离量化测量:以北日耳曼语支为例
用预训练模型从语义、正字、可预测性量化北日耳曼语距离,丹麦语-挪威语最近,与历史结论吻合。
忠实激活言语化:减少大语言模型表征解释中的幻觉
AVPO两阶段框架:从激活重构文本并评估,再以DPO优化,提升语义与字词保真,减少幻觉。
谁获得一个词元,它又承载着什么?大语言模型中不平等的姓名支持与概念可及性
匹配姓名并非等价词元输入;姓名支持不均会系统影响大模型概念可及性,并在招聘、贷款等任务中造成偏差。
面向最大公共边子图的等变神经原始-对偶分配
提出ENPDA,学习共享等变原始-对偶匹配策略,无需重训即可求解最大公共边子图,速度快约千倍且精度提升。
基于约束经验权重分布的量化感知预训练
提出无超参无内存开销的CEWT,约束权重经验分布为零均值高斯,抑制量化预训练振荡噪声,降低困惑度。
基于随机算子草图的极快紧凑二值图表示
超快二值图哈希:随机列采样近似高阶结构并标签安全传播;十数据集精度超无特征基线,亚秒生成适配脉冲网络
Distance-KV:利用相对距离实现高效长上下文推理
Distance-KV按层、注意力头和相对距离学习静态KV保留模式,免在线打分,128K下内存降65.4%、解码提速1.66倍,性能领先。
通过(高效的)LLM引导剪枝构建更优的最近邻图索引
提出LGP框架,用LLM推理剪枝改进ANN图索引,缓解几何-语义错配,提升检索性能。
ARCagent:面向临床问答的自适应检索校准智能体
针对ME/CFS指南矛盾,提出自适应检索校准智能体ARCagent,冲突感知重排证据,准确率达95.3%。
工程化简洁:简单的机制接口引导LLM智能体
比较拍卖与匹配界面发现,顺序界面显著减少出价偏差;说明收益与真实性可改善选择,但语言解释未必同步提升。
超越可读性:统一视频生成中的视觉文本渲染与原位编辑基准评测
提出VidScribe基准,覆盖四类视频文本生成与编辑,评测11系统,揭示编辑瓶颈并提供训练信号。
将推理路径重新思考为阶段结构化轨迹
提出PAIR:视推理路径为题内阶段结构化轨迹,按进度对齐阶段,仅同题同阶段比较成败轨迹,提取质量方向。
并非每次修正都有益:增益引导的持续测试时自适应
GAIN无反向传播,以增益决定历史修正强度,兼顾精度与校准,ImageNet-C达61.9%。
人格剂量:用于分级特质控制的校准激活引导
通过特质描述与请求强度,校准激活引导实现分级人格控制,提升核心特质表达并降低目标误差。
CrossTimeEdit:跨越十年的跨视角数据集与面向历史街景生成的奖励引导编辑
构建跨十年、11城、4.3万组的跨视角街景数据集,提出奖励引导编辑式生成模型,性能提升17.12%。
关系型基础模型在上下文学习中的支持集目标泄漏:影响、检测与缓解
关系型上下文学习中,支持集目标泄漏致性能下降;目标表泄漏最明显,积分梯度可检测并部分缓解。
从检索到推理:基于细胞绘画图谱的智能体作用机制预测
PhenoAIR将细胞绘画MOA预测转为校准证据推理,用可靠性感知多智能体精炼,优于检索与LLM基线。
关系型基础模型在上下文学习中的支持集目标泄漏:模型依赖性与评估可靠性
关系型上下文学习中支持集目标泄漏损害评估,效应依任务与模型而变并可反转结论,检测去除难恢复洁净评估。
AffectReveal:超越视觉表象的事件锚定情感识别
提出事件锚定情感识别,构建基准,并推出免调优框架AffectReveal,借事件证据校验提升识别。
超越二元偏好:面向肢体运动描述的分级偏好优化
提出FlexBench与GPA评分,设计GM-DPO分级偏好优化,减少肢体描述错误与幻觉。
OCA:面向图像到点云配准的ODE驱动交叉注意力
提出ODE驱动交叉注意力OCA,缓解图像到点云配准注意力歧义,召回率最高提升15%。
复用还是重学?地球观测基础模型的谱视角
谱诊断显示:地球观测模型微调时更新更大、保留预训练结构更少;预训练子空间保留处,少量参数微调即可媲美全量微调。
大语言模型并非随机鹦鹉:来自类人造语言任务的意义中介抽象证据
类人造语言任务表明,大模型无示例仍能依约束做意义中介抽象,反驳强随机鹦鹉假说。
FocusVTC:基于自适应分辨率的高效高性能视觉文本压缩
FocusVTC以自适应分辨率压缩视觉文本,2.9倍压缩下大幅提升性能并保持多模态能力。
安全算子:通过谱优化调节安全指令的表达
上下文token可吸收为乘性算子;其主特征值可连续调节安全指令影响,权衡攻击成功率与过度拒绝,实现帕累托改进。
SIFT:通过语义不变性与结构保真度微调增强时间序列基础模型
提出SIFT,用语义不变对抗增强与组件结构保真微调,缓解过拟合和均值陷阱,显著提升TSFM性能。
VLM4Cluster:视觉-语言预训练时代的深度聚类基准评测
VLM4Cluster基准评测17种方法与20个数据集,语言辅助聚类提升效果与泛化,细粒度场景增益有限。