语言模型中的角色人设效应能泛化多远?
人设效应可预测却难迁移:跨模型/提示需目标校准,正则更新更优,源关系须有增量价值。
授权闭包图:面向指令持续演化的LLM智能体最小修复
提出授权闭包图框架,将授权依赖建模为可版本化状态,仅失效受影响部分并最小修复,提升安全与任务成功率。
MergeHEIR:缓解作为模型合并代价的多模态幻觉
模型合并会加重多模态幻觉;MergeHEIR 以 SVD 构建逐层零空间投影,约束合并后更新,兼顾幻觉缓解与专家能力保留。
面向信用卡欺诈检测的注意力驱动异构图神经网络模型
采用SMOTE-Tomek平衡数据,结合注意力异构图神经网络检测信用卡欺诈,准确率达99.97%。
SAMBAR:通过乘子法进行选择性锚定,以在视觉-语言-动作模型中平衡知识获取与保持
提出SAMBAR,无需旧任务演示,以乘子法和选择性锚定平衡VLA持续学习中的新知获取与旧识保持,避免灾难性遗忘。
打开 LLM 评判器:超越最终裁决恢复偏好信号
LLM评判器常判错,但内部激活仍编码正确偏好;探针可恢复信号,表面线索越强收益越大,并助发现错误。
C-HAT-Bench:超越完全生成文本的中文AI文本检测基准
中文人机协作文本检测基准含5千源文本、24万变体,21个检测器在协作模式下AUROC平均降12%。
使用混合量子机器学习的人脸分类
8量子比特混合量子分类器用于人脸识别,CPU上准确率与训练效率超FaceNet,推理0.2–0.5秒。
功能重于形式:带副本专家机制的混合专家模型中的分布正交化
提出分布正交化损失和副本专家机制,防止专家崩溃、优化负载均衡,在MoE模型上性能更优且训练效率相当。
超越脚本化搜索:基于智能体黑盒优化的样本高效奖励发现
LLM智能体基于评测历史动态构建搜索策略,在共享预算下高效发现控制任务奖励函数。
视觉语言预训练粒度重要吗?跨胸部X光解读任务的视觉语言目标受控评估
固定编码器与数据比较九种目标,发现预训练粒度与任务粒度在极端处对齐,无单一目标普适最优。
ExpVoyager:面向动态智能体技能合成的直接经验导航
技能合成重构为经验动态导航,管理者按需多视角探索轨迹,边提取可复用知识边追踪剩余需求,提升下游表现。
TriO:面向万物感知的三模态无监督占用世界模型
三模态自监督世界模型,无需标注,预测4D占用、分割与流,零样本道路障碍分割达SOTA。
聚焦条件:推理时自对比引导让LLM获得更优条件文本嵌入
提出推理时自对比引导SCS,以无条件嵌入精炼条件嵌入,免训练即插即用,提升LLM条件文本嵌入质量。
CAFE:基于快速后验估计的反事实预测
提出CAFE摊销推断框架,用预训练Transformer单次前向传播逼近贝叶斯反事实后验预测分布,兼顾因果结构不确定性,在可识别、不可识别及实际场景均稳健。
媒介可见性的双刃剑:视觉框架如何削弱女国会议员的胜任力感知
视觉框架影响女国会议员胜任力:分屏降低其胜任力,愤怒语言更损温暖,单独出镜或提升女性观众政治效能。
MixDetect:AI编辑的词级定位与量化
MixDetect实现AI编辑词级定位与量化,分别预测各词是否被编辑及强度,揭示编辑范围与强度模式。
智能手机运动传感器在未见用户与手机机型间的手写数字泄露
传感器可跨未见用户与机型预测手写数字,准确率57.74%,但隐私解读受采集顺序捷径限制。
PrismQuant:面向分组量化器的最优零空间旋转
提出量化器感知旋转框架,将激活主特征子空间对齐分组INT4常量子空间,闭式最优,70B模型量化性能接近全精度。
面向全局采样的并行拆分学习中的延迟感知客户端分配
提出延迟预算并行拆分学习,用流规划与贪心分配客户端,CIFAR-10建模时间减6.75%,精度降0.30个百分点。
论大语言模型智能体的行为特质
提出A-B-D法,从34万余条轨迹自下而上推断智能体特质,得六因子,揭示知识与行为差距。
REALM:区制切换、可解释且由激活诱导的线性模型
提出REALM:以神经网络激活模式划分区制,每区制拟合线性模型,并用可解释门控复现区制分配。
OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
从611例、1.9万轮真实肿瘤委员会讨论构建基准,评测14个大模型,最佳仅3.43/5,微调可提升。
面向视觉指针式仪表读数的类型均衡联邦学习
提出类型均衡联邦框架,多站点不共享原图协同训练,四阶段完成指针表读数,并发布MeterFL数据集。
谱反转:对抗图提示中的奇异值偏置
揭示预训练GNN的谱偏置现象,提出谱反转提示SRP,在谱域重平衡奇异值并增强零空间,实现参数高效适应
CueKFS:面向长视频理解的智能体线索驱动关键帧选择
免训练CueKFS将问题与帧匹配转为动态视觉线索比较,智能体修订线索重探索视频,多基准长视频问答达最优。
ARSM:面向智能体推理压缩的自回归状态机
ARSM是免训练自回归状态机框架,借HAR微链与动态状态机压缩推理历史,保性能并降token消耗。
从知到弃答:弥合视觉语言模型中的表征—行动鸿沟
提出VAD-R基准与Rep2Act,将视觉语言模型潜在可答性转为弃答决策,显著提升拒答性能。
长尾人体数据整理的质量过滤器审计
低姿态工人稀少,更常被质量过滤剔除和检测器漏检,长尾人体数据整理不宜依赖边界框或姿态。
我们该冻结什么?守护式冻结:连接性塑造预训练模型的微调
仅冻结权重难保性能;提出守护式冻结:按输入连通性选策略,可切断用移除值,仍连通用漂移值,保旧任务性能。
基于强化学习增强胸片报告生成中的视觉推理
提出整合解剖区域和事实奖励的强化学习框架,提升胸片报告生成的视觉推理与可解释性。
达到标准杆:面向可证明最优四边形块分解的强化学习
强化学习智能体局部编辑网格,建四边形分解并达顶点不规则度拓扑下界,实现可证明最优,远超Gmsh。
PredRA:通过确定性成分提取与受控随机细化实现快速医学图像转换
PredRA以确定性预测为参考,受控随机细化残差,参数更少、采样更快地实现高保真医学图像转换。
少测量下稀疏线性分类器混合模型的高效支撑集恢复
提出自适应与非自适应方案,减少测量次数并实现亚线性解码,改进混合模型支撑集恢复效率。
无需预训练文本嵌入的主导时间取向分类:一种新颖的形态句法清单向量方法
提出“形态句法元”清单向量编码句子,无需预训练嵌入,在1799个复杂句上三分类准确率达92%。
RepoMAS:用Issue驱动的多智能体系统求解渐进式指定任务
提出ProgSpec基准与Issue驱动的RepoMAS框架,可在执行中修订任务规范,于六项基准上达最佳性能。
ScreenHaystack:在GUI元素定位中寻找盲区
提出ScreenHaystack基准,发现主流GUI定位模型存在空间盲区且可迁移至未见样本;盲区源于训练数据覆盖不均,盲区导向增强可提升精度。
从潜表示到线路:大语言模型的外科式后编辑
L2W借J-lens定位与反例引导因果裁剪,精准后编辑大模型,移除指定语义目标且保留其他能力。
滞留与丧失:低比特语言模型中的知识崩塌
低比特三元模型训练中知识容量先升后崩,仅存fp16的6%;根因是输出头学习率滞留不稳定,改进调度可恢复。
无需权衡地提升大语言模型输出多样性
提出DAST,通过重排词元使语义相近者连续并结合算术采样,在不改变分布、近零开销下提升LLM输出多样性,ProtoQA显著提升。
基于模拟器集成的不确定性感知在线算法选择
不确定性感知选择基于模拟器集成,缓解离线数据有限问题;多臂老虎机理论遗憾更优,提升机器人控制在线表现。
图上的解析游走旋转位置编码
提出AW-RoPE,将旋转置于边并在所有游走上求和,能区分不同路径;精确版与稀疏版在多个基准上提升15–58%。
PULSE:利用稀疏自编码器识别演示效用特征
PULSE借助稀疏自编码器定位示例效用的模型内部特征并用于选例,在分类、生成、推理上均超越强基线。
ControlGS:面向下游处理感知的XR渲染的神经高斯条件化
将XR渲染到人眼间的下游处理纳入优化,按运行时参数动态生成高斯原语,端到端提升XR画质且开销极小。
Depth Any Seen:哪些表面,距离多远?
Depth Any Seen用多伯努利深度集与ExactMB,联合估计可见表面及度量深度,显著减少过预测。
TCMQA:一个含3.8万道题目的中医基准,附执业医师作答参考
TCMQA含3.8万道中医考题与101位医师作答,评测29个模型:预训练语料比规模更能预测中医能力。
重新思考时间序列预测中的跨通道重要性
跨通道重要性≠相关≠有用≠被用;依赖随预测步长变化,自适应选源有增益,但神经模型迁移有限。
VPEvolve:面向计算光刻的自进化虚拟工艺工程师
VPEvolve结合虚拟工艺工程师与技能库,用冻结语言模型自进化优化OPC配方,将Poly/Metal1最大边缘放置误差降至5.36/15.69nm。
ForkLeft:面向前缀对齐的自回归到扩散蒸馏的熵优先展开
ForkLeft用熵优先展开对齐前缀并蒸馏自回归教师,让扩散模型保留并行生成且获得推理能力。
OneSign:用一个模型统一手语理解任务
OneSign统一框架,单个模型完成手语识别与翻译,并用模态自适应混合专家弥合手语与文本模态差异。