PreLort: 面向秩异质性联邦微调的前缀嵌套LoRA
PreLort通过前缀嵌套低秩和分段聚合,实现异构秩客户端高效共享任务信息,提升精度与ROUGE-L。
你的“专业”大模型订阅可能实际上是“免费”的:揭露LLM推理服务中的指纹欺骗风险
提出指纹欺骗攻击,证明用户资源限制使指纹易被绕过,设计GhostPrint框架低成本让弱模型模仿强模型,揭露LLM指纹验证漏洞。
基于LLM的虚拟人口需求模拟与定价
LLM驱动虚拟人口模型,利用非结构化信息生成需求分布,支持平均收益与风险意识定价决策。
快速毒化:针对快速响应框架的实用投毒攻击
仅1%毒化率即可实现近100%假阳性与96%假阴性,通过提示注入攻击快速响应训练管道。
SCAR:面向RAG高效上下文扩展的语义连续性感知检索
SCAR自适应策略权衡相关性与连续性,碎片查询召回92.8%,块数减少22.9%,跨模型通用且token减少27.1%。
面向数据受限语言模型预训练的数据增强方法
数据增强可缓解多轮训练过拟合,随机token替换及组合增强有效降低验证损失。
VisualClaw:面向物理世界的实时、个性化智能体
VisualClaw通过混合编码与技能进化,低成本高精度实现物理世界实时个性化智能体。
LiFT:基于线性规划局部搜索的过拟合可控Transformer模型
提出线性规划局部搜索框架,通过双层优化联合更新参数与超参数,有效控制Transformer微调过拟合。
Taylor-Calibrate:混合线性注意力蒸馏的原则性初始化
提出Taylor-Calibrate初始化方法,利用泰勒引导注意力统计设置学生参数,大幅减少蒸馏所需token并提升零样本性能。
QK归一化的MLA:无需完整键缓存的QK归一化
提出QK归一化与MLA兼容方法,无需缓存完整键,实现低延迟、高精度训练。
DoubtProbe:通过结构验证与语义审计的黑盒越狱防御
提出双分支防御框架,结合结构验证与语义审计,有效降低攻击成功率,保持低误报率,实现稳定防御。
daVinci-kernel:基于强化学习的技能选择、总结与利用协同进化,用于GPU内核优化
daVinci-kernel提出强化学习框架,三个共享LLM的智能体协同进化技能选择、生成与总结,在KernelBench超越先前最优模型。
生成式因果测试:连接语言神经科学中的数据驱动模型与科学理论
提出生成式因果测试(GCT)框架,利用LLM生成刺激解释大脑语言选择性,弥合数据驱动模型与科学理论差距。
关于时间:涌现通信中的时间引用
改变架构(批处理方法)可使95%以上智能体涌现时间引用,无需修改损失函数。
无信号选择,通过表达恢复:冻结小代码模型事后证伪算子的测量研究
事后验证算子对冻结小代码模型无提升,表达式恢复M1提升准确率,自适应共识早停ACE零损伤节省计算。
HK-LegiCoST:利用非逐字转录进行语音翻译
提出600+小时粤语-英语平行语料库,利用非逐字转录实现句子级对齐,在语音翻译上取得竞争性结果。
多模态评估者偏好崩溃:自进化智能体中的跨模态传染
多模态下评估偏好崩溃加剧,跨模态传染导致策略反转;交叉模型评估风险最高,自评估近乎免疫(97%零传染)。
良性多智能体系统中的错误信息传播
研究显示错误信息会降低单代理性能,但多智能体辩论可缓解,鲁棒性依赖群体组成与决策协议。
通过提示调优的大语言模型自动总结医患对话
本研究利用提示调优的大语言模型自动总结医患对话,GatorTronGPT-20B性能最优且计算成本低。
符号非形式化:流畅、高效、多语言
符号非形式化可靠转换形式数学为自然语言,使机器验证内容可读且精确,Informath项目基于Dedukti和GF实现多语言输出。
MyPCBench:面向个性化智能计算机操作助手的基准测试
MyPCBench测试个人助手在模拟真实桌面上的表现,最佳模型仅完成55.4%任务,个性化任务挑战大。
从最小标签扩展LLM推理:一种带有轻量验证器的半监督框架
用少量标注训练轻量推理验证器,结合熵阈值过滤生成高质量伪标签,微调后性能媲美10-15倍标注数据。
GePBench:评估多模态大语言模型的基础几何感知能力
GePBench基准测试揭示多模态大模型几何感知能力显著不足,训练数据能提升下游任务性能。
词元级熵揭示语言模型中的群体差异
零温度下,黑人名首个词元熵更高,女性名熵更低且输出更同质,种族性别效应独立,指令调优不减弱种族差距。
DRA-GRPO:你的GRPO需知多样推理路径以进行数学推理
提出DRA-GRPO,通过多样性奖励调整避免策略坍塌,仅用7000样本和$55成本,数学推理准确率达58.2%。
SimSiam命名游戏:一种用于涌现通信和表示学习的统一方法
SSNG以自监督表示对齐替代采样,实现无反馈的成对智体符号涌现,在视觉数据集上分类精度显著超越现有方法。
理解、检测与修复基于上下文学习的真实文本到SQL错误
首次系统研究基于上下文学习的Text-to-SQL错误,总结27种类型,提出MapleDoctor框架,修复率提升13.8%,延迟降低67.4%。
低资源多语言语音识别中面向层次Softmax的跨语言嵌入聚类
跨语言嵌入聚类构建层次Softmax解码器,共享相似token表示,提升低资源多语言ASR准确率
处理仇恨言论分类中的标注者分歧
研究标注者分歧的聚合方法,证明分歧是提升分类鲁棒性的宝贵资源,并在土耳其语推文中取得新最优结果。
基于理论极小极大博弈提升大语言模型安全性
提出极小极大强化学习框架生成多语言安全数据,理论收敛,小模型超越SOTA近10%,速度快4.5倍。
无所不可?语言模型中(不)可能语言学习的跨语言研究
探究语言模型能否区分自然语言与不可能语言:GPT-2小模型有部分人类归纳偏倚,但弱于人类。
映射11个大语言模型中的地缘政治偏见:对美中紧张局势的双语、双框架分析
使用平衡键控法消除同意偏差,测量11个LLM的地缘政治立场,发现语言和开发起源等三因素影响,中文语境下模型更亲中。
树状分支为何对GRPO的思路优势估计至关重要
树状分支通过增加每思路连续分支使方差以1/M趋零,而仅增加采样无法消除,故而是必要机制,实验验证其有效性。
隐藏的幽灵之手:揭示基于MLLM的移动GUI智能体中的后门漏洞
AgentGhost利用复合触发器对GUI智能体实施后门攻击,成功率99.7%,效用仅降1%,防御后降至22.1%。
LoLA:带有稀疏缓存的低秩线性注意力
LoLA通过三种记忆系统增强线性注意力,无需训练,长上下文检索准确率从0.6%提升至97.4%,缓存更小。
CentroidKV:通过KV缓存聚类实现高效长上下文LLM推理
CentroidKV分块交替聚类KV缓存,减少75%内存,加速解码1.92倍,吞吐量提升4倍。
LM-SPT:面向语音标记化的语言模型对齐语义蒸馏
LM-SPT通过语音再合成蒸馏,避免刚性对齐,提升语义与语言模型对齐,在ASR和TTS任务上表现更优。
ChildGuard:针对儿童仇恨言论的专用数据集
推出35万条儿童仇恨言论数据集,覆盖三个年龄段,最佳F1达82%。
MedSynth:逼真的合成医疗对话-笔记对
合成超万对医疗对话-笔记,覆盖2000余ICD-10码,提升双向生成性能。
语义保持的提示劫持:一种针对自动提示优化的黑盒对抗攻击
提出自适应贪婪局部搜索方法,在保持语义相似下最大化输出偏离,成功率更高。
生成式AI与科学计量学的未来:当前主题与未来问题
提出语义与语用维度框架,分析任务性质、粒度及目标类型等关键参数,强调需实证与理论反思以解读AI时代的科学文本变化。
ArFake:面向多方言阿拉伯语语音欺骗检测基准的鲁棒框架
提出首个多方言阿拉伯语欺骗语音数据集,评估发现FishSpeech生成最具挑战样本,但单一模型限制泛化性。
OBCache: 面向高效长上下文LLM推理的最优脑KV缓存剪枝
OBCache基于最优脑损伤理论,通过输出感知评分剪枝KV缓存,提升长上下文推理准确率。
RoSE:无需人工测试集的循环合成数据评估方法,用以选择LLM生成器
RoSE循环评估各LLM的合成数据,训练小模型取平均性能,无需人工测试集即可选出最优生成器,性能接近人工标注基线。
SPI:面向向量数据库中流式RAG的查询深度自适应索引
SPI通过语义金字塔自适应检索深度,实现低延迟流式RAG,延迟降低1.4-2.3倍。
答案自内求:自推导奖励赋能可解释关系抽取
提出 COGRE 推理框架与 HIT@DICT 奖励策略,自推导奖励解决无关 token 误导和抽象层次错位,F1 提升 23.46%,解释质量提升 54%。
智能体安全综述:应用、威胁与防御
首部智能体安全综述,涵盖应用、威胁与防御,揭示系统脆弱性需全生命周期防御。
建模讽刺性言语:语音合成框架中的语义和韵律线索
融合语义和韵律线索建模讽刺,实验证明二者互补增强感知,综合系统最佳。
少即是多:通过最小测试时干预提升大语言模型推理能力
发现推理不确定性集中在高熵token,提出无训练MTI框架,通过选择性CFG和轻量负提示指导,显著提升推理准确性和效率。
一个用于LLM辅助语料库标注的大规模流水线:英语consider构式的变异与变化
提出LLM辅助语料标注流水线,四阶段工作流,在英语consider构式上实现98%+准确率,发现新的变化轨迹。