隐喻追踪器:理论指导的隐藏状态分析
无需训练,单次前向传播,聚合/分化指标评测隐藏状态,追踪token在文本中的结构位置,支持关系性解读。
阶段重放发散跟随KV缓存:固定前缀精度控制与双向缓存移植
验证阶段重放假设,KV缓存决定发散,FP32无分歧,BF16有分歧;双向缓存移植使续写随供体,精度影响表现。
Change2Task:将仓库变更转化为可执行的编码智能体任务与环境
基于仓库历史,将合并PR转为可执行编码任务,验证成功率79.6%,较基线多恢复29.2%,节约10.8%成本。
VAD:多模态策略内蒸馏中面向目标重建的视觉证据归因
VAD通过反事实目标重建估计教师修正中的视觉证据,重建学生锚定目标,在细粒度视觉基准上优于直接蒸馏。
SVR:联合判定-置信度强化学习实现自适应测试时计算的自验证精炼
提出自验证精炼SVR,用自验证作为计算控制策略,数学推理平均2.99轮达0.563准确率,优于基线。
TCA-SIR:学习目标条件抽象实现科学灵感检索
TCA-SIR用目标条件抽象重构科学灵感检索,学习生成可迁移原理并预测适用性,性能超越现有方法且可解释。
基于DeCRIM的LLM自我修正:分解、批判与细化以增强多约束指令遵循
首个真实多约束指令基准RealInstruct,提出DeCRIM自我修正流程,提升开源模型多约束遵循,甚至超越GPT-4。
GradMAP:利用梯度度量与投影补偿的快速层剪枝
提出GradMAP,用梯度度量评估层重要性,仅需单步反向传播,投影补偿修复偏移,剪枝提速4倍且性能更优。
语言多样性:评估数字空间中非洲语言的使用与人工智能表现
研究非洲语言数字使用,发现新闻数据干净可靠,社交媒体代码混合,人工智能检测在新闻上准确,社交平台困难。
面向结构可解释的机器生成文本检测:一种图视角框架
提出图框架LM²otifs,将文本转为词共现图,用图神经网络检测并提取结构特征,比传统方法更忠实可解释。
CRMWeaver:基于智能体强化学习与共享记忆构建强大业务智能体
提出CRMWeaver,用合成数据与强化学习训练,推理时共享记忆,提升业务智能体效果与泛化。
选择还是投影?评估用于LLM训练数据解释的低维向量
比较组件选择与梯度投影构建低维表示,发现贪心选择组件子集在训练数据影响检索上更有效、计算更高效。
非洲经济问答基准:面向世界银行经济报告的定量与时间推理
基于220份世行报告构建含4309个证据链接问答的基准,测试检索增强系统的数值与时间精确性,最佳F1仅0.545。
AISPA:以用户为中心的大语言模型应用系统提示审计
提出系统提示审计框架,发现大模型产品保护性指令广泛但覆盖不全,约四成含损害用户指令,需加强透明监管。
MentorCollab:选择性大模型到小模型的推理时指导实现高效推理
提出MentorCollab,大模型选择性稀疏指导小模型,平均仅用18.4%昂贵token,性能提升3.0%,最高8.0%。
幻觉与真相:RAG、LoRA与DoRA的综合准确性评估
评估RAG、LoRA与DoRA:两万查询中DoRA准确率90.1%、相关度0.88、延迟110ms最优,并分析权衡。
LLM2Vec-Gen:从大语言模型生成嵌入
提出自监督方法,在LLM输出空间学习压缩其响应的嵌入,MTEB提升8.8%,并保留安全对齐与推理能力,且嵌入可解码回文本。
如何合成高质量预训练数据?提示设计、生成模型与源数据的系统研究
系统对比生成模型与源数据,发现结构化格式最优,超10亿参数无增益,FinePhrase降低30倍成本。
置信流形:语言模型中正确性表征的几何结构
语言模型正确性表征呈简单几何结构:2-8维质心可分,25样本达90%性能,干预可改幻觉率。
NorBERTo:使用3310亿词元语料训练的葡萄牙语ModernBERT模型
提出基于ModernBERT的葡语模型NorBERTo,用3310亿词元新语料训练,在PLUE和ASSIN2上表现优异,语料为最大公开葡语资源。
个性化RewardBench:评估奖励模型的人类对齐个性化能力
提出个性化奖励基准,评估模型个性化偏好;现有最佳准确率仅75.94%,且能预测下游表现。
HumorRank:基于锦标赛的大语言模型幽默生成评估排行榜
提出“幽默排名”法,基于锦标赛及幽默理论的成对评估,生成稳定榜单,揭示幽默质量取决于喜剧机制而非模型规模。
VISTA:用于生成与审计第一视角辅助场景的可控平台
VISTA平台根据自然语言场景种子,生成可编辑计划与第一人称视频,支持交互模式与后果控制,经人工评估比基线更贴合场景。
MedHallTune:缓解医学视觉语言模型幻觉的指令调优基准
提出MedHallTune基准,含逾10万图像和百万指令对,评估并缓解医学VLM幻觉,微调提升可靠性与下游任务性能。
仅等待非阻塞广播协议的安全验证
针对仅等待非阻塞广播协议,状态覆盖问题为P完全,配置覆盖问题为PSPACE完全。
利用多模态强化学习扩展医学影像报告生成
提出多模态强化学习框架UniRG,优化评估指标,克服监督微调过拟合,在胸部X光报告上刷新SOTA并开源。
基于客户数字孪生模拟的大规模聊天机器人验证
提出高保真合成客户代理与自动+人工验证框架,实现银行聊天机器人规模化低成本合规测试。
选择在哪里以及如何审核:过滤器放置与回复重写的端到端权衡
比较不同审核策略,发现回复重写能低害恢复流量,探针路由更高效,建议依部署需求选择。
AgentGUI:观察和操控长期运行的AI智能体的界面
AgentGUI是长期AI智能体观察操控界面,具备轨迹可视化与自动防漂移,用户测试识别速度提升38%,任务完成率提高34个百分点。
美国网络流媒体录制的宗教广播节目转录文本大规模语料库
构建了美国宗教广播转录文本大规模语料库,含70万+录音、6000万行文本,支持内容分析与语音研究。
DuplexGen:人类与AI轮流对话的自适应合成
DuplexGen通过少量人类偏好校准LLM,生成场景自适应轮流对话,显著优于传统方法。
方法是否支撑声称?论文内验证辅助同行评审
提出论文内声称验证框架,用LLM评估方法对声称的支撑,与人类评审意见显著一致。
表征AI生成诗歌中的人类相似性:零样本分类研究
通过零样本检测管道提取区分人机诗歌的关键属性,验证可区分性并强化现代检测。
推理时指令层次调控
V-Steer通过编辑缓存值向量,在推理时恢复指令层次,将主约束准确率从18%提升至92%,性能超越基线。
Robostreet Flow:一种轻量级超低阻力电动牵引车与四车混合编队架构,用于最低成本点对点货运
提出Robostreet Flow架构,集成低风阻轻量化电动牵引车与4车编队,成本降低56%、能耗降20.5%。
评估本地LLM机器翻译中的提示范围与示例相似性
研究提示范围和示例选择对本地LLM翻译的影响,专业MT仍最强,少样本部分有益,嵌入检索略优,多目标提示小模型易失败。
CMT-RAG:面向多轮多跳检索增强生成的互补记忆痕迹
引入子问题级推理痕迹的互补记忆框架,在多轮多跳RAG中显著提升答案准确性。
Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs
When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses
对齐错误具有人格特征:大五人格视角下的涌现式对齐失误
微调导致的对齐失误表现为大五人格的显著偏移,可用校准向量诊断,为安全现象提供可解释人格画像。
(有)碍结对编程:编码智能体提升生产力却损害理解
编码智能体提高任务完成效率,但削弱用户代码理解,用户仍因便捷而偏好。
金融披露文本中细粒度不一致性分类的诊断
微调小模型高效分类金融披露细粒度不一致,证据定位是关键瓶颈,不同类型难度分化显著。
面向长上下文语言模型的可合并模型侧聚合状态
提出模型侧HyperLogLog聚合接口,固定2KB内存实现精准可合并聚合,长上下文准确率达99.2%,优于直接推理63.2个点。
知识先行于推理:EC-Reason-Bench——面向大语言模型酶分类的无训练诊断基准
通用LLM酶分类准确率极低因缺乏知识;EC-Reason-Bench揭示知识先于推理,开放书访问大幅提升性能。
Voice Memory for Agentic Speech Recognition
ForgetBench:语言模型长期参数记忆遗忘动力学基准
提出ForgetBench基准,通过时序知识编辑系统评估LLM的长期记忆保留与遗忘动态。
基于文件系统的LLM智能体记忆:组织、演进与可持续性
系统探索文件系统记忆,发现组织降低检索成本但未提升答案质量,工具集影响结构。
哪种RAG范式在大规模下胜出?检索增强生成范式的缩放研究
控制缩放实验表明,BM25准确性-成本权衡最佳,无需LLM构建,中大规模领先;其他范式各有局限。
检测器失效之处:利用专家引导的互蒸馏缩小尾域差距
提出EGMD,通过输入校准、教师对齐域统计、学生互学习蒸馏,域偏差降低57.3%,达SOTA准确率。
对比性ESA:同时对多个翻译进行人工评估
提出对比性错误跨度标注(cESA),同时评估多个翻译,减少噪声和时间,提供绝对质量评分。