10005 条条目 · 106 个活跃源
2026年7月31日
04:00
arXiv cs.CL

隐喻追踪器:理论指导的隐藏状态分析

无需训练,单次前向传播,聚合/分化指标评测隐藏状态,追踪token在文本中的结构位置,支持关系性解读。

04:00
arXiv cs.CL

阶段重放发散跟随KV缓存:固定前缀精度控制与双向缓存移植

验证阶段重放假设,KV缓存决定发散,FP32无分歧,BF16有分歧;双向缓存移植使续写随供体,精度影响表现。

04:00
arXiv cs.CL

Change2Task:将仓库变更转化为可执行的编码智能体任务与环境

基于仓库历史,将合并PR转为可执行编码任务,验证成功率79.6%,较基线多恢复29.2%,节约10.8%成本。

04:00
arXiv cs.CL

VAD:多模态策略内蒸馏中面向目标重建的视觉证据归因

VAD通过反事实目标重建估计教师修正中的视觉证据,重建学生锚定目标,在细粒度视觉基准上优于直接蒸馏。

04:00
arXiv cs.CL

SVR:联合判定-置信度强化学习实现自适应测试时计算的自验证精炼

提出自验证精炼SVR,用自验证作为计算控制策略,数学推理平均2.99轮达0.563准确率,优于基线。

04:00
arXiv cs.CL

TCA-SIR:学习目标条件抽象实现科学灵感检索

TCA-SIR用目标条件抽象重构科学灵感检索,学习生成可迁移原理并预测适用性,性能超越现有方法且可解释。

04:00
arXiv cs.CL

基于DeCRIM的LLM自我修正:分解、批判与细化以增强多约束指令遵循

首个真实多约束指令基准RealInstruct,提出DeCRIM自我修正流程,提升开源模型多约束遵循,甚至超越GPT-4。

04:00
arXiv cs.CL

GradMAP:利用梯度度量与投影补偿的快速层剪枝

提出GradMAP,用梯度度量评估层重要性,仅需单步反向传播,投影补偿修复偏移,剪枝提速4倍且性能更优。

04:00
arXiv cs.CL

语言多样性:评估数字空间中非洲语言的使用与人工智能表现

研究非洲语言数字使用,发现新闻数据干净可靠,社交媒体代码混合,人工智能检测在新闻上准确,社交平台困难。

04:00
arXiv cs.CL

面向结构可解释的机器生成文本检测:一种图视角框架

提出图框架LM²otifs,将文本转为词共现图,用图神经网络检测并提取结构特征,比传统方法更忠实可解释。

04:00
arXiv cs.CL

CRMWeaver:基于智能体强化学习与共享记忆构建强大业务智能体

提出CRMWeaver,用合成数据与强化学习训练,推理时共享记忆,提升业务智能体效果与泛化。

04:00
arXiv cs.CL

选择还是投影?评估用于LLM训练数据解释的低维向量

比较组件选择与梯度投影构建低维表示,发现贪心选择组件子集在训练数据影响检索上更有效、计算更高效。

04:00
arXiv cs.CL

非洲经济问答基准:面向世界银行经济报告的定量与时间推理

基于220份世行报告构建含4309个证据链接问答的基准,测试检索增强系统的数值与时间精确性,最佳F1仅0.545。

04:00
arXiv cs.CL

AISPA:以用户为中心的大语言模型应用系统提示审计

提出系统提示审计框架,发现大模型产品保护性指令广泛但覆盖不全,约四成含损害用户指令,需加强透明监管。

04:00
arXiv cs.CL

MentorCollab:选择性大模型到小模型的推理时指导实现高效推理

提出MentorCollab,大模型选择性稀疏指导小模型,平均仅用18.4%昂贵token,性能提升3.0%,最高8.0%。

04:00
arXiv cs.CL

幻觉与真相:RAG、LoRA与DoRA的综合准确性评估

评估RAG、LoRA与DoRA:两万查询中DoRA准确率90.1%、相关度0.88、延迟110ms最优,并分析权衡。

04:00
arXiv cs.CL

LLM2Vec-Gen:从大语言模型生成嵌入

提出自监督方法,在LLM输出空间学习压缩其响应的嵌入,MTEB提升8.8%,并保留安全对齐与推理能力,且嵌入可解码回文本。

04:00
arXiv cs.CL

如何合成高质量预训练数据?提示设计、生成模型与源数据的系统研究

系统对比生成模型与源数据,发现结构化格式最优,超10亿参数无增益,FinePhrase降低30倍成本。

04:00
arXiv cs.CL

置信流形:语言模型中正确性表征的几何结构

语言模型正确性表征呈简单几何结构:2-8维质心可分,25样本达90%性能,干预可改幻觉率。

04:00
arXiv cs.CL

NorBERTo:使用3310亿词元语料训练的葡萄牙语ModernBERT模型

提出基于ModernBERT的葡语模型NorBERTo,用3310亿词元新语料训练,在PLUE和ASSIN2上表现优异,语料为最大公开葡语资源。

04:00
arXiv cs.CL

个性化RewardBench:评估奖励模型的人类对齐个性化能力

提出个性化奖励基准,评估模型个性化偏好;现有最佳准确率仅75.94%,且能预测下游表现。

04:00
arXiv cs.CL

HumorRank:基于锦标赛的大语言模型幽默生成评估排行榜

提出“幽默排名”法,基于锦标赛及幽默理论的成对评估,生成稳定榜单,揭示幽默质量取决于喜剧机制而非模型规模。

04:00
arXiv cs.CL

VISTA:用于生成与审计第一视角辅助场景的可控平台

VISTA平台根据自然语言场景种子,生成可编辑计划与第一人称视频,支持交互模式与后果控制,经人工评估比基线更贴合场景。

04:00
arXiv cs.CL

MedHallTune:缓解医学视觉语言模型幻觉的指令调优基准

提出MedHallTune基准,含逾10万图像和百万指令对,评估并缓解医学VLM幻觉,微调提升可靠性与下游任务性能。

04:00
arXiv cs.CL

仅等待非阻塞广播协议的安全验证

针对仅等待非阻塞广播协议,状态覆盖问题为P完全,配置覆盖问题为PSPACE完全。

04:00
arXiv cs.CL

利用多模态强化学习扩展医学影像报告生成

提出多模态强化学习框架UniRG,优化评估指标,克服监督微调过拟合,在胸部X光报告上刷新SOTA并开源。

2026年7月30日
04:00
arXiv cs.CL

基于客户数字孪生模拟的大规模聊天机器人验证

提出高保真合成客户代理与自动+人工验证框架,实现银行聊天机器人规模化低成本合规测试。

04:00
arXiv cs.CL

选择在哪里以及如何审核:过滤器放置与回复重写的端到端权衡

比较不同审核策略,发现回复重写能低害恢复流量,探针路由更高效,建议依部署需求选择。

04:00
arXiv cs.CL

AgentGUI:观察和操控长期运行的AI智能体的界面

AgentGUI是长期AI智能体观察操控界面,具备轨迹可视化与自动防漂移,用户测试识别速度提升38%,任务完成率提高34个百分点。

04:00
arXiv cs.CL

美国网络流媒体录制的宗教广播节目转录文本大规模语料库

构建了美国宗教广播转录文本大规模语料库,含70万+录音、6000万行文本,支持内容分析与语音研究。

04:00
arXiv cs.CL

DuplexGen:人类与AI轮流对话的自适应合成

DuplexGen通过少量人类偏好校准LLM,生成场景自适应轮流对话,显著优于传统方法。

04:00
arXiv cs.CL

方法是否支撑声称?论文内验证辅助同行评审

提出论文内声称验证框架,用LLM评估方法对声称的支撑,与人类评审意见显著一致。

04:00
arXiv cs.CL

表征AI生成诗歌中的人类相似性:零样本分类研究

通过零样本检测管道提取区分人机诗歌的关键属性,验证可区分性并强化现代检测。

04:00
arXiv cs.CL

推理时指令层次调控

V-Steer通过编辑缓存值向量,在推理时恢复指令层次,将主约束准确率从18%提升至92%,性能超越基线。

04:00
arXiv cs.CL

Robostreet Flow:一种轻量级超低阻力电动牵引车与四车混合编队架构,用于最低成本点对点货运

提出Robostreet Flow架构,集成低风阻轻量化电动牵引车与4车编队,成本降低56%、能耗降20.5%。

04:00
arXiv cs.CL

评估本地LLM机器翻译中的提示范围与示例相似性

研究提示范围和示例选择对本地LLM翻译的影响,专业MT仍最强,少样本部分有益,嵌入检索略优,多目标提示小模型易失败。

04:00
arXiv cs.CL

CMT-RAG:面向多轮多跳检索增强生成的互补记忆痕迹

引入子问题级推理痕迹的互补记忆框架,在多轮多跳RAG中显著提升答案准确性。

04:00
arXiv cs.CL

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

04:00
arXiv cs.CL

When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses

04:00
arXiv cs.CL

对齐错误具有人格特征:大五人格视角下的涌现式对齐失误

微调导致的对齐失误表现为大五人格的显著偏移,可用校准向量诊断,为安全现象提供可解释人格画像。

04:00
arXiv cs.CL

(有)碍结对编程:编码智能体提升生产力却损害理解

编码智能体提高任务完成效率,但削弱用户代码理解,用户仍因便捷而偏好。

04:00
arXiv cs.CL

金融披露文本中细粒度不一致性分类的诊断

微调小模型高效分类金融披露细粒度不一致,证据定位是关键瓶颈,不同类型难度分化显著。

04:00
arXiv cs.CL

面向长上下文语言模型的可合并模型侧聚合状态

提出模型侧HyperLogLog聚合接口,固定2KB内存实现精准可合并聚合,长上下文准确率达99.2%,优于直接推理63.2个点。

04:00
arXiv cs.CL

知识先行于推理:EC-Reason-Bench——面向大语言模型酶分类的无训练诊断基准

通用LLM酶分类准确率极低因缺乏知识;EC-Reason-Bench揭示知识先于推理,开放书访问大幅提升性能。

04:00
arXiv cs.CL

Voice Memory for Agentic Speech Recognition

04:00
arXiv cs.CL

ForgetBench:语言模型长期参数记忆遗忘动力学基准

提出ForgetBench基准,通过时序知识编辑系统评估LLM的长期记忆保留与遗忘动态。

04:00
arXiv cs.CL

基于文件系统的LLM智能体记忆:组织、演进与可持续性

系统探索文件系统记忆,发现组织降低检索成本但未提升答案质量,工具集影响结构。

04:00
arXiv cs.CL

哪种RAG范式在大规模下胜出?检索增强生成范式的缩放研究

控制缩放实验表明,BM25准确性-成本权衡最佳,无需LLM构建,中大规模领先;其他范式各有局限。

04:00
arXiv cs.CL

检测器失效之处:利用专家引导的互蒸馏缩小尾域差距

提出EGMD,通过输入校准、教师对齐域统计、学生互学习蒸馏,域偏差降低57.3%,达SOTA准确率。

04:00
arXiv cs.CL

对比性ESA:同时对多个翻译进行人工评估

提出对比性错误跨度标注(cESA),同时评估多个翻译,减少噪声和时间,提供绝对质量评分。