10213 条条目 · 106 个活跃源
2026年5月22日
04:00
arXiv cs.CL

FlyRoute:通过数据飞轮实现自适应任务路由的自我进化智能体画像

FlyRoute通过数据飞轮自我进化智能体画像,结合探索策略,路由准确率从72.57%提升至89.83%。

04:00
arXiv cs.CL

ArabDiscrim:一个长达十年的阿拉伯语Facebook种族主义与歧视语料库

推出十年间29.3万条阿拉伯语Facebook帖子语料库,整合互动信号与歧视维度,支持弱监督与平台生态研究。

04:00
arXiv cs.CL

Faithful-MR1: 通过锚定与强化视觉注意力的忠实多模态推理

针对多模态推理中视觉证据感知与利用的忠实性问题,提出Faithful-MR1框架,通过锚定与强化视觉注意力,在较少训练数据下超越基线。

04:00
arXiv cs.CL

Ishigaki-IDS-Bench:从BIM信息需求生成信息交付规范的基准测试

评估LLMs生成BIM信息交付规范XML能力的基准,最佳模型内容F1为65.6%,仅27.7%通过标准审计,生成仍不稳定。

04:00
arXiv cs.CL

高棉语检索增强问答的语言模型比较研究

本文比较三种嵌入模型和五种生成模型,发现BGE-M3检索最优,生成模型各有所长,为低资源语言RAG提供参考。

04:00
arXiv cs.CL

跨语言共识:通过多语言自一致性对齐多语言文化知识

提出自监督框架,利用自一致性和自批评机制迁移多语言文化知识,提升跨语言对齐性能5.03%。

04:00
arXiv cs.CL

Psy-Chronicle:一种用于合成长期校园心理咨询对话的结构化流程

提出Psy-Chronicle框架合成长期校园咨询对话,构建学期事件图与CPCD数据集,提升响应和记忆,但因果推理仍是挑战。

04:00
arXiv cs.CL

多模态语言模型中,事实回忆机制是否从文本迁移到语音?

因果中介分析显示,多模态语音语言模型中事实回忆机制从文本到语音仅部分迁移,存在显著差异。

04:00
arXiv cs.CL

大语言模型推理的统一数据选择

提出无训练代价的高熵和指标,通过高熵token选择高质量推理数据,在多种训练范式下效果一致且高效。

04:00
arXiv cs.CL

阿拉伯女性社会赋权与福祉的受众参与:十年语料库

十年间25万条阿拉伯Facebook帖子,2.67亿互动,分析性别话语与社会改革。

04:00
arXiv cs.CL

更难防御:通过隐式增强与混淆改写实现中文毒性攻击

提出CITA框架,三阶段生成隐式毒性样本,检测器平均漏检率69.48%,可用于增强防御鲁棒性。

04:00
arXiv cs.CL

IdioLink:超越字面的习语与直译表达语义检索

IdioLink基准测试揭示:当前模型难以跨越习语与字面表达的语义鸿沟,过度依赖表层主题线索。

04:00
arXiv cs.CL

GHI:基于条件超图关联的Graphormer用于方面级情感分析

GHI框架通过超图关联表示结构证据,以247M参数接近11B模型性能,鲁棒性强,验证紧凑结构推理在细粒度任务中的价值。

04:00
arXiv cs.CL

模式与词根屈折形态学:阿拉伯语破碎复数

提出模式优先于词根的阿拉伯语名词屈折模型,涵盖破碎复数,分类300类,编码3200条目。

04:00
arXiv cs.CL

TransitLM:用于无地图公交路线生成的大规模数据集与基准

TransitLM含1300万条记录,训练LLM实现高精度无地图公交路线生成,并隐式定位GPS坐标。

04:00
arXiv cs.CL

面向低资源语言农业文档的有效文本嵌入分块策略评估

针对高棉语农业文档RAG,比较四种分块法,字符级递归(300字符)在检索评分和相关性上最优。

04:00
arXiv cs.CL

印度语言辱骂评论检测的多阶段训练

提出语言预处理与模型集成方法,降低假阳性率,平衡辱骂检测与言论自由。

04:00
arXiv cs.CL

通过行为微调对语言模型中的病理样行为模式进行建模

微调语言模型模拟抑郁/偏执等行为模式,产生稳定泛化的分布偏移且具特异性,支持策略系统视角。

04:00
arXiv cs.CL

SynAE:用于衡量工具调用智能体评估中合成数据质量的框架

SynAE从指令、工具调用、输出及下游评估四维度衡量合成数据的有效性、保真度和多样性。

04:00
arXiv cs.CL

DeferMem:通过强化学习进行查询时证据蒸馏以实现长期记忆问答

DeferMem用强化学习在查询时蒸馏证据,解决长期记忆问答难题,实现高准确率和零API成本。

04:00
arXiv cs.CL

BeLink:生物医学实体链接遇上生成式重排序

指令微调开源生成模型重排序,BEL准确率提升3%-24%并减少推理时间,集成到BeLink系统。

04:00
arXiv cs.CL

在仇恨言论与错误信息交汇处的辅助性反言论写作

LLM辅助反言论写作,混合事实核查与NGO指南策略在专家评估中表现最佳。

04:00
arXiv cs.CL

Cohesion-6K:用于分析在线话语中社会凝聚与冲突的阿拉伯语数据集

提出Cohesion-6K阿拉伯语数据集,标注6000条帖子为冲突到凝聚五类,发现冲突帖互动量是解决型的2-4倍。

04:00
arXiv cs.CL

一个提示远远不够:指令敏感性削弱了嵌入模型评估的有效性

单提示评估无法反映真实性能,默认提示会低估或高估,排名也不稳健,建议多提示或报告敏感性。

04:00
arXiv cs.CL

面向词汇语义的场景抽象:情境意义的结构化表示

提出场景抽象框架,用结构化表示词汇情境意义,实验显示场景识别准确率82.4%,优于文本嵌入,更符合人类解释。

04:00
arXiv cs.CL

从相关到因果:Transformer语言模型中特征分析的五阶段方法论

五阶段因果分析揭示GPT-2的IOI特征仅部分因果,鲁棒性与因果力负相关,联合分析优于单一方法,部署可节省99.1%成本。

04:00
arXiv cs.CL

RAMPHO缓冲区的计算建模:通过深度神经网络中的音素熵分离信息掩蔽与能量掩蔽

基于wav2vec2.0音素熵模拟缓冲区,区分信息与能量掩蔽的认知代价,揭示认知-声学帕累托优化问题。

04:00
arXiv cs.CL

表面礼貌实则错误:多语言孟加拉语生成中敬语失效的修复数据集

提出BLADE数据集,含4196个交互对,微调后显著提升孟加拉语生成的结构保真度和敬语对齐。

04:00
arXiv cs.CL

中文3000个词汇化概念的感知运动与具身规范

建立中文3000词的感知运动与具身规范数据库,验证感知强度等变量对词汇加工的影响,发现语言表征可部分恢复具身结构。

04:00
arXiv cs.CL

机器翻译保留道德语义:基于道德基础语料库的跨语言证据

机器翻译能保留道德语义,跨语言相似度高,为低资源语言道德研究提供低成本有效途径。

04:00
arXiv cs.CL

超越温度:超拟合作为后期几何扩展

超拟合并非温度缩放,而是最终Transformer块的特征空间几何扩展(维度增加约80.8),实现深度尾部token提升。

04:00
arXiv cs.CL

Agentic CLEAR:自动化多层级评估LLM智能体

提出自动动态评估框架Agentic CLEAR,提供系统、轨迹、节点三级文本洞察,精准反馈并预测任务成功率。

04:00
arXiv cs.CL

温水煮青蛙:一个面向智能体安全的多轮基准

提出“温水煮青蛙”基准,评估AI智能体在多轮交互中抵御逐步攻击的能力,跨模型平均攻击成功率44.4%。

04:00
arXiv cs.CL

更多上下文、更大模型还是道德知识?政治文本中施瓦茨价值观检测的系统研究

上下文并非越多越好,检索道德知识更有效,模型规模不保证提升,需联合评估。

04:00
arXiv cs.CL

LANG:语言自适应提示引导的多语言推理强化学习

提出LANG框架,利用语言提示引导探索,通过渐进衰减和自适应切换,显著提升多语言推理性能并保持语言一致。

04:00
arXiv cs.CL

谁的声音重要?通过向美国政府提交的公众意见来描绘利益相关者对AI的看法

分析公众意见发现,个人更关注AI对生活的影响,但政府行动计划更偏向私营部门利益。

04:00
arXiv cs.CL

通过能力选择性子空间投影的自策略蒸馏

SPD无需外部信号,利用能力子空间投影与微调,提升LLM性能达13%-16%,泛化性强。

04:00
arXiv cs.CL

看见诗歌:基于MLLMs的AI生成现代汉诗图像语义检测

提出图像语义引导法检测AI现代汉诗,融合图像文本,LLM检测器超越RoBERTa,达85.65% Macro-F1 SOTA。

04:00
arXiv cs.CL

基于分割树的标记化

ToaST通过递归推断和整数规划优化词汇表,减少token数11%以上,显著提升语言模型效果。

04:00
arXiv cs.CL

商业AI聊天机器人作为新闻中介的评估

评估六款聊天机器人发现,高准确率掩盖了区域不公、检索依赖及虚假前提脆弱性。

04:00
arXiv cs.CL

从参数到数据:任务参数引导的高效大语言模型对齐微调流水线

提出P2D框架,利用任务敏感注意力头实现数据选择和剪枝,仅用10%参数和数据即提升8.3%性能并加速7倍。

04:00
arXiv cs.CL

ChronoMedKG:一个基于时间的生物医学知识图谱及临床推理基准

提出时序生物医学知识图谱ChronoMedKG及基准ChronoTQA,通过时间约束提升临床推理准确率,挽救长尾失败。

04:00
arXiv cs.CL

理解数据时间性对大语言模型预训练的影响

顺序训练相比混洗能提升大模型时间知识的时效性和准确性。

04:00
arXiv cs.CL

通过一致性训练减少政治操纵

提出政治一致性训练(PCT),通过情感和帮助一致性训练减少LLM的隐蔽政治偏见,并保持有用性。

04:00
arXiv cs.CL

通过凸松弛的令牌化

提出凸优化令牌化算法ConvexTok,改进指标与模型性能,保证逼近最优。

04:00
arXiv cs.CL

通过比较想法评估训练语言模型预测研究成功

用比较预测方法训练小模型,使其有效筛选研究想法,性能超越大模型,实现可扩展的科学发现。

04:00
arXiv cs.CL

HealthCraft:用于急诊医学的强化学习安全环境

首个公开急诊医学强化学习安全环境,基于FHIR R4,含195个任务,前沿模型安全失败率高达27.5%-34%。

04:00
arXiv cs.CL

跨平台社交媒体话语中的合成政治叙事检测

提出基于词汇多样性、突发性、修辞重复和语义同质化的合成叙事协调得分(SNC),跨平台实验验证多维度评分比单一指标更可靠。

04:00
arXiv cs.CL

为何语义熵会失败:面向策略优化的几何感知与校准不确定性

语义熵因各向异性与校准缺口而失效,GCPO通过几何感知与奖励校准优化策略,提升后训练效果。

04:00
arXiv cs.CL

守卫的盲点:域伪装注入攻击如何规避多智能体LLM系统的检测

域伪装注入攻击使检测率从93.8%降至9.7%,定义CDG显著,多智能体放大小模型攻击,增强检测效果有限。