FinInvest-GTCN:面向风险感知投资决策优化的可解释图-时间-因果建模
提出FinInvest-GTCN模型,结合图-时间-因果网络与元因果适应,实现可解释风险收益评估,RA-MSE降至2.51,累计回报提升18.7%。
A3M:面向重复拍卖中战略竞标的自适应、对抗性及多目标学习
A3M框架融合深度强化学习与对抗推理,通过多目标奖励设计实现自适应竞标,遗憾值降低30-40%,鲁棒且可扩展。
超越均值:基于小型试点数据的LLM调查模拟器三维保真度对齐
微调小样本可平衡三种保真度,但保真度因子样本而异,挑战多元对齐。
面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议
提出AgriTune-R框架,基于Qwen3-8B集成数据治理、微调、RAG与专家评估,为农业LLM适配提供可复现基线
BERTomelo:你的葡萄牙语编码器最佳伙伴
BERTomelo基于ModernBERT架构,在106M文档的葡萄牙语语料上预训练,显著优于此前模型,提供高效替代方案。
临床证据的强度可从语言模型表示中恢复,而非从其陈述的等级中
临床LLM内部表示可反映证据强度,但陈述等级不可靠,性能比估计器低25-27个百分点。
AB-RAG:自适应预算检索增强生成以实现可靠问答
AB-RAG无需训练,融合三重信号估计置信度,自适应预算检索,高效区分正误答案,高置信准确率57.6%,低置信0%。
如何利用合成语音优化基于LLM的ASR系统?
分析合成与真实语音差异来源,发现RIR增强配合层选择模块,仅用25%真实语音即达全数据基线性能。
掩码扩散解码作为x预测流
将掩码预测重释为x预测,用连续解码框架和置信度异步更新,结合强化学习策略网络,以25%解码预算达到97%性能。
ThinkProbe:超越准确率——通过非生成式思维图对开放式大语言模型推理轨迹进行结构化剖析
ThinkProbe将推理痕迹转为思维图并提取五维认知轮廓,发现模型间差异远超领域差异,结构维度揭示准确率无法反映的认知特征。
A Comparative Study on Affective Cues in Text Embeddings Across Psychological Emotion Theories
进化微调:在371个优化任务中学习发现
进化微调通过搜索轨迹监督训练LLM,实现跨任务进化,在22个任务上平均提升10.22%。
拟人化语言如何影响公众对人工智能的认知
实验表明拟人化语言对公众AI感知影响有限,但长期或自然情境下可能有潜在效果。
DistilledGemma:多语言历史文章中人物-地点关系提取的平衡效率与准确性
三阶段知识蒸馏从26B到2.3B模型,在HIPE-2026人物-地点提取中平衡效率与精度,标准集第三、二值集第二。
中文标题:预先知道何时进化外循环无济于事:一个预注册的低成本基线筛选规则
中文摘要:提出预注册筛选规则,计算恢复率R决定是否跳过代价高昂的进化外循环,验证表明R≥90%时可节省6-8倍计算成本。
A Hybrid Framework for Song Lyric Annotation Based on Human-LLM Alignment
跨时间僧伽罗语OCR:页面级适配与历时分析
首个真实世界僧伽罗语页面OCR数据集,LightOnOCR-2-1B取得1.05%字符错误率,优于现有模型。
mamabench与mamaretrieval:用于评估母婴及生殖健康领域医学检索增强生成的基准
mamabench和mamaretrieval基准填补母婴健康检索增强生成评估空白
LC-ICL:标签引导的对比上下文学习用于鲁棒信息抽取
本文提出LC-ICL,利用正负样本及错误标签构建上下文学习,提升大模型信息抽取鲁棒性,性能显著优于以往方法。
TriageRA-CCF:面向医学大语言模型自适应秩预算的源端临床置信度与覆盖信号
提出TriageRA-CCF,用源端置信度、覆盖度与反事实信号监督自适应秩预算,在Qwen3-8B和Llama3.1-8B上平均准确率分别提升0.21和0.16。
OCR-VLM能否读取天城文?压力测试基准与后校正研究
十种OCR系统在天城文上测试,合成文本高估性能,专用模型脆弱,强英文OCR不预示印地语质量,后校正器可提升但不可迁移。
EntroRouter:基于熵调控的高效模型路由学习
EntroRouter通过熵调控解耦推理与路由,抑制信任区域坍塌,保留98.3%精度,节省48.25%成本。
基于领域知识图谱的旅行导向推理大语言模型
提出基于专家知识图谱的旅行推理LLM流水线,微调后精确匹配率达82.4%,远超基线22.4%,并分析残差错误的两类模式。
理解扩散大型语言模型中的评估幻觉
扩散LLM评估幻觉:提示模板敏感导致方法排名偏差,并行解码实际未优于单令牌基线。
MIThinker:用于动机性访谈咨询的即插即用策略优化思考者
提出MIThinker自动生成治疗思维,两阶段训练提升策略对齐,计算量少一个数量级却达到同等咨询能力。
我们还需要微调吗?大语言模型时代的土耳其情感分析
提示大语言模型在土耳其情感分析零样本设置中仍不及监督微调,中性类别是关键。
AURORA:基于不对称性与更新诱导旋转的鲁棒大语言模型幻觉检测
提出AURORA框架,利用权重梯度更新的不对称性和旋转比率检测LLM幻觉,跨模型和数据集表现鲁棒。
哪些词需要上下文?基于参考的翻译责任分析:使用生育率和熵
提出事后模型无关框架,用生育率和熵量化上下文敏感性;功能词依赖上下文,内容词稳定。
The Verbose Context Problem in Medical Records
各向异性决定文本嵌入的余弦度量和排序度量孰优孰劣
嵌入空间的方差分布决定度量选择:均匀时余弦最优,各向异性时替代度量提升约20%,一个数值即可预测。
覆盖驱动的KV缓存逐出:实现LLM高效推理与性能提升
K-VEC通过覆盖感知的跨头跨层模块提升token保留,在相同内存下性能提升达10.35点。
Preference-ASR:语音大语言模型时代下用于评估ASR系统的偏好感知测试集
PreferenceASR测试集评估ASR系统遵循偏好指令的能力,揭示传统基准无法衡量的质量差异。
MAM-AI:面向桑给巴尔护士与助产士的设备端医疗检索增强生成系统
为桑给巴尔护士助产士开发的离线医疗问答系统,通过设备端嵌入检索与4B生成器,优化提示以平衡安全与有用性。
推理还是捏造:基于提示锚定的成对聚合实现无捷径推理
通过提示锚定成对聚合,HIPPO区分真正推理与捷径编造,提升LLM推理鲁棒性和泛化能力。
中文标题:LLM生成的临床语料库中真正的新内容有多少?——基于来源分类的大规模内容冗余测量
中文摘要:LLM生成临床语料库仅10.9%为新内容,79.4%冗余,token数高估信息9倍,去重提升下游性能。
多模态文档推理代理的混合检索器进化
提出失败驱动的进化框架,使元代理自主协调多种检索器实现自适应推理,在多模态文档问答中取得显著提升。
不同构建模式和语言下VLM检测有害ASCII艺术的分辨率阈值
研究发现VLM检测有害ASCII艺术存在分辨率阈值,高分辨率下检测率骤降,单词模式最抗检测,揭示系统漏洞。
Managing Map Cardinality in Automatic Disease Classification Mapping: Balancing Precision, Recall and Coverage
大语言模型如何看待创造力:具有可解释推理的视觉创造力零样本评分
多模态大模型无需训练即可零样本评估视觉创造力,推理过程可解释但与人类评分一致性未提升。
多模态大语言模型能否像人类一样评论?评估开放式审美推理
基于参考的相似度评估有误导性,MLLM评论全面但缺乏人类的选择性与特异性。
何必纠结连续潜在变量?通过渲染压缩实现可解释的离散潜在推理
提出离散潜在推理(DLR),将连续状态转为离散token,实现可解释高效推理,压缩20倍。
SEVA:面向事实归因的自我进化验证智能体(过程奖励)
提出SEVA结构化验证代理,用过程奖励解决RL训练优势崩溃,实现自我进化,在事实归因上媲美GPT-4o-mini且输出可审计。
本地部署开源大模型在Text-to-SQL上的表现如何?——基于BIRD的跨模型家族规模与技术的边界研究
本地开源LLM的Text-to-SQL:代际强于规模,自我纠错免费提效,模式链接无用,自一致性性价比低。
快数字,慢语言:连接定量与定性盈利信号
定量惊喜公告即释,定性情绪次日显现,EarningsInOne语料桥接两信号分析。
两阶段提示优化用于少样本关系抽取:从推理引导搜索到梯度引导精炼
提出推理与梯度优化结合的提示框架,在少样本关系抽取任务上取得领先性能。
人类是进化出的指令遵循者吗?一种潜在的归纳偏置使得快速指令任务学习成为可能
主张人类拥有进化形成的指令遵循偏置,能通过语言指令快速泛化行为,类似LLM零样本学习,是先天认知特征。
KbSD:面向智能体搜索中行为校准的知识边界感知自蒸馏
KbSD通过知识边界自蒸馏和象限自适应优化,提供密集监督,提升搜索准确率并缓解幻觉。
MATCH:通过上下文检索调制注意力以支持长上下文Transformer
MATCH框架将稀疏注意力与动态上下文检索结合,显著提升长距离任务性能且保持高效。
揭示自然语言处理的技术发展:一个以科学实体为中心的视角
本文从实体角度分析NLP技术趋势,发现预训练语言模型成主流,新技术涌现和接受速度加快。
Fund2Persona:基于基金披露数据构建与优化金融顾问画像的框架
提出Fund2Persona,利用基金披露数据构建并优化金融顾问画像,生成更具体有用的投资建议。