59131 条条目 · 106 个活跃源
2026年10月2日
09:30
Wired

医护人员厌倦了替 Palantir 收拾烂摊子

某医院巨头与放射网络引入 Palantir 优化排班,护士等员工称新软件错误频发,令人疲惫沮丧。

09:30
Wired

AI把护士排班搞得一团糟,护士称这关乎安全问题

医院巨头和放射网络用Palantir优化排班,护士等称新软件致错、倦怠,且危及安全。

09:00
MIT Tech Review AI

新竞赛让参赛者相互较量,竞逐生物学青春

本周我正式报名参加奇特竞赛:奖励“变年轻”。四十岁的我深知实际年龄只增不减,但比赛聚焦生物学年龄。

08:25
X @elonmusk

@elonmusk:在 XChat 中向 @Grok 提问

@elonmusk 发帖:在 XChat 中向 @Grok 提问

08:00
MIT Tech Review AI

别被蒙蔽了——大语言模型并不会推理

2016年首尔人机围棋五番棋第二局,第37手看似荒谬;作者借此引出大语言模型不会真正推理。

07:53
X @elonmusk

@elonmusk:超级智能(原称AI)如今在会计考试中轻松拿高分

马斯克称,超级智能(原称AI)已在会计测试中轻松取得高分。

07:00
X @deepseek_ai

@deepseek_ai:请查看 @DeepSeekHarness。我们刚刚发布了适用于 macOS 和 Windows 的打包桌面版;Linux 用户可从 npm 上的 @deepseek-ai/dsh 包获取。https://t.co/Cde0dZ6cPy

DeepSeekHarness发布macOS/Windows桌面版,Linux可用npm包dsh

06:40
Latent Space

[AI新闻] Pi 1.0、Pi Durable 与 AIE NYC

Pi 1.0 让极简框架稳定并支持 TS;另含 Pi Durable、AIE NYC。

06:35
X @karpathy

@karpathy:很酷的评测。只需向LLM提问“陆地还是海洋?”,并以文本形式给出经纬度坐标。问16200次,绘制成图像。模型全都知道。源于对互联网的压缩。

向LLM询问经纬度坐标是陆地还是海洋,共16200次并绘图,模型能准确判断。

06:35
MarkTechPost

AWS Strands Labs 发布 Strands Decider 2B:一款约 115 毫秒即可选出选项的开源决策模型

基于Qwen3.5-2B的开源决策模型,单次前向输出选项与置信概率,中位延迟115毫秒。

06:11
X @dotey

@dotey:😂 Claude Code 可以借助 Mod 做到吗?

询问 Claude Code 能否借助 Mod 做到。

04:01
Hugging Face

AutoSynthData:为企业级智能体生成训练数据

未提供摘要,无法提炼。

04:00
arXiv cs.AI

长时程语言智能体中的重尾记忆轨迹

揭示智能体记忆呈核心-尾部重尾分布,提出CTWM按秩分配提示预算,节省token并降低尾部预测误差。

04:00
arXiv cs.CV

基于时序分割与语义抽象的自我中心与外部视角程序理解框架

多模态工作视频经边界分割与事件卡片抽象,增量构建工作环境模型,实现隐私约束下紧凑可审计的检索。

04:00
arXiv cs.CV

STATERA:利用冻结时序管片实现零样本仿真到现实运动学的隐藏质量估计

冻结时序管片适配V-JEPA,单目视频零样本估计隐藏质心,仿真到现实迁移最优。

04:00
ArXiv AI

喜剧中的愚人金:对话幽默中的奖励漏洞与对策

研究对话幽默奖励的漏洞与对策:惊喜嵌入奖励易被乱序回复欺骗,笑声线索可被利用;修正后改善但未达预期。

04:00
arXiv cs.CL

Noor超大型阿拉伯语语言模型碳足迹的整体评估

本文综合评估Noor超大型阿拉伯语模型全周期碳足迹,指出推理和外部成本影响显著,并探讨减排路径。

04:00
arXiv cs.LG

逆向项目反应理论:碎片化癌症药物反应矩阵中的稀疏稳健排序

提出逆向项目反应理论,将癌症类型与药物建模为耐药被试与项目,碎片化数据中比简单平均更稳健恢复排序。

04:00
arXiv cs.AI

从提议到可验证效果:Praxa——面向受治理AI智能体执行的证据约束型执行框架

Praxa以证据约束架构显式区分提案、授权、派发与验证效果;四条证据线均未证明性能优越。

04:00
arXiv cs.CV

空间升维用于稠密预测

提出空间升维:将输入提升到高维空间并由3D网络处理,稠密预测性能更优,参数量与推理成本大幅下降。

04:00
arXiv cs.CV

涌现式物体绑定具有有限空间视界

预训练ViT冻结块嵌入可解码同物体信号,但绑定随距离指数衰减至非零下限,呈现有限空间视界。

04:00
arXiv cs.LG

Adam 距离自然梯度下降有多远?

Adam与自然梯度的几何偏离随场景变化,病态下显著,但凭动量平滑仍能有效优化。

04:00
arXiv cs.CL

BudgetSchemaBench:Text-to-SQL 模式上下文的预算扫描式诊断基准

提出预算扫描诊断基准,发现检索覆盖受限时,执行准确率对模式上下文的预算远比对序列化格式敏感。

04:00
arXiv cs.AI

理由究竟传递了什么?角色专精问答中的消息干预研究

忠实理由不提升答案准确率,但受损理由显著改变验证支持判断,故理由共享应作为验证消息机制评估。

04:00
ArXiv AI

衡量微任务合格性差距:现成小语言模型何时足以用于智能体执行框架?

构建4项微任务基准测试现成小模型:均未达阈值,量化无改善;差距源于规模而非精度,宜仅作基线补充。

04:00
arXiv cs.CL

韩国性犯罪案件中的法律文本分类:从传统机器学习到结合XAI洞察的大语言模型

韩国性犯罪判例分类中,微调KLUE-BERT准确率99.3%,优于GPT与传统模型,XAI揭示语境理解局限。

04:00
ArXiv AI

因果世界模型何时有助于模块化 LLM 智能体

因果世界模型仅在跨模块接口可统计识别、且行动时可用时,才有助于模块化 LLM 智能体。

04:00
arXiv cs.CV

编码却脱节:在激活补丁零结果下分解视觉语言模型失败

三种视觉语言模型中层虽编码答案却因果失活,补丁零翻转;错误分为感知失败、编码脱节、先验覆盖,且可学习。

04:00
arXiv cs.CV

目标检测中的域泛化与合成数据:赋能者、探针与鸿沟

目标检测域泛化研究稀缺;合成数据既是赋能者与探针,又存在合成到真实鸿沟,未来需兼顾定位与分类。

04:00
arXiv cs.CL

FACET 在 WMT 2026 自动翻译质量评估任务中

提出免参考免训练FACET,将评估分流畅、准确、一致三通道;另交省略一致通道版,人工译后编辑排名第一。

04:00
arXiv cs.LG

FourierQK:滤波器形状、可容许性与泄漏-覆盖定律

QK注意力消融:抑制直流/奈奎斯特,段落尺度带宽最优,可容许滤波器更优;泄漏随覆盖增,适用双向注意力

04:00
arXiv cs.LG

在多实例强化学习系统中整合公平性与可解释性

研究融合RL-MIL、对抗去偏与偏好超网络的学生风险预测,发现偏好调节失效、模式坍塌,需梯度平衡与目标分离。

04:00
ArXiv AI

面向个性化偏好优化的梯度对齐配对选择

提出GAP-DPO,以效用梯度几何对齐选择偏好对,提升LLM个性化偏好优化效果。

04:00
arXiv cs.CV

可达性不等于泛化:理解装配动作识别中的动–名分解

系统分析三数据集上的动–名分解:泛化主要靠共现插值,失败集中于大词表成分,共享编码器致成分纠缠。

04:00
arXiv cs.LG

面向大语言模型的快速多项式超越函数

用3–4次BF16多项式替代sigmoid、tanh、SiLU,训练吞吐最多提升8%,损失几乎不变。

04:00
arXiv cs.AI

刻画推理时 PRM 剪枝片段嫁接无效的配置:来自三个推理语言模型的证据

PRM剪枝片段嫁接在推理时与独立并行思维链基线无显著差异;触发多未命中真正困难链,跨三模型六基准复现。

04:00
arXiv cs.CL

端侧命名实体识别:准确性、成本、可靠性与置信度的可部署性研究

端侧NER可部署性评测:编码器更可靠,小生成模型无效输出多,置信度需校准。

04:00
arXiv cs.CL

基于结构因果模型(SCM)的法律文书分类公平性与忠实可解释性

公平性正则化未改善人口公平,却持续削弱SHAP解释忠实性,表明公平与解释忠实性解离。

04:00
arXiv cs.CV

看见城市,还是识别地点?VLM城市感知中街景影像较现有城市数据的增量贡献

街景影像的增量价值取决于视觉可读性与本地数据覆盖;部分属性上现有数据已匹敌甚至优于图像。

04:00
arXiv cs.CV

DSSR-3D:3D高斯中视角相关指代的解耦推理

DSSR-3D以解耦推理实现3D高斯视角相关指代分割,免重训练,并提出ViewRef-GS基准。

04:00
arXiv cs.LG

面向快速 FP4 预训练的格式感知融合

格式感知融合协同设计FP4量化布局,Llama-3 8B预训练达37.9K tokens/s/GPU。

04:00
arXiv cs.LG

“非常可能”等于“不确定”?大语言模型在语言不确定性量化上如何与人类分道扬镳

大语言模型为“可能”“很可能”等词赋予的不确定性概率与人类差异显著,新算法从输出中学习标记映射,揭示二者置信语义的系统性偏差。

04:00
ArXiv AI

K-Dense BYOK:一款本地运行、以哈希链保存实验记录本的开源 AI 科研助手

开源本地 AI 科研助手,自带模型密钥,哈希链实验记录不可篡改,跨学科表现优于管理平台。

04:00
arXiv cs.CV

基于双对齐测试时自适应的鲁棒在线航空发动机叶片缺陷检测

ABDD测试时自适应框架,对齐全局风格与局部缺陷,用不确定性伪框过滤,提升域偏移下叶片缺陷检测鲁棒性。

04:00
arXiv cs.CL

首个 token 并非裁决:不生成即读取 LLM 评判器的隐性代价

首 token 读出裁决会系统性高估位置偏差;评判器常不先输出裁决 token,强制读取实为退回先答,建议报告首发率。

04:00
arXiv cs.LG

SW-KAN:采用 Stieltjes-Wigert q-正交多项式的 Kolmogorov-Arnold 网络

提出SW-KAN,用Stieltjes-Wigert q-正交多项式与tanh指数映射解决域不匹配,提升资源受限下的逼近与分类效率。

04:00
arXiv cs.LG

单一掌握阈值并不适用于所有知识追踪模型

同一掌握阈值不适合所有知识追踪模型;六模型四数据集表明最佳阈值随模型和情境变化,需重校准与综合评估。

04:00
arXiv cs.CL

指标—构式耦合会夸大合成方言恢复的测量值

韩语方言语料不可再分发;KoDialectBench揭示合成数据恢复因能力轴而异,且当评估指标词表与变换构式重叠时,恢复率被显著高估。

04:00
arXiv cs.CL

测量大语言模型中的类人偏见?——对LLM评估中人类衍生偏见构念的批判

论文批评将人类偏见构念用于LLM评估,指出构念、人机与情境错配导致推断鸿沟,并提出分析框架。

04:00
ArXiv AI

科学智能体:在科学任务上评估专业特定系统提示

专业系统提示不提升科学任务准确率,成本高2–4倍,工具任务更差;长提示仅增强抗API中断。