59089 条条目 · 106 个活跃源
2026年10月2日
11:47
Wired

亚马逊称不再为数据中心使用保密协议

亚马逊宣布停止与县官员签署秘密协议,承认社区反对可能导致全国数据中心暂停。

11:35
Wired

2026年最佳智能猫咪追踪器:Fi Mini 与 Tractive 对比

经数月监测Basil的活动与睡眠,我发现Fi和Tractive猫咪追踪器各有取舍。

11:00
Crunchbase News

你的投资人可能成就也可能毁掉你的初创公司。创始人真正需要在股权结构表中纳入哪些投资人

创始人应有意选择能带来多元价值的投资人,而非谁愿投就纳入股权表;嘉宾分享三点筛选建议。

11:00
Crunchbase News

航海及海洋初创企业融资加码

过去一年,风投向海洋相关初创企业投入近30亿美元,重点为自主船舶、水上机器人、电动船艇和海洋数据。

11:00
Crunchbase News

记者手记:欧洲主权AI推进既需资本也需客户

Crunchbase News研究负责人Gené Teare在阿姆斯特丹HumanX主持讨论,对话欧洲和中东AI生态领袖,分享与Axelera AI、AI71高管的交流片段。

10:30
Wired

你的无人驾驶出租车正在监视你

Waymo、Zoox和特斯拉的自动驾驶车布满摄像头与传感器,部分镜头正对着乘客。

10:00
Wired

选举否认者认为共和党糟糕的中期选举民调是“心理战”

数十名知名MAGA网红和评论员纷纷置评。Catturd在X上称:“可笑的假民调正纷纷出炉。”

09:45
Wired

ChatGPT Mac 应用漏洞本可让黑客窃取敏感数据

AI代理的黑客能力受关注,但ChatGPT应用新修复漏洞表明,AI软件自身也是诱人、脆弱的攻击目标。

09:30
Wired

医护人员厌倦了替 Palantir 收拾烂摊子

某医院巨头与放射网络引入 Palantir 优化排班,护士等员工称新软件错误频发,令人疲惫沮丧。

09:30
Wired

AI把护士排班搞得一团糟,护士称这关乎安全问题

医院巨头和放射网络用Palantir优化排班,护士等称新软件致错、倦怠,且危及安全。

09:00
MIT Tech Review AI

新竞赛让参赛者相互较量,竞逐生物学青春

本周我正式报名参加奇特竞赛:奖励“变年轻”。四十岁的我深知实际年龄只增不减,但比赛聚焦生物学年龄。

08:25
X @elonmusk

@elonmusk:在 XChat 中向 @Grok 提问

@elonmusk 发帖:在 XChat 中向 @Grok 提问

08:00
MIT Tech Review AI

别被蒙蔽了——大语言模型并不会推理

2016年首尔人机围棋五番棋第二局,第37手看似荒谬;作者借此引出大语言模型不会真正推理。

07:53
X @elonmusk

@elonmusk:超级智能(原称AI)如今在会计考试中轻松拿高分

马斯克称,超级智能(原称AI)已在会计测试中轻松取得高分。

07:00
X @deepseek_ai

@deepseek_ai:请查看 @DeepSeekHarness。我们刚刚发布了适用于 macOS 和 Windows 的打包桌面版;Linux 用户可从 npm 上的 @deepseek-ai/dsh 包获取。https://t.co/Cde0dZ6cPy

DeepSeekHarness发布macOS/Windows桌面版,Linux可用npm包dsh

06:40
Latent Space

[AI新闻] Pi 1.0、Pi Durable 与 AIE NYC

Pi 1.0 让极简框架稳定并支持 TS;另含 Pi Durable、AIE NYC。

06:35
X @karpathy

@karpathy:很酷的评测。只需向LLM提问“陆地还是海洋?”,并以文本形式给出经纬度坐标。问16200次,绘制成图像。模型全都知道。源于对互联网的压缩。

向LLM询问经纬度坐标是陆地还是海洋,共16200次并绘图,模型能准确判断。

06:35
MarkTechPost

AWS Strands Labs 发布 Strands Decider 2B:一款约 115 毫秒即可选出选项的开源决策模型

基于Qwen3.5-2B的开源决策模型,单次前向输出选项与置信概率,中位延迟115毫秒。

06:11
X @dotey

@dotey:😂 Claude Code 可以借助 Mod 做到吗?

询问 Claude Code 能否借助 Mod 做到。

04:01
Hugging Face

AutoSynthData:为企业级智能体生成训练数据

未提供摘要,无法提炼。

04:00
arXiv cs.AI

长时程语言智能体中的重尾记忆轨迹

揭示智能体记忆呈核心-尾部重尾分布,提出CTWM按秩分配提示预算,节省token并降低尾部预测误差。

04:00
arXiv cs.CV

基于时序分割与语义抽象的自我中心与外部视角程序理解框架

多模态工作视频经边界分割与事件卡片抽象,增量构建工作环境模型,实现隐私约束下紧凑可审计的检索。

04:00
arXiv cs.CV

STATERA:利用冻结时序管片实现零样本仿真到现实运动学的隐藏质量估计

冻结时序管片适配V-JEPA,单目视频零样本估计隐藏质心,仿真到现实迁移最优。

04:00
ArXiv AI

喜剧中的愚人金:对话幽默中的奖励漏洞与对策

研究对话幽默奖励的漏洞与对策:惊喜嵌入奖励易被乱序回复欺骗,笑声线索可被利用;修正后改善但未达预期。

04:00
arXiv cs.CL

Noor超大型阿拉伯语语言模型碳足迹的整体评估

本文综合评估Noor超大型阿拉伯语模型全周期碳足迹,指出推理和外部成本影响显著,并探讨减排路径。

04:00
arXiv cs.LG

逆向项目反应理论:碎片化癌症药物反应矩阵中的稀疏稳健排序

提出逆向项目反应理论,将癌症类型与药物建模为耐药被试与项目,碎片化数据中比简单平均更稳健恢复排序。

04:00
arXiv cs.AI

从提议到可验证效果:Praxa——面向受治理AI智能体执行的证据约束型执行框架

Praxa以证据约束架构显式区分提案、授权、派发与验证效果;四条证据线均未证明性能优越。

04:00
arXiv cs.CV

空间升维用于稠密预测

提出空间升维:将输入提升到高维空间并由3D网络处理,稠密预测性能更优,参数量与推理成本大幅下降。

04:00
arXiv cs.CV

涌现式物体绑定具有有限空间视界

预训练ViT冻结块嵌入可解码同物体信号,但绑定随距离指数衰减至非零下限,呈现有限空间视界。

04:00
arXiv cs.LG

Adam 距离自然梯度下降有多远?

Adam与自然梯度的几何偏离随场景变化,病态下显著,但凭动量平滑仍能有效优化。

04:00
arXiv cs.CL

BudgetSchemaBench:Text-to-SQL 模式上下文的预算扫描式诊断基准

提出预算扫描诊断基准,发现检索覆盖受限时,执行准确率对模式上下文的预算远比对序列化格式敏感。

04:00
arXiv cs.AI

理由究竟传递了什么?角色专精问答中的消息干预研究

忠实理由不提升答案准确率,但受损理由显著改变验证支持判断,故理由共享应作为验证消息机制评估。

04:00
ArXiv AI

衡量微任务合格性差距:现成小语言模型何时足以用于智能体执行框架?

构建4项微任务基准测试现成小模型:均未达阈值,量化无改善;差距源于规模而非精度,宜仅作基线补充。

04:00
arXiv cs.CL

韩国性犯罪案件中的法律文本分类:从传统机器学习到结合XAI洞察的大语言模型

韩国性犯罪判例分类中,微调KLUE-BERT准确率99.3%,优于GPT与传统模型,XAI揭示语境理解局限。

04:00
ArXiv AI

因果世界模型何时有助于模块化 LLM 智能体

因果世界模型仅在跨模块接口可统计识别、且行动时可用时,才有助于模块化 LLM 智能体。

04:00
arXiv cs.CV

编码却脱节:在激活补丁零结果下分解视觉语言模型失败

三种视觉语言模型中层虽编码答案却因果失活,补丁零翻转;错误分为感知失败、编码脱节、先验覆盖,且可学习。

04:00
arXiv cs.CV

目标检测中的域泛化与合成数据:赋能者、探针与鸿沟

目标检测域泛化研究稀缺;合成数据既是赋能者与探针,又存在合成到真实鸿沟,未来需兼顾定位与分类。

04:00
arXiv cs.CL

FACET 在 WMT 2026 自动翻译质量评估任务中

提出免参考免训练FACET,将评估分流畅、准确、一致三通道;另交省略一致通道版,人工译后编辑排名第一。

04:00
arXiv cs.LG

FourierQK:滤波器形状、可容许性与泄漏-覆盖定律

QK注意力消融:抑制直流/奈奎斯特,段落尺度带宽最优,可容许滤波器更优;泄漏随覆盖增,适用双向注意力

04:00
arXiv cs.LG

在多实例强化学习系统中整合公平性与可解释性

研究融合RL-MIL、对抗去偏与偏好超网络的学生风险预测,发现偏好调节失效、模式坍塌,需梯度平衡与目标分离。

04:00
ArXiv AI

面向个性化偏好优化的梯度对齐配对选择

提出GAP-DPO,以效用梯度几何对齐选择偏好对,提升LLM个性化偏好优化效果。

04:00
arXiv cs.CV

可达性不等于泛化:理解装配动作识别中的动–名分解

系统分析三数据集上的动–名分解:泛化主要靠共现插值,失败集中于大词表成分,共享编码器致成分纠缠。

04:00
arXiv cs.LG

面向大语言模型的快速多项式超越函数

用3–4次BF16多项式替代sigmoid、tanh、SiLU,训练吞吐最多提升8%,损失几乎不变。

04:00
arXiv cs.AI

刻画推理时 PRM 剪枝片段嫁接无效的配置:来自三个推理语言模型的证据

PRM剪枝片段嫁接在推理时与独立并行思维链基线无显著差异;触发多未命中真正困难链,跨三模型六基准复现。

04:00
arXiv cs.CL

端侧命名实体识别:准确性、成本、可靠性与置信度的可部署性研究

端侧NER可部署性评测:编码器更可靠,小生成模型无效输出多,置信度需校准。

04:00
arXiv cs.CL

基于结构因果模型(SCM)的法律文书分类公平性与忠实可解释性

公平性正则化未改善人口公平,却持续削弱SHAP解释忠实性,表明公平与解释忠实性解离。

04:00
arXiv cs.CV

看见城市,还是识别地点?VLM城市感知中街景影像较现有城市数据的增量贡献

街景影像的增量价值取决于视觉可读性与本地数据覆盖;部分属性上现有数据已匹敌甚至优于图像。

04:00
arXiv cs.CV

DSSR-3D:3D高斯中视角相关指代的解耦推理

DSSR-3D以解耦推理实现3D高斯视角相关指代分割,免重训练,并提出ViewRef-GS基准。

04:00
arXiv cs.LG

面向快速 FP4 预训练的格式感知融合

格式感知融合协同设计FP4量化布局,Llama-3 8B预训练达37.9K tokens/s/GPU。

04:00
arXiv cs.LG

“非常可能”等于“不确定”?大语言模型在语言不确定性量化上如何与人类分道扬镳

大语言模型为“可能”“很可能”等词赋予的不确定性概率与人类差异显著,新算法从输出中学习标记映射,揭示二者置信语义的系统性偏差。