奇链 · AI工具发现与创作资源导航
每日精选
2026-09-09 · 近期值得发现的新产品
全网热门
社区最认可的开源项目 · 按 GitHub 热度排序
本周榜单
不知道看什么?从这里开始——新发现、生态变动、免费好物,一眼看本周
最近发现
这站活着——采集、关联、版本追踪,每小时都在更新
最新文章
浏览全部 →Shopify 推出 Gisting 新技术:将大模型系统提示词压缩为主旨词元
Shopify 的工程团队推出了一项叫作 Gisting 的新技术,用于将冗长的 LLM 提示词压缩为精简的 “Gist” 词元集合,从而提升吞吐量并降低推理成本。Spotify 强调,在推理阶段用简洁的 Gist 词元替代冗长文本可以降低端到端延迟、减少基础设施成本,并提升词元吞吐量,同时无需修改模型的核心权重。
AI服务器入门 · 第4篇大模型推理服务器部署 vLLM vs TensorRT-LLM选型实战显存计算 + 框架横评 + 生产部署经验
前三篇聊了硬件架构和散热,这篇开始进入"软件层"。大模型训练是少数巨头的游戏,但推理部署是每个AI团队都要面对的工程问题。vLLM、TensorRT-LLM、SGLang到底怎么选?我用实测数据告诉你。开篇:推理部署的三座大山大模型训练完成后,把它变成一个"线上服务"要翻三座山:第一座:显存墙。70B模型FP16权重就要140GB,单卡放不下。
内存成本高企!英伟达Rubin Ultra减配:HBM从12层砍至8层
快科技9月9日消息,英伟达正考虑将下一代Rubin Ultra AI加速器的HBM方案从12层堆叠调整为8层。在存储成本持续上涨的背景下,公司更重视单位带宽成本与整机系统经济性。 市场分析机构SemiAnalysis指出,当前关键约束已从“单位容量成本”转向“单位带宽成本”。预计8层HBM4方案下,Rubin Ultra单颗GPU显存约为192GB,较12层方案的288GB减少约三分之一。
pnpm 12 采用 Rust 语言重写了包管理器,在保留 pnpm 11 工作流的同时提升了安装速度
pnpm 发布 pnpm 12 版本,将原有的 TypeScript 和 Node.js 实现重写为原生 Rust 版本,同时刻意保留了 pnpm 11 的命令、参数、设置、锁定文件格式以及 node_modules 目录结构。此次发布旨在优化启动速度并降低文件系统开销,同时也不需要团队重新学习该包管理器或进行大规模迁移。当缓存或 node_modules 目录已经存在时,性能提升最为显著。