来自实战 第 №164

观点,不是新闻稿

精选首页连接到聚焦的主题与集群页面,让旧文章不会仅因发布时间较早而失去可见性。

按主题探索
06
聚焦集群
12
博客文章
164

最新文章

每页展示九篇文章,并按发布日期排序。

用于本地 AWS 集成测试的 Floci、LocalStack 与 AWS SAM 对比 交付与 QA

Floci 对比 LocalStack:2026 年 AWS 本地模拟器选型指南

从服务覆盖、行为保真度、许可、CI 适配到低风险迁移,核查 Floci、LocalStack、AWS SAM 与真实 AWS 的采购差异。

一条语音波形分向托管的 Miso TTS API 与私有自托管 GPU AI 与智能体

Miso TTS 本地部署对比 API:成本、延迟与显存真相

Miso TTS 富有表现力且开放权重,但 110 ms 指托管在 H100 上的 API,并非本地推理。部署前应比较硬件、价格、许可证与生产风险。

MCP 客户端向资源服务器出示绑定受众的令牌,服务器在运行任何工具前先对照身份提供方校验它 AI 与智能体

企业级 MCP 授权架构:多租户参考设计

OAuth 2.1、绑定受众的令牌、禁止令牌透传,是规范的硬性要求。其余的,多租户隔离、按工具的 scope、委托访问与审计,都是你要自己设计的参考架构。两张图讲清整条信任边界。

数据无关的向量量化把稠密的 float32 embedding 场压缩成紧凑的 2-bit 桶格,内存缩小 16 倍 AI 与智能体

把 RAG 向量内存压到 1/16:数据无关量化能上生产了吗?

一个新的 Rust 索引用 Google 免训练的 TurboQuant 把 1000 万 embedding 从 31 GB 压到 4 GB。方法证明了什么、在哪胜过 FAISS、recall 的取舍,以及如何试点。

欧盟 AI Act 第50条透明度义务映射为面向 SaaS 聊天机器人、AI 智能体与生成内容的落地清单 商业与监管

面向 SaaS 与 AI 智能体的欧盟 AI Act 第50条落地清单

第50条自2026年8月2日起适用。这份工程落地清单涵盖:聊天机器人与智能体告知、C2PA 机器可读标记、深度伪造标签、公共利益文本、日志,以及审计时需要拿得出的证据。

同一台服务器上八个各自隔离的按 rank 划分的 KV 缓存,坍缩成一个所有服务进程都能读取的共享主机侧缓存层 AI 与智能体

共享 KV 缓存在不新增 GPU 的情况下把 LLM 推理延迟降低 14x

一个开源 KV 缓存层在一个 235B 模型上把平均 time-to-first-token 从 3.98s 降到 0.29s。同样的 GPU,同样的内存。它让八个进程不再各自囤积私有缓存。改变了什么,以及它对你有没有帮助。

从精确性、runtime 证据与生产条件对比 BF16 权重无损压缩和 8-bit GGUF 量化 AI 与智能体

LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?

基于事实比较 GLM-5.2、BF16 精确解码、Q8 量化、既有系统、runtime 证据、集群经济性与 14 天 pilot。

付费试点、概念验证与设计合作伙伴的商业证据对比 产品与 MVP

付费试点、PoC 与设计合作伙伴:哪个能验证需求?

根据技术可行性、客户学习或付费意愿选择验证方式,并提供七项付费试点评分与合同简报。

多层 AI Agent 评测沙箱,包含隔离计算、受控出站、临时凭据与带外监控 AI 与智能体

OpenAI 评测沙箱逃逸:测试网络安全 Agent 前的 12 项控制

经事实核查的事件分析与采购清单,覆盖多层隔离、出站、凭据、控制平面分离、benchmark 完整性、监控与取证备用方案。

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。