来自实战 第 №244

观点,不是新闻稿

精选首页连接到聚焦的主题与集群页面,让旧文章不会仅因发布时间较早而失去可见性。

按主题探索
06
聚焦集群
12
博客文章
244

最新文章

每页展示九篇文章,并按发布日期排序。

一条语音波形分向托管的 Miso TTS API 与私有自托管 GPU AI 与智能体

Miso TTS 本地部署对比 API:成本、延迟与显存真相

Miso TTS 富有表现力且开放权重,但 110 ms 指托管在 H100 上的 API,并非本地推理。部署前应比较硬件、价格、许可证与生产风险。

MCP 客户端向资源服务器出示绑定受众的令牌,服务器在运行任何工具前先对照身份提供方校验它 AI 与智能体

企业级 MCP 授权架构:多租户参考设计

OAuth 2.1、绑定受众的令牌、禁止令牌透传,是规范的硬性要求。其余的,多租户隔离、按工具的 scope、委托访问与审计,都是你要自己设计的参考架构。两张图讲清整条信任边界。

数据无关向量量化把 float32 embedding 转换成字节数少 16 倍的 2-bit 原始代码 AI 与智能体

把 RAG 向量压缩到 2-bit:数据无关量化能上生产了吗?

TurboQuant 已进入 Qdrant 1.18,TurboVec 也达到 1.0 版。了解 16 倍究竟适用于什么、当前基准如何,以及需要测试什么。

欧盟 AI Act 第50条透明度义务映射为面向 SaaS 聊天机器人、AI 智能体与生成内容的落地清单 商业与监管

面向 SaaS 与 AI 智能体的欧盟 AI Act 第50条落地清单

第50条已于2026年8月2日起适用,欧盟委员会也已启动执法。这份工程清单帮你核查聊天机器人与智能体告知、机器可读标记、深度伪造标签、日志和审计证据,并立即补齐缺口。

同一台服务器上八个各自隔离的按 rank 划分的 KV 缓存,坍缩成一个所有服务进程都能读取的共享主机侧缓存层 AI 与智能体

LMCache 报告共享 KV 缓存让平均 TTFT 降低 13.7 倍

LMCache 报告在一项 Qwen3-235B 多轮基准中,平均 time-to-first-token 从 3.98s 降至 0.29s。本文解释结果能证明什么、不能证明什么,以及如何用自己的负载验证复用。

从精确性、runtime 证据与生产条件对比 BF16 权重无损压缩和 8-bit GGUF 量化 AI 与智能体

LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?

基于事实比较 GLM-5.2、BF16 精确解码、Q8 量化、既有系统、runtime 证据、集群经济性与 14 天 pilot。

付费试点、概念验证与设计合作伙伴的商业证据对比 产品与 MVP

付费试点、PoC 与设计合作伙伴:哪个能验证需求?

根据技术可行性、客户学习或付费意愿选择验证方式,并提供七项付费试点评分与合同简报。

多层 AI Agent 评测沙箱,包含隔离计算、受控出站、临时凭据与带外监控 AI 与智能体

OpenAI 评测沙箱逃逸:测试网络安全 Agent 前的 12 项控制

经事实核查的事件分析与采购清单,覆盖多层隔离、出站、凭据、控制平面分离、benchmark 完整性、监控与取证备用方案。

并行 AI 编程智能体在同一代码库存储之上使用隔离的 Git worktree 或 Jujutsu workspace 交付与 QA

Git Worktree 与 Jujutsu:AI 编程智能体版本控制决策指南(2026)

面向采购决策对比代码库缓存、partial clone、Git worktree 与 Jujutsu workspace,并列出兼容缺口、成本指标和可衡量的 14 天试点。

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。