智谱联合清华推出ZCube组网架构:推理吞吐提升15%,网络成本降低33%
admin 2026-05-21 104浏览
ZCube网络架构落地:智谱GLM-5.1coding集群性能跃升,成本直降33% 2026年5月21日,智谱AI正式宣布,由智谱、驭驯网络与清华大学联合研发的ZCube网络架构,已在GLM-5.1coding模型的生产环境中稳...
admin 2026-05-21 104浏览
ZCube网络架构落地:智谱GLM-5.1coding集群性能跃升,成本直降33% 2026年5月21日,智谱AI正式宣布,由智谱、驭驯网络与清华大学联合研发的ZCube网络架构,已在GLM-5.1coding模型的生产环境中稳...
admin 2026-03-27 172浏览
谷歌研究团队发布TurboQuant,将该量化方法应用于大语言模型的KV缓存与向量搜索压缩。该研究旨在解决高维向量在推理与检索过程中占用大量内存,进而推高缓存与相似度搜索成本的问...