摘要
8月27日,在第四屆828 B2B企業節開幕式上,華為云宣布其Tokens服務全面接入CloudMatrix384超節點
8月27日,在第四屆828 B2B企業節開幕式上,華為云宣布其Tokens服務全面接入CloudMatrix384超節點,通過xDeepServe架構創新,單芯片最高可實現2400TPS、50msTPOT的超高吞吐、低時延的性能,超過業界水平。

token 是文本數據的基本單位。在以往按卡時計費的基礎上,今年3月,華為云正式推出了基于MaaS的Tokens服務。針對不同應用、不同場景的性能和時延要求,還提供了在線版、進線版、離線版乃至尊享版等多種服務規格,為大模型、Agent智能體等AI工具提供了更為靈活、便捷、低成本的先進算力。而這一次,華為云的Tokens服務正式接入CloudMatrix384,并通過384原生的xDeepServe框架再次實現了吞吐量的突破,從年初的1920TPS提升至2400TPS,TPOT僅為50ms。過去18個月,中國AI算力需求呈現指數級增長。數據顯示,2024年初中國日均Token的消耗量為1000億,截至今年6月底,日均Token消耗量已突破30萬億,1年半的時間增長了300多倍,反映了我國人工智能應用規模快速增長,也對算力基礎設施的需求提出了更大的挑戰。
據悉,目前華為云MaaS服務已支持DeepSeek、Kimi、Qwen、Pangu、SDXL、Wan等主流大模型及versatile、Dify、扣子等主流Agent平臺。
據悉,華為云積累了大量模型性能優化、效果調優的技術和能力,從而實現“源于開源,高于開源”,讓更多大模型可以在昇騰云上跑得更快更好。華為云Tokens服務在性能、模型適配、效果調優方面的基礎,也讓更多企業能夠快速開發和構建AI Agent(AI 智能體)。而在應用層,華為云已與超過100家伙伴攜手深入行業場景,共建豐富的Agent,在調研分析、內容創作、智慧辦公、智能運維等領域解決產業難題,讓企業更便捷地擁抱AI創新,加速智能化。