GPU

基於 NVIDIA BlueField-4 STX,WEKA 以更低的每 Token 成本將 Token 輸出推至極限

NeuralMesh  Augmented Memory Grid  NVIDIA STX 整合,能在相同 GPU 佔用空間下,將 Token 產量提升 6.5 倍,大減 AI 驅動機構的推理成本

加州聖荷西和加州坎貝爾2026年3月18日 /美通社/ — 在 2026 年圖形處理器 (GPU) 技術大會 (GTC 2026) 上,人工智慧 (AI) 儲存與記憶體系統公司 WEKA 今日宣佈,已將其 NeuralMesh™ 軟體與 NVIDIA STX 參考架構整合。 WEKA 基於 NeuralMesh 執行的突破性 Augmented Memory Grid™ 記憶體擴充套件技術,將支援 NVIDIA STX,為代理型 AI 工廠帶來高吞吐量的情境記憶儲存,使跨會話、工具和任務的長語境推理變得無縫流暢。 基於 NVIDIA STX 的 NeuralMesh 解決方案,運用 NVIDIA Vera Rubin NVL72、NVIDIA BlueField-4 及 NVIDIA Spectrum-X 乙太網絡,預計能將情境記憶體的每秒 Token 生成量提升 4 至 10 倍,同時為 AI 工作負載提供每秒不少於 320 GB 讀取和 150 GB 寫入的吞吐量,較傳統 AI 儲存平臺的吞吐量高出逾一倍。

WEKA 與 NVIDIA 合作實現具成本效益的大規模人工智慧 (AI) 推論。
WEKA 與 NVIDIA 合作實現具成本效益的大規模人工智慧 (AI) 推論。

利用共享鍵 (KV) 快取基礎設施解決推理成本問題
擴充套件代理型系統,尤其在軟體工程應用領域,揭示一個殘酷真相:現今 AI 的經濟效益取決於記憶體基礎設施層。 每個大規模推理叢集都會撞上記憶體牆:GPU 上有限的高頻寬記憶體 (HBM) 很快便耗盡,導致 KV 快取被逐出、情境丟失,系統被迫重複已經完成的工作。 這種架構效率低下,令推理成本急升。 解決之道在於建立共享的 KV 快取基礎設施,讓情境在代理、使用者與會話之間保持活躍。 這樣能消除重複計算、維持 Token 吞吐量,並保持效能穩定可測。 缺乏共享 KV 快取基礎設施的話,每增加一批並發使用者及代理,都會成為負累——成本上漲、體驗變差,推理叢集規模越大,營運就越難。 NVIDIA 推出專為語境記憶而設的 STX,提供一套藍圖,旨在破解核心推理瓶頸。

上下文記憶體儲存:代理型 AI 工廠的基礎
透過基於 NVIDIA STX 架構聯合設計的 WEKA 解決方案,AI 雲端、企業及 AI 模型構建者,均可部署所需基建,讓 GPU 以頂尖效能執行,維持海量 Token 生成,同時提升大規模推理的能源效益及成本效益。

領先在前的 AI 創新者及雲端供應商,例如 Firmus,已開始應用 NeuralMesh 上的 Augmented Memory Grid,重塑其推理經濟模式。

Firmus 技術總監 Daniel Kearney 表示:「現實世界的 AI 並非在實驗室執行,而是要面對電力限制、散熱限制,以及源源不絕的工作負載需求。 Firmus 正是為此而生。 與 NVIDIA AI 基礎設施雙劍合璧之下,WEKA Augmented Memory Grid 可於大規模執行時,實現每秒 Token 數提升 6.5 倍,首個 Token 生成時間 (TTFT) 加快 4 倍,證明在相同 GPU 配置下,效能可提升至更高層次。 隨著 NeuralMesh 和 Augmented Memory Grid 整合到我們與 NVIDIA 一致的 AI Factory 和 NVIDIA STX 參考架構中,就能提供最快的情境記憶體網路,實現可預測且高效的大規模推理。」

NeuralMesh  NVIDIA STX:專為代理型 AI 而設
NeuralMesh 是 WEKA 建基於超過 170 項專利的智慧自適應儲存系統。 這將貫穿全棧 STX 參考架構,為企業提供所需的新一代儲存方案,旨在將高效能 AI 資料服務標準化,從而加快實現代理型 AI 的價值。 WEKA 的 Augmented Memory Grid 是專為擴充套件記憶體而設的技術層,能於 GPU 記憶體以外,將 KV 快取整合成池並持久儲存。即使推理工作負載不斷增加,長情境會話依然穩定,並發量亦能維持高水平。 Augmented Memory Grid 於 GTC 2025 首次亮相,今日起正式向 NeuralMesh 客戶全面供應。該技術已在 Supermicro 平臺上,搭配 NVIDIA Grace 中央處理器 (CPU) 及 BlueField-3 資料處理單元 (DPU) 完成驗證,能帶來多項提升 AI 成本效益的優勢,包括:

  • 戶體驗,大幅躍升:NeuralMesh 上的 Augmented Memory Grid 能將首個 Token 生成時間大幅縮短 4 至 20 倍,確保 AI 代理及應用程式在真實負載下依然反應迅速。
  • 相同硬體,收益更高:毋須增建基礎設施,每個 GPU 就能多處理 6.5 倍的 Token。
  • 規模擴張,效能恆久:隨著會話、代理及情境視窗增加,Augmented Memory Grid 依然能維持高 KV 快取命中率,避免純 DRAM 架構出現效能急跌的瓶頸。
  • GPU 原生效率:整合 BlueField-4 能將儲存資料路徑從 CPU 解除安裝,讓 GPU 全速運算,並消除輸入/輸出 (I/O) 瓶頸從此絕跡。

WEKA 聯合創始人兼行政總裁 Liran Zvibel 表示:「隨著編碼大型語言模型 (LLM) 不斷進步,軟體工程領域對代理型 AI 應用的採納程度可謂前所未見,生產力因此提升了 100 到 1000 倍。 當編碼助手反覆呼叫近乎相同的程式碼庫及提示時,WEKA 的 Augmented Memory Grid 會重複使用已快取的語境,即使語境視窗長度已發展至難以置信,亦不用強制進行冗餘的預填充。 此舉大幅縮短回應時間,亦讓同一基礎設施上支援的並發使用者數目顯著增加。 WEKA 在一年多前便率先洞悉市場對情境記憶儲存的需求,並於 GTC 2025 推出 Augmented Memory Grid。 如今,NVIDIA STX 的出現,為企業開啟大門,讓其能在最先進的 NVIDIA Vera Rubin 架構(包括 NVIDIA BlueField-4 及 NVIDIA Spectrum-X 乙太網絡)上,執行儲存及記憶體擴充套件基礎設施。 為 NVIDIA STX 在 NeuralMesh 上執行 Augmented Memory Grid,將帶來無與倫比的效能及效率,直接實現顛覆市場的 AI 成本效益。」

供應情況

WEKA 的 Augmented Memory Grid 現已隨 NeuralMesh 一併正式推出市場。

今天對記憶體高牆視而不見的企業,日後將會面對更艱難、更昂貴的擴充套件挑戰。 隨著代理型工作負載增加,情境視窗不斷擴大,純 DRAM 架構將面對成本持續疊加的問題:每新增一個並發使用者或會話,重算開銷、GPU 閒置時間及營運成本便隨之上升。 現在就為持久 KV 快取規劃架構的企業,將比那些等待觀望的對手取得結構性成本及效能優勢。

如欲進一步瞭解 NeuralMesh,請瀏覽:weka.io/NeuralMesh
如欲進一步瞭解 Augmented Memory Grid,請瀏覽:weka.io/augmented-memory-grid

企業可瀏覽 weka.io/nvidia 獲取更多資訊,或親臨 GTC 2026 大會 WEKA 的 #1034 展位參觀。

關於 WEKA
WEKA 正憑藉其自適應智慧網格儲存系統 NeuralMesh™ by WEKA®,徹底革新機構建立、執行和擴充套件 AI 工作流程的模式。 有別於傳統資料基礎設施會隨著工作負載擴充套件而變得緩慢不穩,NeuralMesh 在擴容時反而會變得更快速、更穩健、更高效。它能動態適應 AI 環境,為企業 AI 及代理型 AI 的創新,提供靈活穩固的基石。 NeuralMesh 備受財富 50 強中 30% 企業的信賴,致力協助頂尖企業、AI 雲端供應商及 AI 建構者,充分發揮 GPU 效能、加快 AI 擴充套件步伐,並降低創新成本。 在 www.weka.io 瞭解更多,或在 LinkedIn 及 X 與我們聯絡。

WEKA  W 標誌為 WekaIO, Inc. 的註冊商標。本文中出現的其他商業名稱,可能為其各自擁有者的商標

WEKA: The Foundation for Enterprise AI
WEKA: The Foundation for Enterprise AI

 

「數位無限」完成2.25億元募資,和順興、富邦、國泰、鉅杉共同參與,加速海外拓展與研發佈局

臺北2025年12月4日 /美通社/ — 專注於GPU算力排程與AI基礎設施管理的軟體公司數位無限(INFINITIX)宣佈,已完成新臺幣2.25億元募資,本輪募資完成後,公司估值逾10億元,持續朝IPO挺進。本輪投資陣容包括鴻海與中信金控合資的和順興創投、富邦金控創投、國泰創投及鉅杉資本等投資人。募集資金將用於擴增研發人力、深化產品技術、拓展國際通路,進一步強化公司在全球AI基礎設施市場的競爭力和市佔率。

數位無限 INFINITIX 執行長 陳文裕(左)、營運長陳宗逸(右)
數位無限 INFINITIX 執行長 陳文裕(左)、營運長陳宗逸(右)

數位無限曾協助臺灣官方打造國家級AI算力中心,展現其在AI基礎設施建置與運營的深厚實力。公司以AI-Stack為核心產品,協助企業智慧化排程GPU資源、提高硬體利用率及投資報酬率;而新產品ixCSP雲端服務解決方案協助企業建立以 GPU 為核心的AI雲端服務,整合計費引擎、Token管理與模型市集,推出GPU/Model/Token-as-a-Service等商業模式,為AI資料中心提供從運算資源整合、效能最佳化到雲端服務營運的全方位支援,加速資料中心建置與商業化落地。

數位無限執行長陳文裕表示:「此次募資是市場對我們產品技術與營運模式的高度肯定。我們將持續深化與國際夥伴的合作,推動AI基礎設施升級,讓數位無限成為AI算力服務的核心樞紐。」;營運長陳宗逸補充:「我們將把新資金投入研發團隊擴充以深化產品與技術的領先,並加速佈局國際市場,建立各地代理商網路及技術支援中心,邁向新一階段成長。」

為推動國際成長,數位無限近年積極拓展海外市場,今年公司已與中國大陸、日本、韓國、東南亞多家知名資訊業者簽訂代理與技術合作協議,在當地建立銷售與技術支援網路、拓展當地市場,加速數位無限在亞洲主要市場的落地程序,並已實際於亞洲多地完成軟體建置實績,同時也開始探索歐美市場的發展性;未來公司將結合策略投資人資源,深化與全球科技領導者的合作,持續在國際AI生態中扮演關鍵角色。

【關於數位無限INFINITIX】 Beyond AI, to infinity

數位無限自2017年以來即聚焦於GPU算力排程與AI基礎設施管理,憑藉領先的技術實力與跨產業成功案例,持續定義企業AI運算解決方案的新標竿。於2021年即榮獲NVIDIA「Solution Advisor」全球夥伴成員;於2025年初頒獲「AMD GPU 生態建設夥伴獎」,奠定其在兩大國際晶片巨頭生態系中的關鍵戰略地位。瞭解更多:www.infinitix.ai

 

⚠️ 重要提醒: 注意募資資訊的真實性,避免虛假宣傳或誤導性陳述。關注公司估值是否合理,是否存在虛高情況。警惕內幕交易或操縱市場等風險。

Supermicro擴大氣冷式效能與效率型AI解決方案產品組合可支援AMD Instinct™ MI355X GPU

  • Supermicro擴大其AI加速型解決方案,新增搭載AMD Instinct MI355X GPU的10U氣冷伺服器機組,為AI與推論工作負載提供空前的效能
  • 這款全新10U伺服器是基於Supermicro資料中心建構元件解決方案(Data Center Building Block Solutions®,DCBBS)技術與架構,可提供穩固、最佳化的效能,並能加速開發與產品上市時程
  • 與較早世代的產品相比,該伺服器可實現最高4倍的AI運算效能強化,以及最高35倍的推論效能提升¹

加州聖荷西和聖路易2025年11月20日 /美通社/ — Super Micro Computer, Inc.(NASDAQ:SMCI)作為AI、雲端、儲存和5G/邊緣領域的全方位IT解決方案供應商,宣佈擴大其AMD Instinct™ MI350系列GPU最佳化解決方案,推出全新系統機型,提供空前的效能,以及極高的可擴充性和能源效率。Supermicro針對同時需要AMD Instinct MI355X GPU的高規格效能和氣冷式環境的機構單位,量身打造了這款全新系統。

 

AS-A126GS rack front
AS-A126GS rack front

 

Supermicro科技與AI資深副總裁Vik Malyala表示:「Supermicro領先業界,憑藉深厚的技術經驗,為客戶提供高效能AI與HPC解決方案。而Supermicro的DCBBS技術使我們能快速整合AMD解決方案,並透過經驗證的資料中心產品,將先進技術推向市場。本次推出的全新氣冷AMD Instinct MI355X GPU系統,不僅擴大並強化了我們的AI解決方案產品系列,也可為客戶的新一代資料中心建置專案提供更多選擇。」

瞭解更多:https://www.supermicro.com/en/accelerators/amd

Supermicro再次擴大液冷與氣冷式高效能產品線,並推出全新10U氣冷伺服器。這些系統採用現有的業界標準型OCP Accelerator Module(OAM)架構,並提供288GB HBM3e記憶體/GPU、8TB/s頻寬,而系統的熱設計功耗(TDP)也從1000W提升至1400W。與8U氣冷式MI350X系統相比,這些全新10U氣冷伺服器能達到兩位數的效能倍數提升,使客戶能更快速地處理資料。Supermicro MI355X GPU伺服器產品線的10U新機型,也可助力客戶在大規模氣冷或液冷基礎設施內,實現更高的每機架效能(Performance Per Rack)。

AMD資料中心GPU事業部業務開發副總裁Travis Karr表示:「AMD很高興能與Supermicro合作並推出氣冷式AMD Instinct MI355X GPU,幫助客戶更輕鬆地在現有運算設施內匯入先進的AI效能。同時,AMD與Supermicro也共同在運算效能與效率方面領先市場,提供新一代AI與HPC解決方案,加速全球資料中心的革新。」

這些GPU解決方案可為雲端服務供應商(Cloud Service Provider)與企業環境提供大規模式的最大AI與推論效能。Supermicro擴大了搭載AMD Instinct MI350系列GPU的加速型AI伺服器產品系列,並結合Supermicro DCBBS架構與AMD最新第4代CDNA架構,再次彰顯出其次世代資料中心解決方案的技術,率先將先進的AI解決方案推向市場。此外,這些搭載AMD Instinct GPU的全新Supermicro伺服器也在SC25大會內重磅亮相(大會地點:美國密蘇裡州聖路易)。

目前,搭載AMD Instinct MI355X GPU的Supermicro 10U伺服器現已開始供貨。

深入瞭解基於AMD Instinct MI355X的Supermicro 10U氣冷伺服器

註1:AMD Instinct MI350 Series and Beyond: Accelerating the Future of AI and HPC

關於Super Micro Computer, Inc.

Supermicro(納斯達克股票程式碼:SMCI)為應用最佳化全方位IT解決方案的全球領導者。Supermicro的成立據點及營運中心位於美國加州聖荷西,致力為企業、雲端、AI和5G電信/邊緣IT基礎架構提供領先市場的創新技術。我們是全方位IT解決方案製造商,提供伺服器、AI、儲存、物聯網、交換器系統、軟體及支援服務。Supermicro的主機板、電源和機箱設計專業進一步推動了我們的發展與產品生產,為全球客戶實現了從雲端到邊緣的下一代創新。我們的產品皆由企業內部團隊設計及製造(在美國、亞洲及荷蘭),透過全球化營運實現極佳的規模與效率,並藉營運最佳化降低總體擁有成本(TCO),以及經由綠色運算技術減少環境衝擊。屢獲殊榮的Server Building Block Solutions®產品組合,讓客戶可以自由選擇這些具高度彈性、可重複使用且極為多元的建構式組合系統,我們支援各種外形尺寸、處理器、記憶體、GPU、儲存、網路、電源和散熱解決方案(空調、自然氣冷或液冷),因此能為客戶的工作負載與應用提供最佳的效能。

Supermicro、Server Building Block Solutions和We Keep IT Green皆為Super Micro Computer, Inc. 的商標和/或註冊商標。所有其他品牌、名稱和商標皆為其各自所有者之財產。

AS-A126GS front
AS-A126GS front

 

AMD MI355X
AMD MI355X

 

 

⚠️ 重要提醒: 注意商標使用規範,避免虛假宣傳。評估出口管制風險。