文/林裕洋 本刊特約記者 圖/Shutterstock
從 ChatGPT 掀起生成式 AI 熱潮,到近兩年AI Agent 概念迅速普及,整個產業關注焦點正發生根本性的轉移。過去大家討論的是「模型能不能回答得更聰明」,如今則轉向「Agent能不能自主完成任務」。這項轉變看似僅是應用層的升級,實際上卻對底層運算架構提出全新要求。
由於AI Agent 模型應用執行過程中,需要頻繁感知環境、呼叫工具並進行多步驟推理,這代表模型會被反覆呼叫,而非如過去單純問答般偶爾互動。當模型調用頻率大幅提升,對雲端 API(Application Programming Interface)的依賴所產生的成本與延遲問題也會被進一步放大。例如當企業中的數百名員工同時使用雲端Agent 助理處理日常流程,光是雲端推論費用就相當驚人,更遑論尖峰時段的延遲會直接影響使用體驗。
因此,將AI運算能力下放到終端裝置,自然成為產業發展的必然趨勢。根據 Gartner 預估,2027 年將有 40% 的企業 AI 工作負載從純雲端轉移至邊緣端與SLM(Small Language Model)執行,預期未來幾年將有更多 AI 推論工作從雲端移轉至終端執行。這股浪潮不只是技術路線的選擇,更牽動晶片設計、硬體規格與商業模式的全面轉型。
專為特定用途設計
小型語言模型推陳出新
早期談到大語言模型,模型的「參數量愈大愈聰明」幾乎是共識,千億甚至兆級參數的超大語言模型,一度被視為效能天花板的保證。
然而,隨著近年模型壓縮、量化與知識蒸餾技術日益成熟,3B 至 8B 參數等級的小型模型,在特定任務上的表現,已能追平甚至超越前一代大型模型。
以量化技術為例,可將模型權重從 32 位元浮點數(FP32)壓縮至 8 位元甚至 4 位元,在僅犧牲少量準確度的情況下,大幅降低記憶體占用與運算負擔。知識蒸餾則如同讓小模型向大模型「拜師學藝」,透過模仿大模型的輸出機率分布,使其在有限參數內汲取接近大模型的推理能力。這些技術的疊加,讓終端裝置也能順利運行足以應付日常需求的語言模型,同時兼顧模型效能與裝置資源限制。
隨著邊緣運算需求升溫,Google Gemma、Microsoft Phi、Meta Llama 3.2、阿里巴巴Qwen 等小型模型陸續受到市場關注。相較於追求更大的參數規模,這些模型更強調輕量化與運算效率,讓生成式AI能進一步部署在手機、筆電及車用系統等邊緣裝置上。例如,一個專為客服對話微調的 3B 模型,其回答品質往往優於未經微調的百億參數通用模型。
這代表AI模型「參數量」已非唯一效能指標,模型的資料調校與任務適配能力,才是決定實際應用成效的關鍵。
低延遲、離線與隱私
終端 AI優勢浮現
終端 AI能在短時間內成為產業焦點,關鍵在於可同時解決雲端服務長期存在的四大痛點。
第一是低延遲性。在工業檢測、語音助理等需要即時反應的應用場景中,若資料需要先傳到雲端運算再傳回結果,中間網路往返時間往往會嚴重影響使用者體驗。將推論運算放在終端裝置上執行,資料無需離開機台或裝置本身,反應時間可大幅壓縮到毫秒等級,這對於生產線上的瑕疵檢測以及人機互動至關重要。
第二是離線運作能力。許多應用場景無法保證隨時擁有穩定的網路連線,例如車用系統在偏遠地區行駛、國防與救災設備在通訊中斷環境下運作,或是偏鄉地區用於教育及醫療的應用。Edge AI能讓裝置在沒有網路連線的情況下,依然維持基本智慧功能,這是雲端方案難以實現的。
第三是資料隱私性。隨著各國資安法規日益嚴格,企業對於敏感資料是否會外洩到第三方雲端伺服器的疑慮日增,尤其是在醫療、金融、國防等高度監管的產業中。將 AI 推論留在企業內部或裝置本地執行,可避免資料離開受控環境,大幅降低法規遵循的複雜度與外洩風險。
第四是長期成本可控性。雲端 API 計費模式通常按呼叫次數或 token 用量收費,使用量愈大成本愈高,且會隨著使用規模不斷累積。相較之下,企業雖然需要投入終端裝置初期採購費用,但後續使用過程中幾乎沒有邊際費用產生,所以對於需要大量推論的企業應用而言,將推論服務運算轉移到終端執行時,自然有機會降低長期總持有成本(TCO)。
NPU、GPU協作 重新定義AI架構
目前大型語言模型正朝向超大型化與小型化兩大方向發展,然若要在終端裝置上真正順暢運行推論服務,仍需仰賴硬體端的AI算力協助,這也讓 NPU(Neural Processing Unit,神經網路處理單元)成為終端 AI 裝置的核心元件。
過去 NPU 多半被視為輔助 CPU、GPU 處理特定任務的加速單位,如今隨著 AI PC 的興起,NPU 已成為晶片業者積極搶進的重點。各家業者也紛紛以 TOPS(每秒兆次運算)作為重要規格指標,推出算力更高、功耗更低的新一代NPU。目前無論是筆記型電腦、平板電腦或工業電腦所搭載的處理器,都已內建高算力NPU,這也反映出市場對終端 AI 推理能力的需求日益迫切。
在終端裝置中,NPU主要負責低功耗、效率導向的AI工作負載,但並非所有AI運算都適合交由NPU處理。當應用涉及影像、聲音等多模態運算,或需要執行較複雜的模型推理時,GPU憑藉高度平行的運算架構,便能提供額外的運算能力。因此,許多終端裝置逐漸採用NPU與GPU協同運作的混合架構,將輕量且適合AI加速的任務交由NPU處理,較複雜或高運算量的工作負載則由GPU負責,藉此兼顧運算效能與能源效率。
在既有的 NPU 與 GPU 架構之外,市場上也逐漸出現更多針對 AI 推理需求而設計的方案,包括各類 AI ASIC(Application Specific Integrated Circuit)與 IP 授權服務。相較於強調通用運算能力的 GPU,這類方案通常會針對特定的神經網路運算與資料流進行硬體優化,以降低不必要的運算與功耗,進而在相同功耗下提供更高的推理效率。
由於在手機、筆電、車載與各類邊緣裝置等終端場景中,受限於電池容量、散熱空間與整體功耗,單純堆高算力並不足以帶來更好的使用體驗,如何在有限的功耗下維持穩定且高效的 AI 推理能力,才是更關鍵的競爭力。此趨勢對晶片設計業者而言,代表產品競爭力已不再只是比拚「能跑多少算力」,而是進一步比拚「每一瓦能完成多少運算」,也讓能效比(TOPS/W,即每瓦所能提供的運算能力)成為評估 AI 晶片的重要指標。
當終端裝置的運算能力足以承接愈來愈多 AI推論工作,企業採購邏輯也將隨之改變。從過去聚焦於「該選哪家雲端服務」,現今則已開始轉向考量終端硬體規格、模型部署方式,以及哪些工作負載適合留在本地、哪些應交由雲端處理等流程。換言之,終端 AI 的崛起並非單純將 AI 從雲端搬到裝置,而是重新思考 AI 運算在雲端、邊緣與終端之間的分工。