從ChatGPT到智能代理

撰文

人工智慧如何從「聊天工具」,進化為「能夠執行任務的工作夥伴」?

  很多人對人工智慧的印象,至今仍然停留在一句話:「AI,不就是ChatGPT嗎?」

  然而,自2022年底ChatGPT掀起全球熱潮以來,人工智慧的發展已迅速跨越多個階段。短短三年多,AI從一個回答問題、整理資料和撰寫文字的聊天工具,逐步進化為能夠分析、規劃、編程、看圖、生成影音,甚至代替人類操作電腦並執行複雜任務的智能系統。

  這場科技革命最令人震撼的,不只是AI變得更聰明,而是它的發展週期正在被極度壓縮。

  過去,一項重要科技可能需要十年才逐漸普及;今天,一種全新的AI能力,可能在幾個月內便從研究室走進辦公室,再從少數專家的工具,變成人人都能使用的日常服務。

  我們所面對的,已不只是一次軟體升級,而是一場正在重新定義工作、產業、教育,甚至國家競爭力的結構性變革。

DeepSeek帶來的震盪:開源生態引爆AI競賽加速
  早期的大型AI模型,主要掌握在少數美國科技巨頭手中。模型研發成本極高,推出速度也相對緩慢,往往相隔半年甚至一年,才會出現一次顯著的版本更新。

  然而,近年中國開源模型迅速崛起,徹底改變了整個市場的競爭節奏。

  DeepSeek的出現尤其引起全球關注。它向市場證明:新興團隊未必需要與科技巨頭擁有完全相同的資源,也可以透過模型架構、訓練方式與成本控制,開發出極具競爭力的產品。

  DeepSeek之後,字節跳動的「豆包」、智譜的「GLM」、阿里巴巴的「通義千問」等模型相繼進場,使中美之間的AI競爭變得更加熾熱。

開源,為甚麼能改變戰局?
  所謂「開源」,是指開發者在不同程度上公開模型、程式碼或技術架構,讓全球研究人員與企業可以下載、修改、測試和再開發。對新興公司而言,開源不只是技術理想,更是一種突破重圍的市場策略。

  一家原本默默無聞的公司,只要推出高水準的開源模型,就能在短時間內躍上國際舞台,吸引國際關注、開發者與資金湧入。當世界各地的工程師開始使用、測試並改良它這個模型時,這家公司也等同於擁有了一支龐大的「全球研發隊伍」。

  開源模型的迅速進步,迫使OpenAI、Anthropic、Google、Meta,以及Elon Musk旗下的xAI等巨頭加快產品更新,加速推出更強的推理、多模態和智能代理功能。

  結果是:AI產業不再按照過去的速度逐步前進,而是進入一場幾乎沒有休息時間的「科技軍備競賽」。

AI為甚麼如此昂貴?從「五層蛋糕論」看背後競爭
  AI看似只是一個手機應用程式,或網頁上的對話框,但在簡潔介面的背後,卻是一套極其龐大的產業生態系統。

  NVIDIA執行長黃仁勳曾以多層架構來解釋AI產業。我們可以把整個AI生態想像成一個「五層蛋糕」。

  最上層是各種AI應用(聊天、辦公、翻譯、設計、影音生成);第四層是AI模型的(大型語言模型、多模態模型);第三層是基礎設施(數據中心、伺服器與網絡設備);第二層是硬體運算(高階AI晶片、GPU/NPU);而最底層則是能源支撐(電力供應、冷卻與散熱系統)。

  人們最容易看見的是最上層的應用,例如ChatGPT、Gemini、Claude、Copilot,以及各種圖像和影片生成工具。但真正決定AI能否繼續擴張的,往往是下面幾層:晶片、數據中心、散熱系統和電力供應。

  訓練大型模型需要數以萬計的高階晶片同時運作;模型推出後,每天回應全球龐大使用者,更需要持續消耗海量的運算資源。這場競爭已不只是「誰的聊天機械人比較聰明」,而是誰能取得更多晶片、建造更多數據中心,以及獲得更穩定、便宜的能源。

晶片與數據中心成為新戰場
  高階AI晶片供應緊張,使NVIDIA成為這場科技革命的重要贏家。同時,Google、Amazon、微軟等大型企業也積極研發自研晶片,希望能降低對單一供應商的依賴。

  數據中心的需求同樣急升。一個大型數據中心的用電量,可以相當驚人。當全球企業競相建立更多AI系統時,電力供應便逐漸成為一個不能忽視的限制。部分科技企業已開始研究核能、再生能源和更高效率的液冷散熱技術;甚至提出在太空興建數據中心的長期構想,希望利用太陽能和低溫環境解決供電與散熱問題。

  這些構想反映了一個事實:AI的競爭,正在從軟體世界延伸到能源、製造與實體基礎建設。

核心演進:從「會回答」進化為「會做事」
  大家經常聽見的LLM(Large Language Model,大語言模型」。

  基本原理是根據大量文字資料,預測一句話接下來最可能出現甚麼內容。它可以寫得流暢、回答得有條理,但這不等於它具有人類的感情、意識或物理經驗。

  傳統的大語言模型非常擅長「處理語言」,卻未必真正理解我們所生活的物理世界。為此,科學界正在全力發「世界模型(World Model)」,目標是讓AI不只懂文字,還能理解空間、時間、因果關係和物理規律。

  例如,一個人知道玻璃杯跌在石地上可能會破裂,不只是因為讀過這句話,也因為他對重量、硬度、重力和碰撞有生活經驗。

  然而,現階段對商業世界影響最深遠的突破,是另一項關鍵能力:AI Agent(智能代理)

Chatbot與AI Agent兩者有甚麼分別?
  傳統AI聊天機械人主要是被動回應。

  你問一個問題,它回答一個問題;你下達一個指令,它提供文字、答案或生成內容。

  AI智能代理則不只回答,而是能夠根據目標主動規劃,拆解任務、選擇工具、自主執行,並檢查結果。

  例如,你不再只是指令AI:「幫我寫一封會議邀請電郵。」

  而是可以交給它一個完整任務:「找出下星期三有空的時段,草擬會議邀請郵件、整理相關文件,列出議程,待我確認後發送給參加者。」

  為了完成任務,AI智能代理會使用工具與跨系統執行能力去搜尋資料、閱讀電郵、查看日曆、整理文件、撰寫程式、操作網頁,以及追蹤任務進度。

  這種轉變極為關鍵。過去人類使用電腦,是自己逐一點擊按鍵、開啟程式和執行指令;未來,我們只需要說明目標,剩下的繁雜步驟將全權由AI安排並完成。

  AI因而不再只是個「回答問題的工具」,而正轉變成一個「可以代辦工作的數位助手」。

有記憶、有性格的「個人化AI Agent」
  近期不少開源智能代理專案受到高度關注,正是因為它們讓使用者可以在自己的電腦上,建立較個人化的AI助手。

  與每次對話都像「重新認識你」的傳統 Chatbot 不同,進階的AI智能代理能夠保存你的個人偏好、延續工作記憶,甚至可以根據長期互動,形成一種專屬於你的運作默契與回應風格。

  然而,這種強大的能力也伴隨著全新的風險:

  隱私安全性:AI記錄的個人數據與密碼資料愈多,私隱洩露風險也愈高。

  授權與容錯:當AI被賦予操作系統的權限愈多,一旦誤解指令,可能導致錯刪重要郵件或修改錯誤檔案的後果。

  因此,未來AI Agent發展的核心課題,不只是「它能做多少事」,更是「如何在明確的授權、監察和安全限制下幫人類精準做事」。

結語:我們距離AGI還有多遠? 
  當AI不僅能夠處理文字、使用工具、執行任務,甚至開始參與程式開發與「協助訓練下一代AI」時,一個更核心的問題已呼之欲出:

  AI是否正在加速邁向具備跨領域能力的「通用人工智慧(AGI)」 ?

  下一期,我們將進一步探討AI如何自我進化、甚麼是AGI的終極型態,以及這場競賽如何從科技巨頭之間的商業角力,演變為攸關國家實力與個人職場存亡的結構洗牌。

*人工智能生成圖片

撰文:周百通

其他文章: