2026 年 2 月 10 日,智利總統 Gabriel Boric 親自為 Latam-GPT 揭幕:拉丁美洲第一個在區域內開發的開源大型語言模型。計畫由智利國家人工智慧中心 CENIA 主導,主任為 Álvaro Soto,串連 15 個國家、超過 200 名協作者與 33 個機構聯盟,阿根廷、巴西、哥倫比亞、厄瓜多、墨西哥、秘魯與烏拉圭等國的大學、基金會、圖書館與政府單位都參與其中,資金來自 CENIA 自有資源與拉丁美洲開發銀行 CAF。
值得開發者注意的是它的定位:這不是一款面向大眾的聊天機器人,而是一套開放基礎設施——700 億參數、以 Meta Llama 3.1 為基礎、採開源授權,免費提供企業與公共機構下載客製,模型可透過官方網站 latamgpt.org 取得。
從 260 萬份文件長出來的模型
訓練資料是 Latam-GPT 最核心的差異化。模型使用超過 8 TB 的區域資料,來自 260 萬份文件,涵蓋 20 個拉丁美洲國家與西班牙,目前支援西班牙語與葡萄牙語,團隊並計畫納入原住民族語言。背景是一個長期被忽視的數據落差:據報導,西班牙語與葡萄牙語合計僅占現有大型模型訓練資料約 2–3%,模型輸出自然傾向美國與全球北方的視角。
Soto 的說法很直接:「無論大型模型多麼強大,都無法涵蓋與我們現實相關的所有面向。」他舉的例子是文化盲點——模型預設的歷史人物、慣用語與在地脈絡,往往繞著 George Washington 這類美國符號打轉,而不是拉丁美洲使用者真正需要的內容。
主權論述:坐在餐桌前,而不是菜單上
Boric 在發表會上把這個計畫拉到主權層次:Latam-GPT 讓該區域成為「未來經濟中一個主動且主權自主的參與者」,他最廣被引用的一句話是「我們坐在餐桌前——而不是在菜單上」。Tech Policy Press 也引述他將計畫定位為「捍衛我們的身分認同與存在的權利」。
這套論述在 2026 年格外有共鳴。當前沿模型的能力與定價都掌握在少數美國與中國實驗室手上,區域自主的替代路徑只剩下兩條:法規施壓,或自建模型。Latam-GPT 選了後者,而且選了開源——讓任何政府、媒體或新創都能在下載後自行微調,不被迫依賴特定 API。
55 萬美元預算的現實
不過帳本攤開來看,規模差距很殘酷。整個計畫投入約 55 萬美元(CENIA 約 30 萬、CAF 約 25 萬),對比美國與中國動輒數十億美元的模型訓練預算,超過三個數量級。第一版模型是在 AWS 上完成訓練,未來訓練將轉移到智利北部 Arica 的塔拉帕卡大學(University of Tarapacá)超級電腦——該校投資 1,000 萬美元,建成區域內第一座有能力在本地訓練大型模型的超算中心。
應用場景已經具體浮現:Soto 點名醫院物流為潛在用途;創業家 Roberto Musso 的 Digevo 則計畫用它打造能辨識區域「俚語、慣用語甚至語速」的客服工具。這些都是全球模型覆蓋不到、但確實存在的市場。
對照全球開源權重浪潮
質疑者指出兩個風險。第一,OpenAI、Google、Anthropic 等大廠資源壓倒性領先,只需花很少的錢在西班牙語與葡萄牙語資料上微調現有模型,就能抹平 Latam-GPT 的區域優勢。第二,區域政治不穩定可能威脅計畫的長期延續——2009 年 UNASUR 區域光纖計畫的失敗是當地常被提起的前車之鑑。Tech Policy Press 的結論是:Latam-GPT 的真正價值在於建立區域能力與人才,而不是與全球巨頭正面競爭。
放在全球開源權重版圖上看,這個判斷更立體。中國與美國陣營持續釋出開放權重模型,例如 MiniMax 的 M2.5 開放權重編程模型,走的是效能路線;Latam-GPT 走的則是資料主權路線。對產品團隊的啟示很實際:如果你服務西語或葡語市場,現在多了一個可以完全客製、不需支付 API 費用的基底模型——它的價值不在打敗 GPT,而在沒有人能把它從你手上拿走。
參考來源
- LatamGPT Navigates the Gap Between Regional Aspiration and Market Realities — Tech Policy Press
- Latam-GPT: a Latin American AI to combat US-centric bias — France 24
- Chile leads launch of first AI system developed in Latin America — Latin America Reports
本文由 AI 協助自上述來源整理,經人工審核後發布。
