原標(biāo)題:
“北京、海淀的人才聚集效應(yīng)無可比擬”
月之暗面:做像登月一樣難而正確的事
“我們希望做的事是像登月一樣,難而正確,但一旦成功,可能是對全人類都有非常大的貢獻(xiàn)!比涨,在位于北京海淀的公司總部,月之暗面Kimi企業(yè)業(yè)務(wù)負(fù)責(zé)人黃震昕對北京日報(bào)記者說。
過去一周,月之暗面無疑是全球科技圈“頂流”。其7月16日發(fā)布了全球參數(shù)規(guī)模最大的開源模型Kimi K3。該模型總參數(shù)達(dá)到2.8萬億,具備100萬詞元上下文窗口,在長程編程、知識(shí)工作和復(fù)雜推理等場景中表現(xiàn)尤為突出。
據(jù)了解,參數(shù)規(guī)模決定模型“能裝下多少知識(shí)”,注意力機(jī)制則決定模型“會(huì)不會(huì)抓重點(diǎn)”,能不能從海量信息中快速找到關(guān)鍵、建立聯(lián)系并形成答案。此次,Kimi K3的突破,不僅在于“裝得更多”,更在于處理信息的方式變得更高效。
業(yè)務(wù)人員介紹,Kimi K3的第一項(xiàng)創(chuàng)新,是團(tuán)隊(duì)自主研發(fā)的KDA混合線性注意力機(jī)制。傳統(tǒng)全注意力機(jī)制處理長文本時(shí),計(jì)算量隨文本長度接近平方級增長,模型讀的內(nèi)容增加一倍,計(jì)算量就增至約四倍,這正是超長文本難以落地的關(guān)鍵原因。而月之暗面的新技術(shù),成功將這一效率實(shí)現(xiàn)了接近線性增長。這意味著,在同等算力條件下,模型能讀得更長、處理更多信息、完成更復(fù)雜任務(wù)。
第二項(xiàng)創(chuàng)新,是注意力殘差(Attention Residuals)技術(shù)。長期以來,模型越大、層數(shù)越多,信息傳遞的“路程”就越長,信號(hào)容易衰減、失真,訓(xùn)練也越容易“翻車”,成為全球頭部實(shí)驗(yàn)室共同面對的工程難題。注意力殘差技術(shù)改進(jìn)了信息在不同網(wǎng)絡(luò)層之間的傳遞和復(fù)用方式,相當(dāng)于為巨型模型加裝了一套“穩(wěn)定器”,讓2.8萬億參數(shù)不僅“訓(xùn)得出來”,還能穩(wěn)定高效地用起來。
Kimi K3發(fā)布后迅速引發(fā)海外科技界關(guān)注。特斯拉首席執(zhí)行官埃隆·馬斯克在相關(guān)評測報(bào)道的評論區(qū)留言稱“令人印象深刻”,并將Kimi K3列為其新模型Grok 4.5希望追趕的目標(biāo)。
“最了解我們的不一定是投資人,可能是同行。來自同行的肯定對我們來說還是挺珍貴的。”黃震昕說。在社交媒體上,月之暗面官方對馬斯克的回復(fù)是:“歡迎加入2萬億+俱樂部”。
“我們非常樂見于全球范圍的技術(shù)交流與共享!秉S震昕說,Kimi的許多技術(shù)都已經(jīng)開源,甚至在模型正式發(fā)布前就已將技術(shù)細(xì)節(jié)寫入報(bào)告,向全世界公開。“我們中國AI企業(yè)有這樣的胸襟和氣度,希望馬斯克他們也能做出2萬億級的模型,大家一起共同進(jìn)步。”
在國際上收獲廣泛關(guān)注的同時(shí),不少人對這家聚光燈下的明星公司的成長路徑也頗為關(guān)心,一些人好奇:這樣的成果和公司,為何能出現(xiàn)在北京,出現(xiàn)在海淀?
“北京海淀的人才聚集效應(yīng)無可比擬。”黃震昕表示,包括創(chuàng)始人楊植麟在內(nèi),月之暗面的五位核心創(chuàng)始人,都來自清華大學(xué)。Kimi的投資人之一王慧文曾在社交媒體上感嘆,自己所有投資收益最高的公司,都集中在一個(gè)清華以南、北大以東的“框”里!霸谶@個(gè)區(qū)域里,產(chǎn)生了智譜、Kimi、Seedance這些成果,我認(rèn)為這并不是偶然現(xiàn)象,從人才、政策等方面,我們都得到了很多幫助。”黃震昕說。(記者 孫奇茹)
長按二維碼關(guān)注精彩內(nèi)容





