AI數(shù)據(jù)部門升咖:數(shù)據(jù)團(tuán)隊(duì)為何不交給科學(xué)家?)
字節(jié) AI 數(shù)據(jù)部門“升咖”組織架構(gòu)升級背后為什么數(shù)據(jù)團(tuán)隊(duì)仍然沒有交給科學(xué)家最近字節(jié)跳動(dòng) AI 數(shù)據(jù)部門迎來了一次重要的組織調(diào)整。從公開信息來看字節(jié)的一部分?jǐn)?shù)據(jù)相關(guān)團(tuán)隊(duì)正在轉(zhuǎn)崗至 Core Data 部門而這一變動(dòng)也被外界解讀為 AI 數(shù)據(jù)部門在字節(jié)內(nèi)部的“升咖”。但有意思的是這次架構(gòu)調(diào)整中數(shù)據(jù)團(tuán)隊(duì)并沒有直接劃歸到 Seed字節(jié)的大模型團(tuán)隊(duì)或者交給科學(xué)家體系管理。這一動(dòng)作背后到底釋放了什么信號對做 AI 工程、數(shù)據(jù)工程、大模型應(yīng)用的人來說又意味著什么這篇文章我想從組織架構(gòu)變化、數(shù)據(jù)團(tuán)隊(duì)在大模型時(shí)代的定位、以及“為什么不交給科學(xué)家”這三個(gè)角度拆解一下這次調(diào)整背后的邏輯。同時(shí)也會(huì)結(jié)合 AI 數(shù)據(jù)工程的實(shí)際場景聊聊數(shù)據(jù)團(tuán)隊(duì)在模型訓(xùn)練、數(shù)據(jù)治理、數(shù)據(jù)標(biāo)注、評測迭代中扮演的真實(shí)角色。這不是一篇內(nèi)部爆料而是基于公開信息的技術(shù)與組織分析供大家參考。1. 字節(jié) AI 數(shù)據(jù)部門“升咖”這次調(diào)整到底改了什么先看這次調(diào)整的核心事實(shí)。根據(jù)公開報(bào)道字節(jié)跳動(dòng)的部分 AI 數(shù)據(jù)團(tuán)隊(duì)正在轉(zhuǎn)崗至 Core Data 部門。Core Data 是字節(jié)內(nèi)部負(fù)責(zé)數(shù)據(jù)中臺(tái)、數(shù)據(jù)基礎(chǔ)設(shè)施、數(shù)據(jù)治理等方向的核心部門。換句話說原本分散在 AI 業(yè)務(wù)線或者大模型項(xiàng)目組里的數(shù)據(jù)團(tuán)隊(duì)開始向一個(gè)更加中心化的數(shù)據(jù)基礎(chǔ)部門集中。這件事為什么值得關(guān)注因?yàn)樗从沉艘粋€(gè)趨勢在大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)的地位正在從“支撐角色”向“核心角色”遷移。過去數(shù)據(jù)團(tuán)隊(duì)在大部分互聯(lián)網(wǎng)公司里屬于“中臺(tái)部門”服務(wù)的對象是業(yè)務(wù)方、算法團(tuán)隊(duì)、分析團(tuán)隊(duì)。數(shù)據(jù)團(tuán)隊(duì)的工作價(jià)值往往通過“別人用數(shù)據(jù)做了什么”來體現(xiàn)自身很難直接量化。但在大模型時(shí)代數(shù)據(jù)不再是輔助決策的“石油”而是模型能力的“直接組成部分”。一條高質(zhì)量的數(shù)據(jù)樣本可能直接決定模型在某個(gè)任務(wù)上的表現(xiàn)上限。數(shù)據(jù)團(tuán)隊(duì)的工作從“支撐業(yè)務(wù)”變成了“定義模型能力邊界”。所以字節(jié)把 AI 數(shù)據(jù)團(tuán)隊(duì)升咖、集中到 Core Data本質(zhì)上是在做一件事把數(shù)據(jù)從項(xiàng)目制資源升級為組織級基礎(chǔ)設(shè)施。這里有一個(gè)值得注意的細(xì)節(jié)這次調(diào)整強(qiáng)調(diào)的方向是“集中”和“基礎(chǔ)化”而不是“項(xiàng)目化”和“垂直化”。什么意思如果數(shù)據(jù)團(tuán)隊(duì)直接劃給 Seed 大模型團(tuán)隊(duì)那數(shù)據(jù)團(tuán)隊(duì)會(huì)變成大模型項(xiàng)目的“附屬資源”服務(wù)對象單一數(shù)據(jù)建設(shè)也容易圍繞短期項(xiàng)目目標(biāo)展開。但把數(shù)據(jù)團(tuán)隊(duì)放到 Core Data意味著數(shù)據(jù)建設(shè)會(huì)朝著平臺(tái)化、復(fù)用化、基礎(chǔ)設(shè)施化的方向走。數(shù)據(jù)團(tuán)隊(duì)服務(wù)的對象就不只是一個(gè)模型團(tuán)隊(duì)而是整個(gè)字節(jié)的 AI 生態(tài)。這個(gè)判斷是理解整件事的關(guān)鍵。2. 為什么數(shù)據(jù)團(tuán)隊(duì)沒有交給科學(xué)家組織邏輯與技術(shù)邏輯的雙重考量很多人第一反應(yīng)是AI 數(shù)據(jù)部門升咖了為什么不直接交給 Seed 或者科學(xué)家團(tuán)隊(duì)管理科學(xué)家不是最懂?dāng)?shù)據(jù)質(zhì)量的人嗎這個(gè)問題恰恰是這次調(diào)整最值得琢磨的地方。2.1 科學(xué)家的核心能力是建模不是數(shù)據(jù)工程先看技術(shù)分工。大模型團(tuán)隊(duì)里的科學(xué)家核心能力集中在模型架構(gòu)設(shè)計(jì)、訓(xùn)練策略優(yōu)化、評測方案設(shè)計(jì)、算法創(chuàng)新這些方向。他們的核心交付物是“模型”而不是“數(shù)據(jù)”。但是高質(zhì)量數(shù)據(jù)集的構(gòu)建是一項(xiàng)系統(tǒng)工程。它涉及數(shù)據(jù)采集、數(shù)據(jù)清洗、數(shù)據(jù)標(biāo)注、數(shù)據(jù)增強(qiáng)、數(shù)據(jù)版本管理、數(shù)據(jù)質(zhì)量評估、數(shù)據(jù)安全與合規(guī)、數(shù)據(jù)流水線建設(shè)等大量工程化工作。舉個(gè)例子。一個(gè)用于訓(xùn)練大模型的指令微調(diào)數(shù)據(jù)集從原始數(shù)據(jù)到最終可用的訓(xùn)練集通常要經(jīng)過以下流程數(shù)據(jù)源接入與采樣數(shù)據(jù)去重與清洗敏感信息識別與過濾數(shù)據(jù)分類與打標(biāo)指令模板設(shè)計(jì)與改寫人工標(biāo)注與審核數(shù)據(jù)質(zhì)量抽檢數(shù)據(jù)版本管理與發(fā)布這中間真正需要科學(xué)家深度參與的其實(shí)是“指令模板設(shè)計(jì)與改寫”和“數(shù)據(jù)質(zhì)量抽檢標(biāo)準(zhǔn)制定”這兩個(gè)環(huán)節(jié)。而其他環(huán)節(jié)更多是數(shù)據(jù)工程、數(shù)據(jù)治理、產(chǎn)線管理的問題。如果把數(shù)據(jù)團(tuán)隊(duì)直接交給科學(xué)家管理會(huì)出現(xiàn)什么情況科學(xué)家會(huì)把數(shù)據(jù)團(tuán)隊(duì)當(dāng)成“標(biāo)注資源池”今天需要什么數(shù)據(jù)就提需求明天模型迭代又要換一批數(shù)據(jù)。數(shù)據(jù)團(tuán)隊(duì)會(huì)陷入“需求驅(qū)動(dòng)”的被動(dòng)模式很難有精力去建設(shè)通用、復(fù)用、高質(zhì)量的數(shù)據(jù)基礎(chǔ)設(shè)施。2.2 數(shù)據(jù)團(tuán)隊(duì)的交付對象不只是大模型團(tuán)隊(duì)再看業(yè)務(wù)需求。字節(jié)的業(yè)務(wù)線非常多從抖音、今日頭條到飛書、剪映再到各類 AI 應(yīng)用。每條業(yè)務(wù)線都需要數(shù)據(jù)支持。如果把數(shù)據(jù)團(tuán)隊(duì)全部劃給 Seed那其他業(yè)務(wù)線的數(shù)據(jù)需求怎么辦再建一套數(shù)據(jù)團(tuán)隊(duì)這顯然不經(jīng)濟(jì)。更合理的做法是數(shù)據(jù)團(tuán)隊(duì)作為 Core Data 的一部分向全公司提供統(tǒng)一的數(shù)據(jù)能力。大模型團(tuán)隊(duì)是重點(diǎn)客戶之一但不是唯一客戶。這里的組織邏輯和“中臺(tái)戰(zhàn)略”是一脈相承的。數(shù)據(jù)中臺(tái)的核心價(jià)值就是能力的復(fù)用。在大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)的能力復(fù)用價(jià)值不但沒有減弱反而因?yàn)閿?shù)據(jù)質(zhì)量對模型效果的影響越來越大變得更加重要。2.3 “沒有交給科學(xué)家”其實(shí)是一種更成熟的組織設(shè)計(jì)從組織設(shè)計(jì)的角度看“數(shù)據(jù)團(tuán)隊(duì)不歸科學(xué)家管”不是貶低數(shù)據(jù)團(tuán)隊(duì)恰恰是對數(shù)據(jù)團(tuán)隊(duì)專業(yè)性的認(rèn)可。數(shù)據(jù)團(tuán)隊(duì)需要的是獨(dú)立的技術(shù)棧和管理體系。數(shù)據(jù)工程師關(guān)心的是數(shù)據(jù)管道穩(wěn)定性、數(shù)據(jù)質(zhì)量指標(biāo)、數(shù)據(jù)治理規(guī)范、存儲(chǔ)與計(jì)算成本。這些和科學(xué)家關(guān)心的模型指標(biāo)、訓(xùn)練效率、評測分?jǐn)?shù)雖然有交集但不能互相替代。如果數(shù)據(jù)團(tuán)隊(duì)和科學(xué)家團(tuán)隊(duì)混在一起管理很容易出現(xiàn)以下問題數(shù)據(jù)團(tuán)隊(duì)的績效難以獨(dú)立評估容易受模型短期效果波動(dòng)影響數(shù)據(jù)團(tuán)隊(duì)的技術(shù)規(guī)劃容易被項(xiàng)目需求打斷無法形成長期積累數(shù)據(jù)團(tuán)隊(duì)的人才晉升通道不清晰數(shù)據(jù)工程師的價(jià)值很難被看見。把數(shù)據(jù)團(tuán)隊(duì)放在 Core Data相當(dāng)于在組織層面承認(rèn)數(shù)據(jù)建設(shè)本身是一項(xiàng)專業(yè)工作需要獨(dú)立的技術(shù)積累和管理體系。3. 大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)的核心價(jià)值正在被重新定義字節(jié)這次調(diào)整表面上是組織架構(gòu)變化本質(zhì)上是對“數(shù)據(jù)團(tuán)隊(duì)在大模型時(shí)代應(yīng)該承擔(dān)什么角色”的一次重新定義。過去數(shù)據(jù)團(tuán)隊(duì)的價(jià)值可以用四個(gè)字概括支持業(yè)務(wù)。做報(bào)表、搭數(shù)倉、跑分析核心是服務(wù)決策。但在大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)的價(jià)值正在變成定義模型能力邊界。大模型的訓(xùn)練與迭代本質(zhì)上是一個(gè)“數(shù)據(jù)飛輪”數(shù)據(jù)質(zhì)量決定模型能力的上限模型能力決定產(chǎn)品體驗(yàn)的上限產(chǎn)品使用產(chǎn)生新的數(shù)據(jù)新數(shù)據(jù)反哺模型迭代。在這個(gè)飛輪里數(shù)據(jù)團(tuán)隊(duì)處于最上游。數(shù)據(jù)團(tuán)隊(duì)交付的數(shù)據(jù)質(zhì)量直接影響后面所有環(huán)節(jié)的效果。所以你會(huì)發(fā)現(xiàn)在大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)的工作內(nèi)容發(fā)生了幾個(gè)重要變化3.1 從“數(shù)據(jù)管理”到“數(shù)據(jù)生產(chǎn)”傳統(tǒng)的數(shù)據(jù)團(tuán)隊(duì)主要工作是“管理”已經(jīng)產(chǎn)生的數(shù)據(jù)采集、清洗、存儲(chǔ)、分析。數(shù)據(jù)是業(yè)務(wù)過程的副產(chǎn)品。但大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)開始主動(dòng)“生產(chǎn)”數(shù)據(jù)設(shè)計(jì)數(shù)據(jù)配比、構(gòu)造訓(xùn)練樣本、生成指令數(shù)據(jù)、組織人工標(biāo)注、進(jìn)行數(shù)據(jù)增強(qiáng)。數(shù)據(jù)不再是被動(dòng)產(chǎn)生的而是為了模型能力目標(biāo)主動(dòng)設(shè)計(jì)的。舉個(gè)例子。訓(xùn)練一個(gè)代碼生成模型你需要的不只是“網(wǎng)上已有的開源代碼”還需要設(shè)計(jì)各種指令模板、構(gòu)造不同難度的編程題目、組織人工編寫高質(zhì)量代碼樣本、設(shè)計(jì)代碼錯(cuò)誤修復(fù)的數(shù)據(jù)對。這些數(shù)據(jù)不是天然存在的需要數(shù)據(jù)團(tuán)隊(duì)主動(dòng)生產(chǎn)。3.2 從“追求數(shù)據(jù)量”到“追求數(shù)據(jù)質(zhì)量”以前做數(shù)據(jù)分析數(shù)據(jù)量越大統(tǒng)計(jì)意義越強(qiáng)結(jié)論越可靠。但在大模型訓(xùn)練里數(shù)據(jù)量不等于數(shù)據(jù)質(zhì)量甚至數(shù)據(jù)量過大會(huì)帶來負(fù)面影響。訓(xùn)練數(shù)據(jù)里的重復(fù)樣本、低質(zhì)量樣本、錯(cuò)誤樣本會(huì)被模型“學(xué)進(jìn)去”導(dǎo)致模型生成質(zhì)量下降。所以大模型團(tuán)隊(duì)對數(shù)據(jù)質(zhì)量的要求是“精”而不是“多”。這帶來一個(gè)核心變化數(shù)據(jù)團(tuán)隊(duì)的核心指標(biāo)從“產(chǎn)出了多少數(shù)據(jù)”變成“數(shù)據(jù)質(zhì)量合格率是多少”“低質(zhì)量數(shù)據(jù)占比降到多少”“數(shù)據(jù)錯(cuò)誤對模型效果的負(fù)面影響降低了多少”。3.3 從“一次性交付”到“持續(xù)迭代”傳統(tǒng)的數(shù)據(jù)需求基本是“提需求-開發(fā)-交付”的一次性模式。但大模型的數(shù)據(jù)需求是持續(xù)的、循環(huán)的。模型每迭代一個(gè)版本都需要新的數(shù)據(jù)。數(shù)據(jù)團(tuán)隊(duì)需要建設(shè)的是“數(shù)據(jù)流水線”而不是“數(shù)據(jù)項(xiàng)目”。數(shù)據(jù)流水線的意思是從數(shù)據(jù)采集、處理、標(biāo)注、質(zhì)檢到發(fā)布的完整流程可以自動(dòng)、持續(xù)、穩(wěn)定地運(yùn)行。3.4 從“成本中心”到“核心競爭力”過去數(shù)據(jù)團(tuán)隊(duì)在很多公司里被看作“成本中心”投入大、產(chǎn)出難以量化。但大模型時(shí)代數(shù)據(jù)團(tuán)隊(duì)的產(chǎn)出可以直接對標(biāo)模型效果。一個(gè)高質(zhì)量的數(shù)據(jù)集可能讓模型在某個(gè)任務(wù)上的準(zhǔn)確率提升幾個(gè)百分點(diǎn)。這種價(jià)值是可以用業(yè)務(wù)指標(biāo)直接衡量的。字節(jié)這次把 AI 數(shù)據(jù)部門升咖到 Core Data本質(zhì)上是承認(rèn)數(shù)據(jù)團(tuán)隊(duì)不是成本中心而是 AI 時(shí)代的基礎(chǔ)設(shè)施。4. 從這次調(diào)整看 AI 數(shù)據(jù)工程的核心技術(shù)棧聊完了組織邏輯我們落地到技術(shù)層面。如果數(shù)據(jù)團(tuán)隊(duì)要承擔(dān)起“定義模型能力邊界”的角色那 AI 數(shù)據(jù)工程師需要掌握哪些核心技術(shù)能力結(jié)合當(dāng)前大模型數(shù)據(jù)的熱門方向我認(rèn)為以下六個(gè)方向是 AI 數(shù)據(jù)工程的核心技術(shù)棧。4.1 數(shù)據(jù)采集與數(shù)據(jù)源管理大模型訓(xùn)練需要的數(shù)據(jù)來源非常多樣公開網(wǎng)頁數(shù)據(jù)開源代碼倉庫學(xué)術(shù)論文與書籍結(jié)構(gòu)化數(shù)據(jù)庫用戶行為數(shù)據(jù)需合規(guī)授權(quán)人工生產(chǎn)的數(shù)據(jù)數(shù)據(jù)采集不是簡單地把數(shù)據(jù)“抓下來”而是要解決數(shù)據(jù)源的覆蓋度、時(shí)效性、合規(guī)性、更新頻率等問題。對于一個(gè)數(shù)據(jù)團(tuán)隊(duì)來說建設(shè)統(tǒng)一的數(shù)據(jù)源管理平臺(tái)是第一步。4.2 數(shù)據(jù)清洗與數(shù)據(jù)去重這是數(shù)據(jù)工程里最基礎(chǔ)也最重要的環(huán)節(jié)。大模型訓(xùn)練數(shù)據(jù)里常見的“臟數(shù)據(jù)”包括重復(fù)數(shù)據(jù)同一個(gè)文本出現(xiàn)多次會(huì)導(dǎo)致模型過擬合噪音數(shù)據(jù)HTML 標(biāo)簽、亂碼、無意義符號低質(zhì)量數(shù)據(jù)短文本、無信息量文本、病句有害數(shù)據(jù)違反安全規(guī)范的內(nèi)容、越獄指令、隱私信息。數(shù)據(jù)清洗的目標(biāo)是在不損失有效信息的前提下把噪音和低質(zhì)量數(shù)據(jù)降到最低。這里想多說一句去重。很多人低估了數(shù)據(jù)去重對大模型訓(xùn)練的重要性。如果訓(xùn)練數(shù)據(jù)里有大量的重復(fù)文本模型會(huì)把這些文本當(dāng)成“重點(diǎn)知識”來學(xué)習(xí)導(dǎo)致模型對其他低頻知識的記憶能力變差。高質(zhì)量的去重是大模型訓(xùn)練數(shù)據(jù)建設(shè)的第一步。4.3 數(shù)據(jù)標(biāo)注與指令數(shù)據(jù)構(gòu)建指令微調(diào)SFT階段需要大量高質(zhì)量的人工標(biāo)注數(shù)據(jù)。如何管理標(biāo)注團(tuán)隊(duì)、設(shè)計(jì)標(biāo)注規(guī)范、控制標(biāo)注質(zhì)量是數(shù)據(jù)團(tuán)隊(duì)的核心能力。此外指令數(shù)據(jù)的構(gòu)建也是一個(gè)技術(shù)活。不是簡單地把問題-答案對收集起來就行而是要設(shè)計(jì)數(shù)據(jù)配比確保模型在數(shù)學(xué)、代碼、邏輯推理、知識問答、創(chuàng)意生成等能力上的均衡發(fā)展。4.4 數(shù)據(jù)增強(qiáng)與合成數(shù)據(jù)當(dāng)真實(shí)數(shù)據(jù)不夠用或者質(zhì)量不夠高時(shí)就需要數(shù)據(jù)增強(qiáng)。在 CV 領(lǐng)域數(shù)據(jù)增強(qiáng)已經(jīng)很成熟了比如旋轉(zhuǎn)、裁剪、加噪。但在 NLP 和大模型領(lǐng)域數(shù)據(jù)增強(qiáng)還在快速演化中。現(xiàn)在比較熱門的方向是合成數(shù)據(jù)用大模型生成訓(xùn)練數(shù)據(jù)。比如用 Teacher 模型生成一批高質(zhì)量的問答對再經(jīng)過清洗和人工審核作為 Student 模型的訓(xùn)練數(shù)據(jù)。這種方式在數(shù)學(xué)推理、代碼生成、角色對話等場景中已經(jīng)有不少落地案例。不過合成數(shù)據(jù)也有風(fēng)險(xiǎn)。如果合成數(shù)據(jù)的分布和真實(shí)數(shù)據(jù)分布偏差過大會(huì)導(dǎo)致模型在真實(shí)場景中表現(xiàn)不穩(wěn)定。所以合成數(shù)據(jù)通常是作為真實(shí)數(shù)據(jù)的補(bǔ)充而不是替代。4.5 數(shù)據(jù)版本管理與數(shù)據(jù)血緣大模型的訓(xùn)練數(shù)據(jù)會(huì)頻繁迭代。一個(gè)數(shù)據(jù)集從 v1 到 v2中間可能經(jīng)歷了多輪清洗、標(biāo)注、增強(qiáng)。如何管理數(shù)據(jù)集的版本如何追溯一條數(shù)據(jù)從哪里來、經(jīng)過了什么處理這就是數(shù)據(jù)版本管理和數(shù)據(jù)血緣要做的事。數(shù)據(jù)血緣的價(jià)值在于當(dāng)模型效果出現(xiàn)問題時(shí)能夠快速定位是訓(xùn)練數(shù)據(jù)中的哪一部分導(dǎo)致的。如果數(shù)據(jù)血緣不清晰出了問題只能“全量回滾”效率非常低。4.6 數(shù)據(jù)質(zhì)量評估與監(jiān)控?cái)?shù)據(jù)質(zhì)量不能靠“感覺”需要一套量化指標(biāo)來評估。常見的數(shù)據(jù)質(zhì)量指標(biāo)包括完整性數(shù)據(jù)字段是否有缺失一致性同一實(shí)體在不同數(shù)據(jù)源中是否一致準(zhǔn)確性數(shù)據(jù)內(nèi)容是否正確時(shí)效性數(shù)據(jù)是否過期安全性是否包含敏感信息。在大模型訓(xùn)練場景中還需要關(guān)注數(shù)據(jù)分布指標(biāo)數(shù)據(jù)在類別、長度、難度、領(lǐng)域上的分布是否合理。如果訓(xùn)練數(shù)據(jù)中代碼數(shù)據(jù)占比過高模型可能在其他領(lǐng)域上的表現(xiàn)會(huì)下降。數(shù)據(jù)配比的合理性通常需要用實(shí)驗(yàn)來驗(yàn)證。5. 從“關(guān)系數(shù)據(jù)庫里的數(shù)據(jù)”到“大模型能讀懂的數(shù)據(jù)”這次字節(jié)的組織調(diào)整也讓我聯(lián)想到一個(gè)在數(shù)據(jù)工程領(lǐng)域被反復(fù)討論的問題如何把關(guān)系數(shù)據(jù)庫里的數(shù)據(jù)加工成大模型能讀懂的數(shù)據(jù)很多企業(yè)積累了大量的業(yè)務(wù)數(shù)據(jù)這些數(shù)據(jù)存儲(chǔ)在 MySQL、PostgreSQL、Oracle 等關(guān)系型數(shù)據(jù)庫中。但大模型無法直接“讀懂”結(jié)構(gòu)化數(shù)據(jù)。模型需要的是自然語言文本。于是從結(jié)構(gòu)化數(shù)據(jù)到自然語言文本的轉(zhuǎn)換就成了企業(yè)落地大模型應(yīng)用必須解決的問題。這里給出一個(gè)通用的處理思路。5.1 第一步理解數(shù)據(jù)結(jié)構(gòu)關(guān)系數(shù)據(jù)庫里的數(shù)據(jù)以表Table為單位組織表之間通過主外鍵關(guān)聯(lián)。要處理和轉(zhuǎn)換這些數(shù)據(jù)第一步是理解數(shù)據(jù)庫的 Schema。核心要做的事包括了解每張表的字段含義了解表之間的關(guān)聯(lián)關(guān)系了解數(shù)據(jù)的更新頻率和時(shí)效性識別敏感字段和需要脫敏的字段。建議通過編寫數(shù)據(jù)字典把每張表的 Schema 和業(yè)務(wù)含義文檔化。數(shù)據(jù)字典是后續(xù)所有工作的基礎(chǔ)。5.2 第二步設(shè)計(jì)數(shù)據(jù)抽取與預(yù)處理流程根據(jù)后續(xù)使用場景決定抽取哪些數(shù)據(jù)以及如何處理。關(guān)鍵步驟按時(shí)間范圍抽取數(shù)據(jù)過濾掉明顯無效的數(shù)據(jù)對敏感字段進(jìn)行脫敏處理將多個(gè)相關(guān)表進(jìn)行關(guān)聯(lián)形成完整的業(yè)務(wù)記錄。這一步的技術(shù)難點(diǎn)是如何保證抽取的數(shù)據(jù)能夠覆蓋完整的業(yè)務(wù)邏輯。比如用戶的“訂單記錄”和“退單記錄”分布在不同的表里抽取時(shí)需要做關(guān)聯(lián)否則后續(xù)生成的文本就會(huì)缺少關(guān)鍵信息。5.3 第三步將結(jié)構(gòu)化數(shù)據(jù)轉(zhuǎn)為文本描述這一步是核心。常見的轉(zhuǎn)換方式有兩種第一種是模板化轉(zhuǎn)換。設(shè)計(jì)統(tǒng)一的文本模板將結(jié)構(gòu)化數(shù)據(jù)填充進(jìn)去。例如將訂單表數(shù)據(jù)轉(zhuǎn)換為用戶張三在2024年6月1日下單購買了商品A數(shù)量2件單價(jià)199元實(shí)付金額358元優(yōu)惠40元支付方式為微信支付。第二種是語義化轉(zhuǎn)換。針對特定任務(wù)把結(jié)構(gòu)化數(shù)據(jù)轉(zhuǎn)換成更自然的語言描述。比如用于客服問答場景時(shí)可以把訂單數(shù)據(jù)轉(zhuǎn)換成“用戶咨詢話術(shù)”和“客服回答話術(shù)”的對話對。這兩種方式各有優(yōu)劣。模板化轉(zhuǎn)換效率高、準(zhǔn)確率高但自然度一般語義化轉(zhuǎn)換更接近真實(shí)場景但成本更高需要結(jié)合大模型生成和人工審核。5.4 第四步構(gòu)建可訓(xùn)練或可檢索的數(shù)據(jù)集轉(zhuǎn)換后的文本需要根據(jù)應(yīng)用場景進(jìn)一步加工如果用于模型微調(diào)需要整理成“輸入-輸出”的樣本對并做數(shù)據(jù)配比如果用于 RAG檢索增強(qiáng)生成需要做文本切塊、向量化并構(gòu)建向量索引如果用于評估需要構(gòu)建評測集附上標(biāo)準(zhǔn)答案或評估規(guī)則。這一步的產(chǎn)出才是大模型真正能“讀懂”的數(shù)據(jù)。這個(gè)流程看起來不復(fù)雜但在實(shí)際項(xiàng)目里幾乎每一步都有坑。最典型的坑有兩個(gè)一個(gè)是數(shù)據(jù)脫敏沒做好導(dǎo)致敏感信息泄漏另一個(gè)是表關(guān)聯(lián)邏輯不對導(dǎo)致轉(zhuǎn)換后的文本語義錯(cuò)誤。建議在項(xiàng)目初期用小樣本先把整個(gè)流程跑通再逐步放大數(shù)據(jù)量。6. 數(shù)據(jù)團(tuán)隊(duì)升咖后對 AI 應(yīng)用開發(fā)的三個(gè)實(shí)際影響回到字節(jié)這次調(diào)整。數(shù)據(jù)團(tuán)隊(duì)從業(yè)務(wù)線剝離、集中到 Core Data看起來是一次內(nèi)部組織變動(dòng)但它會(huì)對 AI 應(yīng)用開發(fā)產(chǎn)生實(shí)際影響。6.1 影響一數(shù)據(jù)能力將更加平臺(tái)化數(shù)據(jù)團(tuán)隊(duì)集中管理后數(shù)據(jù)能力會(huì)以平臺(tái)化的方式對外輸出。AI 應(yīng)用開發(fā)者不需要自己去對接各個(gè)業(yè)務(wù)線的數(shù)據(jù)團(tuán)隊(duì)而是直接使用統(tǒng)一的數(shù)據(jù)平臺(tái)能力。這意味著AI 應(yīng)用開發(fā)中的數(shù)據(jù)獲取成本會(huì)下降數(shù)據(jù)質(zhì)量會(huì)更有保障。對于開發(fā)者來說這是一件好事。6.2 影響二數(shù)據(jù)治理和合規(guī)的要求會(huì)更高數(shù)據(jù)團(tuán)隊(duì)集中到 Core Data 后數(shù)據(jù)治理和數(shù)據(jù)合規(guī)的邊界會(huì)變得更加清晰。所有數(shù)據(jù)資產(chǎn)統(tǒng)一管理敏感數(shù)據(jù)的識別、脫敏、權(quán)限管控也更容易標(biāo)準(zhǔn)化。對 AI 應(yīng)用開發(fā)者來說這意味著使用數(shù)據(jù)時(shí)需要更加關(guān)注合規(guī)要求。特別是在涉及用戶隱私數(shù)據(jù)的場景中數(shù)據(jù)權(quán)限申請、數(shù)據(jù)使用留痕會(huì)成為標(biāo)準(zhǔn)流程。6.3 影響三數(shù)據(jù)工程崗位的需求會(huì)持續(xù)增加這次調(diào)整釋放了一個(gè)信號數(shù)據(jù)團(tuán)隊(duì)在大廠組織架構(gòu)中的地位在上升。隨之而來的是數(shù)據(jù)工程相關(guān)崗位的需求持續(xù)增加。特別是以下三類人才懂大模型訓(xùn)練數(shù)據(jù)建設(shè)的數(shù)據(jù)工程師懂?dāng)?shù)據(jù)治理和數(shù)據(jù)合規(guī)的數(shù)據(jù)架構(gòu)師懂?dāng)?shù)據(jù)標(biāo)注產(chǎn)線管理和質(zhì)量控制的 AI 數(shù)據(jù)產(chǎn)品經(jīng)理。如果你正在考慮技術(shù)方向AI 數(shù)據(jù)工程是一個(gè)值得關(guān)注的領(lǐng)域。它不像算法崗位那樣有很高的數(shù)學(xué)門檻但對工程能力、數(shù)據(jù)敏感度、業(yè)務(wù)理解力的要求很高是一個(gè)“越老越吃香”的方向。7. 數(shù)據(jù)團(tuán)隊(duì)建設(shè)中的常見問題與思考不管是字節(jié)這樣的大廠還是正在做 AI 應(yīng)用的中小團(tuán)隊(duì)數(shù)據(jù)團(tuán)隊(duì)建設(shè)都會(huì)遇到一些共性問題。這里整理幾個(gè)典型的場景并聊聊我的思考。7.1 數(shù)據(jù)團(tuán)隊(duì)?wèi)?yīng)該放在業(yè)務(wù)線還是中臺(tái)這是組織設(shè)計(jì)中最常見的問題。業(yè)務(wù)線擁有數(shù)據(jù)團(tuán)隊(duì)優(yōu)點(diǎn)是響應(yīng)快、貼近業(yè)務(wù)缺點(diǎn)是容易重復(fù)建設(shè)、數(shù)據(jù)標(biāo)準(zhǔn)不統(tǒng)一。中臺(tái)擁有數(shù)據(jù)團(tuán)隊(duì)優(yōu)點(diǎn)是標(biāo)準(zhǔn)化、復(fù)用性強(qiáng)缺點(diǎn)是可能離業(yè)務(wù)遠(yuǎn)、響應(yīng)慢。字節(jié)的這次調(diào)整給出的答案更偏向“中臺(tái)化”。但實(shí)際落地中很多公司會(huì)采用“雙軌制”中臺(tái)數(shù)據(jù)團(tuán)隊(duì)負(fù)責(zé)基礎(chǔ)設(shè)施和通用數(shù)據(jù)能力業(yè)務(wù)線保留少量數(shù)據(jù)開發(fā)人員負(fù)責(zé)業(yè)務(wù)側(cè)的數(shù)據(jù)需求對接。這個(gè)模式的核心是明確中臺(tái)與業(yè)務(wù)線的邊界中臺(tái)負(fù)責(zé)“建好路”業(yè)務(wù)線負(fù)責(zé)“用好路”。7.2 如何評估數(shù)據(jù)團(tuán)隊(duì)的產(chǎn)出價(jià)值數(shù)據(jù)團(tuán)隊(duì)的產(chǎn)出不像算法團(tuán)隊(duì)那樣有直接的指標(biāo)比如模型準(zhǔn)確率、召回率。所以數(shù)據(jù)團(tuán)隊(duì)的績效評估在很多公司是一個(gè)難題。在大模型時(shí)代我建議用“數(shù)據(jù)對模型效果的影響”來評估數(shù)據(jù)團(tuán)隊(duì)而不是用“產(chǎn)出了多少數(shù)據(jù)”來評估。比如可以設(shè)計(jì)這樣的評估維度數(shù)據(jù)質(zhì)量合格率抽檢數(shù)據(jù)樣本中的合格比例數(shù)據(jù)交付及時(shí)率數(shù)據(jù)是否按計(jì)劃交付給模型訓(xùn)練團(tuán)隊(duì)數(shù)據(jù)迭代效果數(shù)據(jù)更新后模型在評測集上的指標(biāo)變化數(shù)據(jù)基礎(chǔ)設(shè)施效率數(shù)據(jù)平臺(tái)的處理效率、穩(wěn)定性、成本指標(biāo)。這些維度不一定適用所有團(tuán)隊(duì)但方向是明確的數(shù)據(jù)團(tuán)隊(duì)的評估要圍繞“數(shù)據(jù)對業(yè)務(wù)/模型的實(shí)際貢獻(xiàn)”來設(shè)計(jì)而不是圍繞“工作量”來設(shè)計(jì)。7.3 如何避免數(shù)據(jù)團(tuán)隊(duì)變成“標(biāo)注團(tuán)隊(duì)”在大模型團(tuán)隊(duì)里數(shù)據(jù)團(tuán)隊(duì)很容易被“降級”為標(biāo)注管理團(tuán)隊(duì)——只負(fù)責(zé)組織人力做標(biāo)注技術(shù)含量低話語權(quán)弱。要避免這一點(diǎn)數(shù)據(jù)團(tuán)隊(duì)需要主動(dòng)向上游和下游延伸向上游延伸參與數(shù)據(jù)采集方案設(shè)計(jì)、數(shù)據(jù)源選擇、數(shù)據(jù)配比規(guī)劃向下游延伸參與數(shù)據(jù)質(zhì)量對模型效果的影響分析、數(shù)據(jù)迭代策略制定。換句話說數(shù)據(jù)團(tuán)隊(duì)不能只做“執(zhí)行”還要做“規(guī)劃”和“分析”。如果數(shù)據(jù)團(tuán)隊(duì)只被動(dòng)響應(yīng)需求那就很難擺脫“標(biāo)注團(tuán)隊(duì)”的定位。8. 給數(shù)據(jù)工程師與 AI 開發(fā)者的實(shí)踐建議最后結(jié)合這次字節(jié)調(diào)整和行業(yè)趨勢給正在做數(shù)據(jù)方向或者對 AI 數(shù)據(jù)工程感興趣的開發(fā)者一些具體建議。8.1 重視數(shù)據(jù)質(zhì)量的量化評估數(shù)據(jù)質(zhì)量不能靠“感覺”要建立量化指標(biāo)體系。建議從完整性、一致性、準(zhǔn)確性、時(shí)效性、安全性、分布合理性幾個(gè)維度設(shè)計(jì)指標(biāo)并形成數(shù)據(jù)質(zhì)量報(bào)告。大模型訓(xùn)練數(shù)據(jù)尤其要關(guān)注數(shù)據(jù)分布指標(biāo)避免數(shù)據(jù)配比失衡導(dǎo)致模型能力偏差。8.2 建立數(shù)據(jù)血緣意識在做數(shù)據(jù)清洗、轉(zhuǎn)換、增強(qiáng)時(shí)要養(yǎng)成記錄數(shù)據(jù)血緣的習(xí)慣。哪條數(shù)據(jù)來自哪里、經(jīng)過了哪些處理、最后被哪個(gè)模型使用都要有記錄。建議使用數(shù)據(jù)版本管理工具每次數(shù)據(jù)變更都生成新版本并記錄變更說明。這樣在模型效果出現(xiàn)問題時(shí)才能快速定位數(shù)據(jù)原因。8.3 建設(shè)自動(dòng)化數(shù)據(jù)處理流水線數(shù)據(jù)處理不能靠“手工操作”要建設(shè)自動(dòng)化的數(shù)據(jù)流水線。建議從以下環(huán)節(jié)開始自動(dòng)化數(shù)據(jù)源定時(shí)接入數(shù)據(jù)清洗的自動(dòng)觸發(fā)數(shù)據(jù)質(zhì)量檢查的自動(dòng)運(yùn)行數(shù)據(jù)版本發(fā)布的自動(dòng)記錄。自動(dòng)化流水線的好處是可以減少人為錯(cuò)誤也能提高數(shù)據(jù)處理效率。一開始不用追求完整可以先跑通最小鏈路再逐步完善。8.4 關(guān)注數(shù)據(jù)合規(guī)與安全邊界大模型訓(xùn)練數(shù)據(jù)涉及大量文本內(nèi)容數(shù)據(jù)合規(guī)與安全是絕對不可忽視的紅線。建議重點(diǎn)關(guān)注敏感信息識別與脫敏數(shù)據(jù)訪問權(quán)限的最小化管控?cái)?shù)據(jù)使用的審計(jì)留痕涉及個(gè)人信息的數(shù)據(jù)處理嚴(yán)格遵守相關(guān)法規(guī)要求準(zhǔn)確理解并執(zhí)行數(shù)據(jù)主體的授權(quán)范圍。數(shù)據(jù)合規(guī)不是數(shù)據(jù)團(tuán)隊(duì)一個(gè)部門的事但從數(shù)據(jù)團(tuán)隊(duì)做起是最佳切入點(diǎn)。因?yàn)閿?shù)據(jù)團(tuán)隊(duì)是數(shù)據(jù)的入口和出口把好合規(guī)關(guān)才能讓下游模型訓(xùn)練和應(yīng)用開發(fā)沒有后顧之憂。8.5 不要只做數(shù)據(jù)執(zhí)行要理解模型數(shù)據(jù)工程師如果想在 AI 時(shí)代有更強(qiáng)的競爭力建議花時(shí)間理解大模型的基本原理。不需要成為算法專家但要知道以下幾點(diǎn)訓(xùn)練數(shù)據(jù)、評測數(shù)據(jù)、預(yù)訓(xùn)練數(shù)據(jù)、SFT 數(shù)據(jù)的區(qū)別與用途數(shù)據(jù)分布對模型能力的影響數(shù)據(jù)質(zhì)量與模型評測指標(biāo)之間的關(guān)系合成數(shù)據(jù)、數(shù)據(jù)增強(qiáng)的常見方法與風(fēng)險(xiǎn)。當(dāng)你理解了模型你才能真正理解“什么樣的數(shù)據(jù)是好數(shù)據(jù)”。從“執(zhí)行數(shù)據(jù)需求”到“定義數(shù)據(jù)標(biāo)準(zhǔn)”是數(shù)據(jù)工程師向更高層級躍遷的關(guān)鍵一步。9. 總結(jié)與思考字節(jié) AI 數(shù)據(jù)部門升咖、并入 Core Data是一次值得行業(yè)關(guān)注的組織信號。它說明在大模型時(shí)代數(shù)據(jù)不再是“輔助資源”而是和算力、算法并列的核心基礎(chǔ)設(shè)施。數(shù)據(jù)團(tuán)隊(duì)沒有交給科學(xué)家并不是數(shù)據(jù)團(tuán)隊(duì)的價(jià)值被低估恰恰相反數(shù)據(jù)團(tuán)隊(duì)的價(jià)值正在被重新評估。科學(xué)家的核心能力在建模而數(shù)據(jù)團(tuán)隊(duì)的核心能力在數(shù)據(jù)工程、數(shù)據(jù)治理和數(shù)據(jù)生產(chǎn)。兩者需要分工協(xié)作而不是互相替代。對技術(shù)人來說這次調(diào)整帶來的啟示是第一AI 數(shù)據(jù)工程是一個(gè)有長期價(jià)值的賽道。無論大模型技術(shù)如何演進(jìn)數(shù)據(jù)質(zhì)量始終是模型能力的基石。第二數(shù)據(jù)工程師要主動(dòng)提升對模型的理解從“執(zhí)行者”變成“定義者”。第三數(shù)據(jù)治理、數(shù)據(jù)合規(guī)、數(shù)據(jù)版本管理這些基礎(chǔ)能力在大模型時(shí)代不是被削弱了而是更加重要了。字節(jié)的這次組織調(diào)整只是行業(yè)的一個(gè)切片。但透過這個(gè)切片我們能看到的是一場正在發(fā)生的、關(guān)于數(shù)據(jù)價(jià)值的重新定義。對于正在做 AI 應(yīng)用、或者在數(shù)據(jù)領(lǐng)域深耕的開發(fā)者來說這既是挑戰(zhàn)也是機(jī)會(huì)。數(shù)據(jù)團(tuán)隊(duì)的位置正在從幕后走向臺(tái)前。這個(gè)趨勢值得所有人關(guān)注。