變局)
天貓請(qǐng)AI虛擬人段宴拍廣告這件事這兩天在內(nèi)容圈里討論度很高。真正有意思的不是“AI頂流”這個(gè)新包裝而是消息擴(kuò)散后最先反應(yīng)的群體居然是配音演員。一個(gè)廣告代言為什么先觸動(dòng)的是聲音行業(yè)因?yàn)榇蟊妼?duì)AI虛擬人的預(yù)期已經(jīng)變了不再關(guān)心它像不像真人而是關(guān)心它會(huì)不會(huì)直接替代某些工作。這個(gè)話題很容易被情緒帶偏。我更建議把整條產(chǎn)業(yè)鏈拆開(kāi)看一遍虛擬人怎么被做出來(lái)、聲音從哪里來(lái)、配音演員在擔(dān)心什么、品牌方到底在賭什么。這篇就按這個(gè)順序?qū)懸矔?huì)把我在AI內(nèi)容生產(chǎn)里遇到過(guò)的邊界問(wèn)題一并放進(jìn)來(lái)。1. 一場(chǎng)廣告代言為什么先急的是配音演員1.1 先看清這件事的結(jié)構(gòu)先把這個(gè)事件拆開(kāi)看。它是一個(gè)典型的AI虛擬人商業(yè)落地案例平臺(tái)方是天貓代言對(duì)象是一個(gè)叫段宴的AI虛擬人落地場(chǎng)景是廣告拍攝。廣告行業(yè)用虛擬偶像早就不是新鮮事初音未來(lái)、虛擬主播、虛擬KOL都是前例。但這次能被討論起來(lái)有幾個(gè)不一樣的地方。第一這是主流電商平臺(tái)直接下場(chǎng)讓AI虛擬人承擔(dān)“頂流”角色。平臺(tái)想把它當(dāng)作可以長(zhǎng)期運(yùn)營(yíng)的商業(yè)資產(chǎn)而不是一次性的技術(shù)演示。第二大眾注意力集中在配音演員的焦慮上說(shuō)明話題已經(jīng)從“技術(shù)能不能做”過(guò)渡到“做了之后誰(shuí)受影響”。第三這個(gè)案例的鏈路足夠長(zhǎng)角色形象、聲音、視頻、投放、商業(yè)變現(xiàn)每一環(huán)都有從業(yè)者會(huì)關(guān)心的問(wèn)題。所以這篇不是在給“AI會(huì)不會(huì)取代配音演員”下結(jié)論。我更想說(shuō)的是在這個(gè)事件里哪些是真實(shí)存在的變量哪些只是被情緒放大的想象。如果你只在熱搜上看熱鬧很容易得出“AI已經(jīng)全面搶工作”的結(jié)論如果你真的上手做過(guò)AI內(nèi)容生產(chǎn)就會(huì)知道中間還有大量工程細(xì)節(jié)需要處理。1.2 為什么率先被看到的是聲音而不是臉虛擬人的“臉”是數(shù)字生成的從一開(kāi)始就不存在真人形象權(quán)問(wèn)題。真人演員看到虛擬人更多是“多了一個(gè)競(jìng)爭(zhēng)對(duì)手”而不是“我的臉被用了”。但聲音不一樣。虛擬人雖然沒(méi)有真實(shí)身體卻必須有一個(gè)聲音而好的AI合成音聽(tīng)起來(lái)幾乎和真人沒(méi)有區(qū)別。對(duì)大眾來(lái)說(shuō)看到一張CG臉不會(huì)立刻產(chǎn)生“我可能失業(yè)了”的感覺(jué)但聽(tīng)到一段接近真人的AI配音會(huì)直接聯(lián)想到“這個(gè)工作我可能做不了”。這就是配音演員反應(yīng)強(qiáng)烈的原因聲音的接近度把替代感變得非常具體。還有一個(gè)更現(xiàn)實(shí)的原因聲音的生產(chǎn)成本很低。一個(gè)成熟的AI聲音合成系統(tǒng)只需要一段授權(quán)錄音就能生成可用音色后續(xù)每生成一條語(yǔ)音的成本趨近于零。而廣告拍攝、3D渲染、視頻后期這些環(huán)節(jié)仍然有設(shè)備、渲染、人力等固定成本。內(nèi)容行業(yè)里最先被AI滲透的通常是“邊際成本最低”的環(huán)節(jié)配音正好具備這個(gè)特征。1.3 先別急著站隊(duì)問(wèn)題比“取代”復(fù)雜我看到網(wǎng)上不少討論直接把這件事當(dāng)成“AI開(kāi)始搶工作”的信號(hào)。但如果你真的做過(guò)AI內(nèi)容生產(chǎn)就會(huì)知道“能生成聲音”和“能穩(wěn)定交付廣告級(jí)成片”之間隔著一大段工程距離。虛擬人廣告要落地至少要解決三件事角色形象能不能在多個(gè)鏡頭里保持一致語(yǔ)音情緒能不能匹配品牌調(diào)性以及整條片子的質(zhì)量能不能達(dá)到投放標(biāo)準(zhǔn)。這三件事每一項(xiàng)都需要人工參與和多次迭代。所以更準(zhǔn)確的說(shuō)法是AI并沒(méi)有直接“取代”誰(shuí)而是把一個(gè)原本需要多人協(xié)作的流程壓縮成一個(gè)人加一套工具就能啟動(dòng)的流程。省下來(lái)的不是“人”而是“溝通和等待的時(shí)間”。這個(gè)判斷后面幾個(gè)章節(jié)會(huì)展開(kāi)講。2. 從“畫一張臉”到“拍一條成片”AI虛擬人廣告的生產(chǎn)鏈路2.1 角色設(shè)計(jì)最難的不是好看而是穩(wěn)定AI虛擬人的第一步是定形象?,F(xiàn)在用AI繪畫工具生成一張好看的臉并不難難的是讓這張臉在三十秒廣告的每一個(gè)鏡頭里都長(zhǎng)得一樣。發(fā)型、臉型、衣服、光線、角度稍微一偏觀眾立刻會(huì)覺(jué)得“這不是同一個(gè)人”。我的建議是先做角色設(shè)定集。用一段描述詞生成正面、側(cè)面、半身、全身、不同光線下的參考圖選出最穩(wěn)定的幾張作為統(tǒng)一基準(zhǔn)。之后每個(gè)鏡頭都圍繞同一基準(zhǔn)來(lái)生成而不是每張圖單獨(dú)描述。生成時(shí)盡量固定隨機(jī)種子和模型版本否則同一句話在不同版本下會(huì)跑出完全不同的臉。如果你要做3D虛擬人還需要建模、綁定骨骼、驅(qū)動(dòng)表情。這條路對(duì)設(shè)備要求高流程長(zhǎng)但好處是動(dòng)作可控適合廣告里需要固定走位和產(chǎn)品展示的場(chǎng)景。如果你只是做短視頻和營(yíng)銷圖2D生成路線更輕先用低分辨率驗(yàn)證分鏡確認(rèn)導(dǎo)演意圖后再出高清圖能省掉大量無(wú)效渲染。2.2 聲音生成配音演員的焦慮點(diǎn)就在這里虛擬人定完形象接下來(lái)就是聲音。這也是配音演員最敏感的環(huán)節(jié)。目前的AI語(yǔ)音生成主要有兩條路線。一條是標(biāo)準(zhǔn)TTS也就是把文案輸入大模型選擇預(yù)設(shè)音色直接輸出語(yǔ)音。適合產(chǎn)品介紹、電商口播、短視頻旁白這類標(biāo)準(zhǔn)化內(nèi)容。調(diào)參重點(diǎn)包括語(yǔ)速、音調(diào)、停頓和情緒標(biāo)記。不同模型情緒標(biāo)記的寫法不一樣有的用標(biāo)簽有的用標(biāo)點(diǎn)控制落地前一定要先看模型的說(shuō)明文檔。另一條是聲音克隆。這里必須強(qiáng)調(diào)克隆一個(gè)人的聲音前必須取得本人明確授權(quán)并且合同里要寫明使用范圍。合法合規(guī)的做法是讓配音演員錄制一批專用語(yǔ)料明確這筆錄音用于AI聲音模型的訓(xùn)練再約定AI生成內(nèi)容的歸屬和收益。千萬(wàn)不要在未經(jīng)授權(quán)的情況下使用網(wǎng)上扒下來(lái)的音頻做訓(xùn)練數(shù)據(jù)這條線一旦突破項(xiàng)目再漂亮也會(huì)變成侵權(quán)事故。交付質(zhì)量上廣告級(jí)成片對(duì)音頻有硬性要求。采樣率建議不低于44.1kHz響度要符合投放平臺(tái)的統(tǒng)一標(biāo)準(zhǔn)。如果AI直接輸出的聲音忽大忽小合成前就要先做響度歸一化而不是推到后期去補(bǔ)救。這里最容易踩的坑是聽(tīng)感上覺(jué)得“還行”但在手機(jī)外放和專業(yè)設(shè)備上一對(duì)比齒音、氣息、低頻完全不同所以驗(yàn)收時(shí)一定要換至少兩種設(shè)備試聽(tīng)。2.3 視頻合成從生成片段到控制分鏡形象和聲音都定了接下來(lái)是把它們合成到視頻里。大體上分兩條路線。一條是端到端的AI視頻生成輸入腳本和參考圖直接輸出動(dòng)態(tài)片段。這類工具現(xiàn)在做“氛圍感鏡頭”很好用比如產(chǎn)品在光影中旋轉(zhuǎn)、人物背影走在街道上。但它的缺點(diǎn)是分鏡控制弱很難讓角色在指定時(shí)間做出指定動(dòng)作廣告里需要精準(zhǔn)展示產(chǎn)品的場(chǎng)景就不太適合。另一條是虛擬人驅(qū)動(dòng)方案用真人演員的動(dòng)作捕捉或者面部捕捉去驅(qū)動(dòng)3D角色??煽匦詮?qiáng)角色可以說(shuō)指定臺(tái)詞、做指定動(dòng)作適合商業(yè)廣告。缺點(diǎn)是制作周期長(zhǎng)、硬件要求高。實(shí)際項(xiàng)目里很多團(tuán)隊(duì)是兩條路線混用大場(chǎng)景用AI視頻生成產(chǎn)品特寫和人物對(duì)話用驅(qū)動(dòng)方案最后在剪輯軟件里統(tǒng)一合成。不要一上來(lái)就出4K全片。正確的流程是先做低分辨率草稿把所有分鏡的節(jié)奏、字幕、旁白、產(chǎn)品位置定下來(lái)確認(rèn)導(dǎo)演和品牌方都滿意后再進(jìn)入最終渲染。一條30秒的廣告分鏡往往有幾十個(gè)如果每個(gè)鏡頭都在4K下反復(fù)重渲靠一臺(tái)機(jī)器根本做不完必須按鏡頭編號(hào)分批渲染并保留每個(gè)鏡頭的版本記錄。2.4 本地部署和云工具怎么選工具選擇上要看項(xiàng)目對(duì)隱私和數(shù)據(jù)安全的要求。涉及未公開(kāi)新品、品牌素材或者真實(shí)人物授權(quán)的語(yǔ)音數(shù)據(jù)建議優(yōu)先考慮本地部署方案數(shù)據(jù)不出內(nèi)網(wǎng)風(fēng)險(xiǎn)更可控。本地跑AI模型先看硬件條件。通常來(lái)說(shuō)顯存8G左右可以跑中等規(guī)模的生成模型16G以上跑大模型會(huì)更從容要是顯存不夠就得靠模型量化、降低分辨率、分批任務(wù)來(lái)湊。這里給的是通用判斷具體要以你手里的模型和機(jī)器為準(zhǔn)。部署前還要確認(rèn)Python、CUDA、模型依賴庫(kù)的版本很多啟動(dòng)失敗不是模型問(wèn)題而是依賴版本沖突。如果只是做一次營(yíng)銷活動(dòng)或者團(tuán)隊(duì)里沒(méi)有專門做部署的人云端工具更省心。按量付費(fèi)、界面化操作適合快速出片。缺點(diǎn)是數(shù)據(jù)要經(jīng)過(guò)第三方授權(quán)鏈路和隱私條款要看仔細(xì)。另外不管本地還是云端都要保留生成過(guò)程的日志和參數(shù)記錄。以后一旦出現(xiàn)授權(quán)爭(zhēng)議這些記錄就是最直接的證據(jù)。3. 配音演員在擔(dān)心什么不是“聲音沒(méi)了”是定價(jià)體系被重排3.1 聲音使用權(quán)合同里最容易被忽略的部分配音演員的焦慮表面上是“AI會(huì)模仿我的聲音”本質(zhì)上是“聲音的使用規(guī)則沒(méi)有跟上技術(shù)”。傳統(tǒng)配音的合作方式很簡(jiǎn)單一個(gè)項(xiàng)目簽一份合同約定時(shí)長(zhǎng)、用途、費(fèi)用。甲方用完即止演員的聲音只出現(xiàn)在合同規(guī)定的作品里。AI出現(xiàn)后情況變了。如果配音演員在不知情的情況下自己的聲音被用于訓(xùn)練模型那這個(gè)模型可以無(wú)限次生成近似自己音色的內(nèi)容覆蓋到廣告、短劇、直播甚至不了解的領(lǐng)域。這不是“搶單”問(wèn)題而是“人格聲音”的授權(quán)邊界問(wèn)題。所以現(xiàn)在行業(yè)里比較一致的呼吁是來(lái)源授權(quán)必須前置。使用真人聲音做AI訓(xùn)練必須單獨(dú)簽一份AI授權(quán)協(xié)議明確三點(diǎn)語(yǔ)料來(lái)源、訓(xùn)練后的模型歸屬、生成內(nèi)容的使用范圍。范圍要寫具體不能只寫“用于AI相關(guān)項(xiàng)目”要落到平臺(tái)、地區(qū)、期限、是否可商用、是否可再授權(quán)。3.2 哪些配音工作最先被替代哪些反而更值錢講完風(fēng)險(xiǎn)再講一個(gè)更實(shí)際的問(wèn)題配音行業(yè)內(nèi)部也會(huì)分化。標(biāo)準(zhǔn)化程度越高的內(nèi)容越容易被AI替代。電商短視頻口播、產(chǎn)品功能介紹、游戲NPC的固定臺(tái)詞、智能語(yǔ)音提示這些內(nèi)容重復(fù)度高、情緒跨度小AI語(yǔ)音已經(jīng)能穩(wěn)定覆蓋。在這些細(xì)分領(lǐng)域甲方的考量會(huì)越來(lái)越偏向“成本低、出片快”真人配音的份額可能被壓縮。但另一端反而會(huì)更值錢需要角色塑造的影視劇配音、需要即興反應(yīng)的綜藝和直播、需要方言和年齡跨度表現(xiàn)的有聲書(shū)、需要臨場(chǎng)調(diào)整情緒的商業(yè)大片這些高度依賴人味和判斷力的工作AI暫時(shí)還接不住。我個(gè)人的判斷標(biāo)準(zhǔn)很簡(jiǎn)單如果一個(gè)配音項(xiàng)目甲方能給出通稿文案要求“照著念就行”那它大概率會(huì)被AI分走一部分如果項(xiàng)目需要配音演員參與創(chuàng)作比如改臺(tái)詞、調(diào)情緒、設(shè)計(jì)角色性格那這個(gè)工作的價(jià)值反而上升。配音演員真正要守的不是“讀稿子”的環(huán)節(jié)而是“怎么讀、為什么這么讀”的創(chuàng)作環(huán)節(jié)。3.3 為什么AI配音聽(tīng)著還行卻經(jīng)不起長(zhǎng)時(shí)間考驗(yàn)很多人在短視頻里聽(tīng)AI配音覺(jué)得已經(jīng)跟真人差不多了。但廣告和影視里的配音跟短視頻旁白不是一個(gè)量級(jí)。短視頻旁白往往只有幾十秒情緒單一AI處理起來(lái)很輕松。但一條3分鐘的廣告、一集20分鐘的短劇、一部有聲書(shū)需要在長(zhǎng)時(shí)間里保持穩(wěn)定的角色感、呼吸節(jié)奏和情緒遞進(jìn)。AI語(yǔ)音在長(zhǎng)時(shí)間任務(wù)里容易出現(xiàn)幾個(gè)問(wèn)題語(yǔ)句之間的情緒斷層、重音位置不合理、句子一長(zhǎng)就開(kāi)始“念課文”。這些問(wèn)題第一次聽(tīng)不明顯多聽(tīng)?zhēng)妆榫吐娥W。遇到這種情況排查順序是先看文本斷句和標(biāo)點(diǎn)再看情緒標(biāo)簽參數(shù)然后換一個(gè)更合適的聲音模型最后檢查是不是采樣率和響度被二次壓縮導(dǎo)致失真。大部分“AI配音不自然”的問(wèn)題不是模型能力不夠而是前期的文案標(biāo)注和參數(shù)沒(méi)有按廣告級(jí)標(biāo)準(zhǔn)走。4. 品牌方和內(nèi)容團(tuán)隊(duì)要用AI虛擬人先把這幾個(gè)問(wèn)題處理好4.1 先判斷品牌適不適合虛擬人品牌方看到“AI頂流”案例第一反應(yīng)可能是“這個(gè)風(fēng)口我也要追”。但虛擬人不是萬(wàn)能的先做一道篩選。如果你的品牌核心是“真實(shí)、親切、有煙火氣”比如生活服務(wù)、社區(qū)平臺(tái)、線下門店一個(gè)AI虛擬人可能反而帶來(lái)距離感。如果你的內(nèi)容更新頻率很高比如每天要出幾十條電商短視頻虛擬人的生產(chǎn)成本優(yōu)勢(shì)就會(huì)非常明顯。如果你的產(chǎn)品需要展示復(fù)雜細(xì)節(jié)虛擬人反而不如真人演示直觀。還有一個(gè)現(xiàn)實(shí)維度成本結(jié)構(gòu)。虛擬人初期要投入角色設(shè)計(jì)、聲音授權(quán)、模型部署和成片流程搭建這些不便宜。但如果內(nèi)容量大、更新頻次高固定資產(chǎn)攤薄后單條成本會(huì)低于持續(xù)雇人。算賬的時(shí)候別只看“能不能做”要看“做了多少條之后能回本”。如果連30條都做不滿那這個(gè)虛擬人大概率是虧的。4.2 合同和授權(quán)必須寫清楚的條目這是整個(gè)項(xiàng)目里最不能省的部分。AI虛擬人涉及至少三方品牌方、虛擬人IP運(yùn)營(yíng)方、聲音和形象素材的授權(quán)方。三方之間如果沒(méi)有清晰的合同條款一旦開(kāi)始投放任何一方想調(diào)整使用范圍都會(huì)變成扯皮。授權(quán)事項(xiàng)建議寫清楚的內(nèi)容為什么必須寫形象授權(quán)虛擬人形象是否可以二次修改、是否可以跨平臺(tái)使用防止形象被改動(dòng)后偏離品牌定位聲音授權(quán)用于AI訓(xùn)練的語(yǔ)料來(lái)源、訓(xùn)練后模型歸屬、生成內(nèi)容的使用范圍防止聲音被用到合同之外的項(xiàng)目使用期限授權(quán)期限、續(xù)約條件、到期后存量?jī)?nèi)容如何處理防止合作結(jié)束后素材仍在持續(xù)使用區(qū)域和平臺(tái)投放國(guó)家或地區(qū)、媒體平臺(tái)列表防止跨區(qū)域跨平臺(tái)使用引發(fā)糾紛收益分配虛擬人商業(yè)收益的分成方式、結(jié)算周期防止合作關(guān)系因利益結(jié)構(gòu)不明而破裂責(zé)任承擔(dān)AI生成內(nèi)容侵權(quán)時(shí)由哪一方負(fù)責(zé)處理防止出事后互相推諉審計(jì)權(quán)是否允許授權(quán)方檢查使用日志和生成記錄防止超范圍使用這些條款看起來(lái)瑣碎但任何一個(gè)遺漏在項(xiàng)目跑起來(lái)后都可能變成成本。合同不是用來(lái)約束合作的是用來(lái)在合作出現(xiàn)分歧時(shí)快速確定邊界的。4.3 加一道人工審核不要讓AI直接發(fā)布無(wú)論AI生成的廣告素材多接近完美都建議在發(fā)布前保留一道人工審核。審核的重點(diǎn)不是“這個(gè)片子好不好看”而是三個(gè)問(wèn)題內(nèi)容是否合規(guī)、產(chǎn)品信息是否準(zhǔn)確、品牌口吻是否一致。AI生成內(nèi)容容易出現(xiàn)看似合理但實(shí)際錯(cuò)誤的細(xì)節(jié)比如產(chǎn)品參數(shù)念錯(cuò)、專有名詞張冠李戴、廣告語(yǔ)在特定語(yǔ)境下產(chǎn)生歧義。這些錯(cuò)誤在生成階段很難發(fā)現(xiàn)只有人帶著品牌語(yǔ)境去審才能攔住。另外還要保留一條回滾機(jī)制。如果某條AI生成的廣告投放后出現(xiàn)負(fù)面反饋要能快速定位是哪一批參數(shù)、哪一次生成、哪一個(gè)環(huán)節(jié)出了問(wèn)題而不是把整條片子重做。我見(jiàn)過(guò)不少團(tuán)隊(duì)把“AI快速出片”做成了“AI快速出事故”根源就是沒(méi)有記錄生成過(guò)程出了事只能全部推翻重來(lái)。5. 回到事件本身AI虛擬人廣告不是終點(diǎn)而是分工重組5.1 產(chǎn)業(yè)鏈上的角色會(huì)怎么變AI虛擬人廣告這個(gè)事最值得關(guān)注的不是某一條廣告本身而是它代表的產(chǎn)業(yè)分工變化。過(guò)去品牌方請(qǐng)代言人買的是“人”的知名度和形象使用權(quán)?,F(xiàn)在品牌方做一個(gè)虛擬IP買的是一套“資產(chǎn)”形象資產(chǎn)、聲音資產(chǎn)、內(nèi)容生產(chǎn)能力。這個(gè)區(qū)別很關(guān)鍵。真人代言人有自己的檔期、團(tuán)隊(duì)和輿論風(fēng)險(xiǎn)虛擬IP作為一個(gè)長(zhǎng)期數(shù)字資產(chǎn)可以被持續(xù)開(kāi)發(fā)、分授權(quán)、跨場(chǎng)景使用。品牌方從“租人”變成“養(yǎng)資產(chǎn)”整個(gè)商業(yè)邏輯不一樣了。對(duì)內(nèi)容工作者來(lái)說(shuō)這意味著工作方式也在變。以前一個(gè)廣告項(xiàng)目需要對(duì)接導(dǎo)演、攝影、演員、配音、剪輯、調(diào)色現(xiàn)在很多環(huán)節(jié)被壓縮成“AI生成 人工審核 導(dǎo)演把關(guān)”。AI Agent在中間扮演流程調(diào)度者的角色把腳本、配音、畫面、字幕、審核串聯(lián)起來(lái)。這不是崗位消失而是崗位形態(tài)變化原來(lái)負(fù)責(zé)單點(diǎn)執(zhí)行的人可能要變成會(huì)操作AI工具、能判斷輸出質(zhì)量、能處理授權(quán)問(wèn)題的復(fù)合角色。5.2 給三類從業(yè)者的落地建議第一給配音演員。不必急著把AI當(dāng)成敵人但要開(kāi)始管理自己的聲音資產(chǎn)。錄制樣音時(shí)注意保留版權(quán)聲明簽合同時(shí)把AI訓(xùn)練授權(quán)單獨(dú)拎