先看重點
這篇文章可以先抓住三件事,再回頭讀完整做法:
- 沒有一站式工具,你要接七到十段
- 第二段:角色資產,先鎖圖再生影片
- 一集要多久、多少錢
其實我一開始只是想知道這東西能不能做。
最近很多人在講 AI 短劇,講得好像打開軟體就能生出一部劇。我把中國、歐美、台灣的資料撈了一輪,把實際做過的人寫的工序拆開來看,發現真實的流程跟大家在講的差滿多的。
這篇是我整理出來的完整工序。先講清楚一件事,這篇教的是怎麼做,不是叫你去做。做得出來跟賺得到是兩件事,這點我放在最後講。
先講幾個名詞
短劇指單集通常一到三分鐘、直式九比十六、走連續劇情的影片。中國官方的定義是單集少於二十分鐘。
AI 短劇是用 AI 影片生成工具做出來的短劇。裡面又分兩類,一類是動漫風格的 AI 漫劇,一類是模擬真人的 AI 仿真人劇,後者難度高很多。
抽卡是創作者的黑話,指同一個鏡頭反覆生成直到有一次可用。這個詞會在這篇出現很多次,因為它是整個流程最花時間的地方。
角色一致性指同一個角色在不同鏡頭裡長得一樣。這是目前最大的技術瓶頸。
投流是買廣告流量把片推出去。中國短劇的主要獲利模式建立在這上面。
沒有一站式工具,你要接七到十段
我看到的所有實作文章,工序結構都一樣,就是七到十段的接力,每一段換一個工具。順序大致是立項、劇本、角色與場景資產、分鏡設計、影片生成、配音配樂、後期剪輯、品控、合規標註、分發。
沒有任何一個工具可以從頭做到尾。這件事要先接受,後面才不會一直在找那個不存在的萬用軟體。
第一段:劇本,先給約束再讓模型生成
這一段我看到最完整的做法來自一位長篇小說寫手,他的流程是四步,重點在順序。
先做三張設定卡。 主角卡寫開場處境、核心慾望、最大恐懼。能力系統卡寫能力再加三條明確限制。反派卡寫三個對手跟被擊敗的順序。這一步要求模型只輸出表格,並且明令它不要寫劇情。
會這樣做是因為模型一旦開始寫劇情就會自己跑掉,先把約束鎖死,後面才控得住。
再用遊戲關卡邏輯排爽點跟懸念交替。 不要一路爽到底,也不要一路壓抑。
每集大綱只准四行。 本集目標、情緒爽點、切斷點、埋伏筆與回收集數。切斷點必須是具體的台詞或動作,禁止寫「氣氛突然緊張」這種空話。這條限制很重要,因為模糊的切斷點到了生成階段會變成你不知道要生什麼畫面。
最後才展開全稿。 三分鐘大約四百五十到五百五十字對白,單句上限二十字。
還有一個心法是把設定卡整份塞進後續每一次提示詞。這聽起來很囉嗦,但省下來的是後面重寫的時間。
第二段:角色資產,先鎖圖再生影片
這是整篇最重要的一段。
業界的共識是圖生影片的穩定度遠高於文生影片。所以正確的順序是先把角色的樣子鎖成圖,再拿那張圖去生影片,而不是每次都用文字描述請模型重新想像一次這個人長什麼樣。
實務上有三層做法。
圖像層是做三視圖角色設定表,正面、側面、背面、臉部特寫都出一張,一個角色的成本大概人民幣五十到八十元。有人的做法是先做一張白底自然站姿的中景參考圖當錨點。
資產層是把這些多視圖存進專案資產庫永久鎖定,之後每一集都調用同一份。中國那邊已經有平台把這件事產品化了。
模型層是選原生支援多鏡頭與角色一致性的模型。也可以用 LoRA 微調,需要三到五張參考圖。
真正的突破在資產層,不在模型層。換句話說,這是流程紀律的問題,不是你買不買得起最貴的模型的問題。
第三段:分鏡,兩種規格自己選
鏡頭規格有兩派。
長鏡派是一集十二到十五個鏡頭,每鏡八到十五秒。短鏡派是一集十四到二十五鏡,每鏡四到十秒。
短鏡派的失敗率低很多,因為鏡頭越長,角色跑掉的機率越高。代價是剪起來比較碎。
節奏上有幾個被反覆提到的規格。前三秒要放衝突或反差。每三十秒一個鉤子。每集結尾要落在具體的動作上,不能是氛圍。
集數結構的通則是小反轉每五到十集一次,大反轉每二十到三十集一次,整劇三十到一百集。規格是九比十六直式、1080x1920、24fps。
第四段:生成,這裡最花錢也最花時間
先講模型現況,因為這塊三個月變一輪。
Sora 已經退場。 OpenAI 的 Sora App 在二〇二六年四月關閉,API 在九月二十四號關。所以你現在如果看到任何教學是用 Sora 做短劇,那份教學已經過期了。
目前主力是 Seedance 2.5、可靈 3.0、Veo 3.1、Vidu Q3 這幾支。Veo 3.1 的定價最透明,Fast 檔 720p 每秒零點一美元,Standard 檔 720p 每秒零點四美元,差四倍。順帶一提沒有 Veo 4,網路上那些 Veo 4 的價格都是臆測。
然後是最殘酷的一段。
角色一致性其實還沒解決。中國有一部劇的製作實況被媒體報導出來,整劇廢片率六成,一個十五秒的動作鏡頭抽卡了九十七次。常規鏡頭也要抽二十到三十次。另一份報導說超過六成的觀眾回報有恐怖谷感,包括動作脫節、對嘴不準、表情僵硬。
所以你要先在心裡把預期調整成這樣:你生出來的東西,大概有六成要丟掉。
省錢的做法是分級生成。 基礎鏡頭用便宜的模型跑,只有複雜的動作鏡才用貴的。這樣同時降低成本跟失敗率。
第五段:卡點對照表
實作者整理出來的常見卡點跟繞法,這份可以直接抄。
| 卡點 | 解法 |
|---|---|
| 臉漂移就是同一個角色的臉在不同鏡頭變了。 | 解法是改用圖生影片並附上角色參考錨點,然後把臉型、髮際線、年齡感、服裝這些描述原封不動複製回提示詞。 |
| 光線不連戲是同一場戲的鏡頭光線對不起來。 | 解法是同場景批次生成,再統一調色套 LUT。 |
| 空間錯亂是角色從畫面左邊出去卻從左邊回來。 | 解法是在提示詞裡明確寫出進出場方向跟地標。 |
| 轉場生硬 | 留到剪輯處理,不要在生成階段硬解。 |
第六段:配音跟對嘴是兩件事
這一段有個容易踩的坑。ElevenLabs 官方明講他們的 Dubbing 功能不包含對嘴。所以如果你用它做多角色配音,還要再接一層對嘴工具。
二〇二六年比較主流的做法已經改成用模型原生的多語音訊生成,直接讓影片模型生出帶聲音跟對嘴的畫面,而不是後製硬對。可靈 3.0 Turbo 支援五種語言的原生對嘴。有報導說做完中文版之後,五個語種可以一天出齊,每個版本口型都對得上。
第七段:剪輯,這裡反而不是瓶頸
剪映專業版跟 CapCut 就夠了,基礎功能免費,內建直式短劇模板、AI 字幕、智能配音。
我看到的實作文章都同意剪輯不是瓶頸。真正吃時間的是前面的抽卡跟挑素材。
第八段:標示與合規,這段別跳過
中國的《微短劇發展管理辦法》在二〇二六年九月一號施行,就是最近的事。AI 生成的微短劇每一集都必須在明顯位置加提示標識,罰款上限人民幣十萬。三十萬以上的投資還要備案發證。
平台端的規則比法規更細。紅果從八月三號起,跨劇角色的臉部相似度超過百分之六十五直接駁回,等於封殺了一套 AI 臉打天下的量產法。
台灣這邊反而是真空,沒有主管機關在管社群短劇。但有另一件更麻煩的事,智慧財產局明確認定純 AI 生成的內容不受著作權保護。意思是你花時間做出來的東西,別人可以直接拿走用。
一集要多久、多少錢
有一份訪談給了很具體的數字。一集三到四分鐘要十二到十八小時,大約七十個分鏡,單張圖平均要重跑七到八次才可用。
熟練的單人做一到兩分鐘的完整片段,大概一到兩天。工業化團隊平均每集零點三到三點七五天,差距全在流程紀律,不在模型。
錢的部分,純 API 算力一集兩分鐘大約二十五到一百二十美元,這是順利的情況。中國市場含人力的行情是 AI 動漫劇每分鐘人民幣八百到一千二,AI 仿真人劇每分鐘一千五到三千。
對照真人短劇每集五萬到一百萬人民幣,成本真的降很多。
什麼題材跑得動
跑得動的集中在非現實設定,玄幻、修仙、獸世、穿書、非人主角這些。海外向則是狼人、吸血鬼、系統覺醒。
原因很實際。AI 在這些題材不會被抓包,因為觀眾本來就不知道獸人應該長什麼樣。反而是現代都市寫實最容易穿幫,一張臉不對就整個垮掉。
最後這段,講兩面
前面講的是怎麼做。這段講做出來之後。
二〇二六年上半年,抖音上線了二十二萬部 AI 短劇,其中百分之九十八點七在半年內沒有回本,每七十七部才有一部回本。萬次播放的收入從二〇二五年的人民幣三十到一百元,跌到二〇二六年的五到十元。
有一個團隊做了十一部劇,扣掉工具訂閱、硬體、雲端算力之後,淨賺人民幣九塊六。
平台也在踩煞車。抖音把 AI 內容的分成係數從六十砍到四十,紅果取消了 AI 仿真人劇本的保底改成純分成兩成。
而且中文搜尋結果被內容農場污染得很嚴重,數字互相矛盾,有些明顯造假,像是三天做完七百二十九集這種。看到誇張數字先存疑。
所以如果你要問值不值得做,我覺得問題要換一個問法。不要問 AI 短劇能不能賺錢,先問你做這件事想換到什麼。
如果你想換的是錢,數據已經很清楚了。如果你想換的是把一個故事完整做出來的能力,那這條路現在的門檻確實比三年前低太多了,一個人真的做得完一集。
那你想換的是哪一個呢?