H3
·
STUDIO
本機影音生成控制台
ComfyUI 檢查中...
RTX 5060 Ti · 16GB
Ref2VA + Turbo LoRA
SageAttention 已停用
GPU —
CPU —
登出
H3
·
STUDIO
管理密碼
登入
忘記密碼?
H3
·
STUDIO
設定新密碼
設定密碼並登入
專案
系統設定
專案
(未載入專案)
尚未載入專案
儲存
另存新檔
複製
刪除
+新專案
語音 Profile 錄製
▼
重新整理裝置
照著念(約20秒或更短)
大家好,我叫小明,今天天氣很好,我想出去走走看看。東西南北、春夏秋冬,一二三四五六七八九十。謝謝大家聽我做這段聲音測試。
● 開始錄音
00:00 / 00:20
存成 Profile
已存語音 Profile
▼
尚無 Profile
🧑 AI生成人物照
▼
分析人物
會用上面這個文字框的內容去抓人物;生成的照片會自動存進下方「參考圖片庫」,之後在「參考圖片」區選取就會變成 <Subject N>,模型才會真的鎖臉
參考圖片庫(人物照)
▼
去背景(白底)
存入圖庫
存過的人物照會出現在右邊「專案內容」分頁,用檔名直接調用,不用每次重新上傳
輸出格式
解析度
864×480 原生
1280×720 放大
影格率
24fps 原生
30fps
生成步數
8 步(穩定,官方預設)
4 步(快 40%,正臉場景已驗證)
效能
啟用 SageAttention
實測比不裝慢,目前預設關閉;改變設定後要重啟 ComfyUI 才會生效——不會自動重啟,避免中斷正在跑的生成,記得自己找時間手動重啟
密碼管理
變更密碼
目前系統模型參照列表
▼
直接讀 ComfyUI workflow 設定檔,不會跟實際跑的模型脫鉤
專案人物與聲音設定
Prompt 輸入
生成
後製
角色與延續參考
人物 / 聲音 / 延伸影片,皆可留空,留空由系統自行處理(段落間仍會自動接續畫面)
參考圖片(最多 3 人)
從圖庫選(在左邊「設定」分頁上傳、存成人物照),Ctrl/Cmd+點 可複選
參考語音(單一聲音)
從圖庫選用(在左邊「設定」分頁錄音、存成 Profile)
(選擇語音 Profile)
或直接上傳單次使用的音檔
參考影片(延伸現有影片用,可留空)
啟用參考影片直接分析
(實驗性)
預設關閉時改用「影片最後一幀擷取成參考圖片」,這是已驗證有效的做法
背景音樂
參考音檔(已驗證有效,會自動裁切成分段長度,接到獨立的 ref_audio_1 插槽,
跟人聲分開)
文字描述配樂調性(non_diegetic_music 文字內容在「Prompt 輸入」分頁)
影片長度(分鐘):
分段長度(秒/段):
15秒單段測試
一鍵設成 0.25 分鐘 × 15秒/段 = 1 段,跑最快的測試
Prompt 範本庫
1人 / 2人 / 3人 / 多人
▼
1人
2人
3人
多人
僅供參考格式,不會自動帶入正式段落——請用下方每段卡片上的「插入」工具列組出實際內容
另存新範本
刪除此範本
subject_definitions
會依參考圖片/語音自動更新,手動打字就不再自動蓋掉;清空文字框可以重新恢復自動
summary
✨ AI 產生 Prompt
retention_analysis
fully_preserved(完全保留,最強)
fully_preserved_with_scene(連服裝場景都保留,適合連續多段的同一鏡位發言)
fully_preserved_with_wardrobe(臉+衣服鎖照片,場景交給文字描述,適合去背照片)
partially_preserved(部分保留,特徵可能改變)
attribute_transfer(特徵轉移到另一個人物)
weak_reference(弱參考,只保留風格/氛圍)
高保真 max(較慢,官方建議)
標準 match(較快)
non_diegetic_music
Seed:
生成範圍:
同一組 seed + 同一份 prompt 理論上會生出接近的結果,適合做 A/B 對照測試;合法範圍 0 ~ 18446744073709551615(ComfyUI RandomNoise node 本身的限制)。生成範圍:跑到第幾段就停,之後可以「續跑」剩下的段落
開始生成
■ 停止
🔌 檢視接線圖
▶ 續跑剩餘段落
🎬 合成 Final 影片
尚未送出生成
已送出的正式 Prompt
確認結果用,不可編輯——要改內容請回「Prompt 輸入」分頁
播放區
尚未有影片
生成完成後會顯示在這裡
生成紀錄
跟著這個專案走,Save/Load/Save As 都會連動
後製來源
可以用剛生成的影片,也可以直接上傳本機影片,兩者互不影響
使用目前生成的影片
上傳本機影片
編輯區
整段式操作:cut 剪下(存進剪貼簿)/delete 刪除/paste 貼上
第 1 軌・影片
Cut
Delete
Paste
第 2 軌・原始聲音
Cut
Delete
Paste
第 3 軌・SFX
Cut
Delete
Paste
音效後製(HunyuanVideo-Foley)
建議結構:
主體 + 動作 + 環境 + 聲音特質
,例如:深夜暴雨打在玻璃窗上的聲音,伴隨遠處隱約的雷聲,高保真,無雜音。中文會先翻譯成英文再送給模型(CLAP 文字編碼器僅以英文語料訓練)。
結構化提示詞範例(選一個帶入,可再自行編輯)
翻譯成英文
生成音效
SFX 音量
0 dB
合成
Mix 合成
detailed_description
檢視送出的正式 Prompt(英文,Haiku 產生)
每段的環境音輸入框對應 overall_soundscape,就在各段卡片裡
正式 Prompt 預覽(英文,Haiku 產生)
✕
✨ AI 產生 Prompt
0 字
✕
套用到目前作用中的一段
生成整個多段故事
產生
用 Haiku 把描述展開成分鏡草稿(含背景音、合適時會加對白)+專案主題(summary);「整個多段故事」會依現有分段數量把劇情接續分配到每一段。會直接覆蓋目標段落的 Shot 內容跟環境音,還有專案主題,填完可以照樣手動修改
✕
✕