作者 alljerry04 (Jas)
標題 Re: [閒聊] Gemini真的有那麼糟嗎
時間 Thu Jul 23 11:30:44 2026



    雖然 Gemini 可能已經不是部分使用者的首選模型,不過 Gemini 的「影片理解」
    能力我認為是它與競品不同的地方。

    如果有人想研究 AI 剪輯,但沒有什麼頭緒的話,分享一些我近期結合了雲
    端 Gemini 與地端模型的實驗與想法。

    【影像】

    最近有時間就會研究怎麼讓 AI 輔助剪片,而 Gemini 的影片與圖片解讀能力
    確實幫了我很多。

    例如,手上有一整批拍攝毛片時,可以先用 FFmpeg 將影片轉成比較輕量的
     proxy,再讓 Gemini 看完並整理成簡單的 Clip Card,記錄每支素材拍到
    了什麼以及可能適合放在影片的哪個段落等資訊。這些 Clip Card 做好後就
    可以保存在本機。


    之後想把同一批素材剪成不同主題或長度的影片時,不需要再讓 Gemini 重
    看全部毛片,只要先從 Clip Card 找出可能適合的片段,再回到原始影片確
    認畫面即可。


    如果只是一般接片,找到素材後其實就可以開始剪了。但如果想將橫式毛片
    重新構圖成 9:16,或是讓畫面持續跟著人物、手機與產品移動,就還需要知
    道物件在每個影格中的位置。


    這時就利用 Gemini 的「圖片理解」與「物件偵測」能力,找出指定物件的
    定界框。根據 Gemini 回傳的座標換算為影片內的實際位置。不過圖片是靜
    態的,Gemini 找到的座標只能代表單一時點,所以接著又用了 SAM 2.1 來
    協助追蹤物件的移動。


    【音訊】

    受 Palmier Pro 用 Apple SpeechTranscriber 做字幕的啟發,我實驗了一套
    讓「字幕準確度」跟「細粒度時間軸」可以盡量兼得的轉錄方式。

    Apple SpeechTranscriber 語音辨識的強項是時間,每個字都有自己的起訖
    時間碼,但是中文辨識不夠準確,會掉字或者同音錯字。

    所以我的做法是找了 Gemini 的「影片理解」能力來補強,讓 Gemini 獨立
    看一次影片,並回覆逐字稿,接著再修正回去 Apple SpeechTranscriber 的
    時間去。


    然後也讓 Gemini 回覆時一併輸出判斷符號,讓程式判斷這個是要用來斷行
    、術語還是要剪掉的贅詞。

--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 61.220.133.157 (臺灣)
※ 作者: alljerry04 2026-07-23 11:30:44
※ 文章代碼(AID): #1gOOhc4X (C_Chat)
※ 文章網址: https://www.ptt.cc/bbs/C_Chat/M.1784777446.A.121.html
※ 同主題文章:
Re: [閒聊] Gemini真的有那麼糟嗎
07-23 11:30 alljerry04
kuninaka: GOOGLE的影片圖片理解是他的強項沒錯,很強
我之前上傳監視器影片,問他某個人物出現多少次
都能算得出來1F 07/23 11:45
tim1112: 可是我昨天讓Ginimi分析一場布袋戲的武戲,感覺結果滿空泛的,而且有一種偷偷從別的管道查資料的嫌疑而且還查錯4F 07/23 12:06
alljerry04: 如果是在 Web / App 上分析 YouTube 影片時
務必要看到有跳出 YouTube icon,不然 Web / App
很容易呼叫工具失敗7F 07/23 12:15
nacoojohn: “可能不是不” 你講話可能不要不這麼多贅字,看了實在不是不難理解10F 07/23 12:27
※ 編輯: alljerry04 (61.220.133.157 臺灣), 07/23/2026 12:34:00
alljerry04: 可能不是 不少人,你的不連錯地方了,但我改一下12F 07/23 12:34
※ 編輯: alljerry04 (61.220.133.157 臺灣), 07/23/2026 12:35:36
--
作者 alljerry04 的最新發文:
點此顯示更多發文記錄