這項(xiàng)由Google DeepMind主導(dǎo)的研究于2026年7月28日以預(yù)印本形式發(fā)布,論文編號為arXiv:2607.25537v1,有興趣深入了解的讀者可通過該編號在arXiv平臺查詢完整論文。
(資料圖片僅供參考)
說到提示詞,大多數(shù)人腦海中浮現(xiàn)的畫面大概是這樣的:在聊天框里敲入一段精心措辭的文字,然后期待AI給出更好的答案。過去幾年,圍繞如何"好好跟AI說話"的研究已經(jīng)發(fā)展成了一門獨(dú)立的學(xué)問,甚至有人專門以此謀生。但Google DeepMind的研究團(tuán)隊(duì)最近提出了一個(gè)頗為新鮮的問題:如果說文字提示詞可以被精心設(shè)計(jì),那么圖片提示詞是不是也可以?
這個(gè)問題背后,藏著一個(gè)已經(jīng)悄然發(fā)生的技術(shù)轉(zhuǎn)變。過去一年多時(shí)間里,一類被稱為"視頻生成模型"的AI系統(tǒng)正在悄然升級為通用的視覺推理工具。這些模型不僅能生成好看的視頻,還能通過"演示"來解決問題——給它一張迷宮的圖片,它能生成一段小球走出迷宮的視頻;給它一道物理題的示意圖,它能用動(dòng)畫展示球會(huì)滾進(jìn)哪個(gè)桶。這類模型接收兩樣?xùn)|西作為輸入:一段文字說明(描述接下來要發(fā)生什么),以及一張圖片(作為視頻的第一幀)。研究者們一直在努力優(yōu)化前者,卻幾乎從未認(rèn)真打量過后者。
Google DeepMind的團(tuán)隊(duì)決定填補(bǔ)這個(gè)空白。他們將這套方法命名為VIPE,也就是"視覺提示工程"(Visual Prompt Engineering)。核心思路其實(shí)并不復(fù)雜:在把圖片喂給視頻模型之前,先用圖像編輯模型對這張圖片動(dòng)動(dòng)手腳——不改變題目本身,只改變它的視覺呈現(xiàn)方式。一道原本用素描風(fēng)格畫出的物理題,可以被改造成擺滿實(shí)木架子和臺球的逼真場景;一組抽象符號,可以被渲染成立體的3D實(shí)物。
結(jié)論相當(dāng)出人意料:僅僅改變圖片的視覺風(fēng)格,不改任何題目內(nèi)容,視頻模型的答題正確率就能大幅提升。在某些任務(wù)上,這種純粹的"換衣服"操作帶來的性能提升,甚至超過了讓模型反復(fù)嘗試同一道題二十次的效果。
一、為什么給AI"換一身行頭"這件事有意義
在正式展開研究細(xì)節(jié)之前,有必要先理解這件事為什么值得做。
考慮這樣一個(gè)場景:你想測試一條魚的游泳速度,但你把它放在了一塊旱地上。測試結(jié)果當(dāng)然很糟糕,但這個(gè)糟糕的結(jié)果反映的不是魚的真實(shí)游泳能力,而是測試環(huán)境的不匹配。這個(gè)聽起來有些荒唐的比喻,恰恰是Google DeepMind研究團(tuán)隊(duì)在這項(xiàng)工作中的核心發(fā)現(xiàn):視頻生成模型在抽象、草圖風(fēng)格的圖片上表現(xiàn)糟糕,并不一定意味著它們推理能力差,而可能只是因?yàn)樗鼈儽环旁诹?旱地上"。
視頻生成模型是用海量真實(shí)世界視頻訓(xùn)練出來的。它們最熟悉的是真實(shí)場景里的光影、質(zhì)感、物理運(yùn)動(dòng)方式。當(dāng)你給它們一張黑白線條草圖,讓它們預(yù)測一個(gè)白色圓圈會(huì)滾進(jìn)哪個(gè)線條畫的容器里,它們其實(shí)是在一種陌生的視覺語言下工作。結(jié)果自然不理想。
這個(gè)觀察引出了研究的核心假設(shè):如果把草圖變成逼真的照片風(fēng)格,讓那個(gè)白色圓圈變成一顆真實(shí)的臺球,讓那些線條變成實(shí)木貨架,視頻模型會(huì)不會(huì)表現(xiàn)得更好?答案是肯定的。
這種現(xiàn)象被研究團(tuán)隊(duì)稱為"現(xiàn)實(shí)主義偏好"——視頻模型天然偏好在寫實(shí)場景中推理,而這恰恰給視覺提示工程留出了可操作的空間。
二、實(shí)驗(yàn)是怎么做的
研究團(tuán)隊(duì)搭建了一套完整的流水線,分為三個(gè)步驟,各司其職。
第一步叫做"構(gòu)想者"。這個(gè)角色的任務(wù)是想出如何修改圖片。在自動(dòng)化實(shí)驗(yàn)中,研究團(tuán)隊(duì)用一個(gè)大型語言模型(具體是Gemini 3.1 Pro)來擔(dān)任這個(gè)角色。它會(huì)查看原始圖片,然后用文字描述一種新的視覺風(fēng)格——比如"把這張草圖變成一個(gè)真實(shí)的臺球滾落木制貨架的場景"。關(guān)鍵約束是:題目的邏輯結(jié)構(gòu)必須完整保留,障礙物的數(shù)量、位置、角度都不能變,只有視覺呈現(xiàn)方式可以改。
第二步叫做"編輯者"。它負(fù)責(zé)按照第一步的指令,真正動(dòng)手改圖片。研究團(tuán)隊(duì)在實(shí)驗(yàn)中使用了Nano Banana Pro(本質(zhì)上是Gemini的圖像生成模塊)來完成這個(gè)工作。對于同一張圖片,編輯者會(huì)生成多個(gè)候選版本,默認(rèn)是五個(gè)。
第三步叫做"過濾器",是可選的。當(dāng)編輯者產(chǎn)出了多個(gè)候選圖片后,過濾器負(fù)責(zé)從中挑出質(zhì)量最好、與原圖邏輯最吻合的那一個(gè)。這個(gè)角色同樣由Gemini 3.1 Pro擔(dān)任,它會(huì)仔細(xì)比對編輯前后的圖片,確保題目本身沒有被意外改變。
完成這三步之后,改造好的圖片才被送給視頻模型,視頻模型生成一段演示視頻,最后由一個(gè)"裁判"(自動(dòng)評分模塊)判斷答案是否正確。
整個(gè)流程的設(shè)計(jì)理念是:始終對題目的邏輯內(nèi)容保持零干擾,只在視覺表現(xiàn)層面做文章。就像把同一道數(shù)學(xué)題從手寫板書抄到打印稿上——題目沒變,但讀者的閱讀體驗(yàn)變了。
三、用一道經(jīng)典物理題檢驗(yàn)效果
研究團(tuán)隊(duì)選擇的第一個(gè)測試場景是一個(gè)叫做VPCT的數(shù)據(jù)集。這個(gè)數(shù)據(jù)集的設(shè)定很直觀:屏幕上有一張草圖,一個(gè)白色圓圈從頂端出發(fā),沿著幾條斜線(代表障礙物)往下滑落,最終落入底部三個(gè)容器之一。題目要求預(yù)測圓圈會(huì)落入哪個(gè)容器。
原始版本完全是抽象的線條畫風(fēng)格,黑色線條代表障礙物,白色圓圈代表球,沒有任何質(zhì)感、光影或真實(shí)物體的特征。經(jīng)過視覺提示工程處理后,同樣的場景被渲染成了逼真的照片:白色圓圈變成了紅色臺球,黑色線條變成了實(shí)木擱板,整個(gè)場景看起來就像一個(gè)真實(shí)存在的臺球滾落展架的實(shí)驗(yàn)裝置。
研究團(tuán)隊(duì)用多個(gè)視頻模型測試了這個(gè)改變的效果,結(jié)果相當(dāng)顯著。以開源模型Wan2.2為例,在原始草圖條件下,它的正確率接近隨機(jī)猜測水平(隨機(jī)猜測三選一的概率是33.3%),英文提示版本的正確率只有32.4%。換成逼真圖片后,同一個(gè)模型的正確率穩(wěn)定地超過了隨機(jī)水平,達(dá)到40%以上。對于Google自家的Veo 3.1模型,改變更加明顯:原始草圖下正確率是41.3%,換成逼真圖片后直接跳升到59.3%,提升了整整18個(gè)百分點(diǎn)。另一個(gè)模型Omni Flash則從56.3%上升到67.5%。
為了驗(yàn)證真正起作用的是"寫實(shí)感"而非"立體感",研究團(tuán)隊(duì)還專門做了一組對照實(shí)驗(yàn):他們制作了一批看起來有立體感但紋理完全不真實(shí)(比如棋盤格紋理、熒光色拼接)的圖片。結(jié)果幾乎所有模型在這種"假3D"條件下的表現(xiàn),與原始草圖相比沒有顯著差異。這說明讓模型變聰明的不是3D效果本身,而是真實(shí)材質(zhì)、真實(shí)光影帶來的寫實(shí)感。
四、讓機(jī)器自動(dòng)找到最好的"視覺外衣"
手動(dòng)設(shè)計(jì)一套合適的圖片改造方案是可行的,但這需要人對模型有一定的了解,也比較費(fèi)時(shí)。更理想的情況是讓整個(gè)過程自動(dòng)完成。研究團(tuán)隊(duì)測試了兩種不同的自動(dòng)化策略。
第一種策略叫做"自由發(fā)揮構(gòu)想"。簡單說,就是讓一個(gè)AI(Gemini 3.1 Pro)在沒有任何預(yù)設(shè)框架的情況下,自由地為每個(gè)任務(wù)想出新的視覺呈現(xiàn)方案。為了保證多樣性,每次生成新方案時(shí),AI都能看到之前已經(jīng)提出過的所有方案,從而避免重復(fù)。研究團(tuán)隊(duì)對六個(gè)不同的視覺推理任務(wù)各自生成了20種不同的圖片變體,再用這些變體測試Veo 3.1的表現(xiàn)。
實(shí)驗(yàn)覆蓋的任務(wù)包括:上文提到的物理滾球預(yù)測(VPCT)、四種不同難度的迷宮求解(從5×5的簡單方格迷宮到形狀不規(guī)則的復(fù)雜迷宮)、停車場解謎(RushHour,需要移動(dòng)擋路的車輛讓目標(biāo)車輛出場)、視覺搜索(在一堆干擾物中找出兩個(gè)符合特定顏色和形狀條件的目標(biāo))、數(shù)字排序(讓數(shù)字按從小到大的順序逐一消失),以及連點(diǎn)成線(用線連接顏色相同的兩個(gè)圓點(diǎn))。
在這些任務(wù)上,自動(dòng)生成的視覺變體帶來的錯(cuò)誤減少率非常可觀。以數(shù)字排序任務(wù)為例,最好的一個(gè)圖片變體讓錯(cuò)誤率降低了70%。停車場解謎的某些變體讓錯(cuò)誤率降低了75%。迷宮求解在某些難度級別上也取得了超過40%的錯(cuò)誤減少率。不同的任務(wù)有不同的"最優(yōu)視覺風(fēng)格"——停車場解謎在被改造成"陽極氧化鋁金屬拼圖盒"風(fēng)格時(shí)表現(xiàn)最好,而迷宮在被渲染成"街機(jī)游戲屏幕截圖"風(fēng)格(畫面有細(xì)微的像素紋理)時(shí)效果最佳。
第二種策略叫做"逐步概念編輯"(ACE)。與第一種策略的"整體換風(fēng)格"不同,這種方法更像是一個(gè)外科醫(yī)生:每次只改變圖片中的一個(gè)元素,比如換掉背景顏色,或者給數(shù)字加上邊框,然后觀察效果,再?zèng)Q定下一步改什么。整個(gè)探索過程像一棵樹:從原始圖片出發(fā),每一次編輯都是一個(gè)分支,效果好的分支繼續(xù)延伸,效果差的分支剪掉。
ACE方法還有一個(gè)重要特點(diǎn):它能從實(shí)驗(yàn)結(jié)果中總結(jié)出規(guī)律,形成所謂的"規(guī)程",然后用這套規(guī)程指導(dǎo)后續(xù)的搜索。比如對于數(shù)字排序任務(wù),模型總結(jié)出了幾條反復(fù)奏效的原則:高對比度的深色背景能幫助模型聚焦在前景元素上;給每個(gè)數(shù)字加上幾何邊框能增強(qiáng)視覺定位;把平面元素改成有質(zhì)感的3D風(fēng)格(比如黑板粉筆字)能提升物體在時(shí)間維度上的穩(wěn)定性。研究團(tuán)隊(duì)特別指出,這些有效策略往往需要組合使用才能發(fā)揮最大效果,單獨(dú)使用任何一個(gè)效果都更有限。
相比之下,被反復(fù)證明無效甚至有害的操作包括:給物體添加高反光的金屬材質(zhì)(因?yàn)檫@種材質(zhì)會(huì)在視頻幀之間引入不穩(wěn)定的光影變化)、過度加粗字體(會(huì)讓數(shù)字邊界模糊)、以及把顏色調(diào)得過于鮮艷飽和(反而會(huì)分散模型的注意力)。
兩種策略各有優(yōu)劣。自由發(fā)揮構(gòu)想更省計(jì)算資源,適合快速探索;逐步概念編輯更精細(xì),在某些困難任務(wù)上能找到更好的單樣本解決方案。數(shù)字排序任務(wù)在ACE方法下甚至達(dá)到了100%的錯(cuò)誤減少率。
五、視覺提示工程與其他提升策略的橫向比較
研究團(tuán)隊(duì)不僅測試了視覺提示工程本身的效果,還把它與另外兩種常見的性能提升策略進(jìn)行了直接比較:反復(fù)生成視頻然后投票(也叫"自洽性"方法),以及直接改寫文字提示詞。
先看與反復(fù)生成的比較。這種策略的邏輯是:同一道題生成多個(gè)答案,然后用多數(shù)票決定最終答案,就像讓多個(gè)陪審員獨(dú)立投票一樣。研究團(tuán)隊(duì)在VPCT任務(wù)上讓Veo 3.1反復(fù)生成20次并投票,正確率從41.3%上升到50%,提升了大約8.7個(gè)百分點(diǎn)。而使用一次視覺提示工程處理過的圖片,僅用單次生成就已經(jīng)達(dá)到59.3%,比20次反復(fù)生成還高出將近10個(gè)百分點(diǎn)。
更有趣的是,這兩種策略并不互斥,可以疊加使用。在改造過的逼真圖片上再做20次投票,最終正確率達(dá)到了68%,比原始草圖加20次投票(50%)高出18個(gè)百分點(diǎn)。
從成本角度看,這種比較更加鮮明。生成一段8秒的視頻需要大約3.2美元,而完成一次視覺提示工程(包含5個(gè)候選圖片的生成和過濾)只需要大約0.4美元,不到視頻生成費(fèi)用的八分之一。這意味著在相同的預(yù)算下,把錢花在探索更多視覺變體上,比把錢花在生成更多視頻上效率更高。研究數(shù)據(jù)顯示,對于同等預(yù)算,最優(yōu)策略通常是盡可能多地探索不同的視覺變體,每個(gè)變體只生成一次視頻,而不是針對同一個(gè)視覺變體反復(fù)生成。
再看與文字提示工程的比較。研究團(tuán)隊(duì)用同樣的自動(dòng)化框架,分別生成了20個(gè)圖片變體和20個(gè)文字提示變體,在四個(gè)任務(wù)上進(jìn)行了直接對比。結(jié)論是:兩種策略都有效,但視覺提示工程在多數(shù)任務(wù)上表現(xiàn)更好。以視覺搜索任務(wù)為例,最好的圖片變體讓正確率從4%跳升到62%,而最好的文字變體只能達(dá)到12%。數(shù)字排序任務(wù)上,最好的圖片變體達(dá)到76%,最好的文字變體達(dá)到86%,這是少數(shù)幾個(gè)文字策略更優(yōu)的案例之一。
值得一提的是,研究團(tuán)隊(duì)還嘗試了同時(shí)修改圖片和文字的聯(lián)合優(yōu)化,但結(jié)果沒有比單獨(dú)修改圖片更好。研究者推測,這可能是因?yàn)槁?lián)合優(yōu)化增加了搜索難度,生成的方案反而不如專注于單一維度精雕細(xì)琢來得有效。
六、視頻模型為什么喜歡真實(shí)感
現(xiàn)在回到最根本的問題:為什么視覺提示工程會(huì)有效?研究團(tuán)隊(duì)通過一個(gè)精心設(shè)計(jì)的實(shí)驗(yàn)給出了直觀的解釋。
他們創(chuàng)建了一個(gè)逐步遞進(jìn)的視覺改造序列,從一個(gè)純粹抽象的合成場景出發(fā),每次只往"真實(shí)"方向走一小步。起點(diǎn)是兩個(gè)彩色圓點(diǎn)和兩條虛線,代表兩個(gè)物體沿各自路徑移動(dòng)到交匯點(diǎn)。第一步改造:把虛線換成鐵路軌道,但圓點(diǎn)保持不變。第二步:把圓點(diǎn)換成火車車廂模型,但背景仍然是白色。第三步:加上真實(shí)的綠色草地背景,整個(gè)場景看起來就像一段真實(shí)的俯拍鐵路視頻。
在每個(gè)階段,研究團(tuán)隊(duì)都讓Veo 3.1生成100段視頻,然后由真人評估員判斷生成的視頻是否"場景連貫"(即物體沒有憑空消失、沒有隨機(jī)變形、沒有莫名其妙地改變外觀)。結(jié)果沿著這條改造路徑單調(diào)遞增:純抽象場景的連貫性得分是0%,加上鐵路軌道后是11%,換上火車車廂后是24%,加上真實(shí)草地背景后是59%。每一小步朝真實(shí)感邁進(jìn),都直接對應(yīng)著視頻模型生成質(zhì)量的提升。
這個(gè)結(jié)果指向一個(gè)清晰的機(jī)制:在真實(shí)場景中,視頻模型"知道"物體應(yīng)該怎么運(yùn)動(dòng),因?yàn)檫@類場景在訓(xùn)練數(shù)據(jù)里出現(xiàn)過無數(shù)次,物理規(guī)律是隱含在訓(xùn)練記憶里的。但在抽象場景中,模型沒有足夠的"記憶"可以依賴,只能靠"猜",而猜出來的結(jié)果往往是物體隨機(jī)出現(xiàn)、消失或變形——這對任何需要追蹤物體狀態(tài)的推理任務(wù)都是致命的干擾。視覺提示工程的本質(zhì),就是把任務(wù)從模型陌生的視覺語言翻譯到模型熟悉的視覺語言。
七、這套方法并非對所有AI模型都適用
研究團(tuán)隊(duì)還做了一組補(bǔ)充實(shí)驗(yàn),測試視覺提示工程是否同樣能提升圖像生成模型的推理能力。他們選用了兩個(gè)版本的Nano Banana(Gemini系列的圖像生成模塊),讓這些模型直接從VPCT的圖片預(yù)測球會(huì)落入哪個(gè)桶,答案可以是一張圖片(畫出球落入某個(gè)桶的場景),也可以是一段文字(直接說"左邊"、"中間"或"右邊")。
結(jié)果出現(xiàn)了一個(gè)有趣的分化。對于圖像生成模型,視覺提示工程帶來的提升要么微弱,要么甚至是負(fù)面的。Nano Banana Flash在圖像輸出模式下,換用逼真圖片后正確率反而從37%下降到21%。但同一個(gè)模型切換到文字輸出模式,在原始草圖上的正確率就達(dá)到了58%。
這個(gè)結(jié)果揭示了一個(gè)重要的區(qū)別:圖像生成模型在訓(xùn)練中接觸過各種風(fēng)格的圖片,包括抽象風(fēng)格和寫實(shí)風(fēng)格,因此對它們來說抽象草圖并不陌生,視覺提示工程的"翻譯價(jià)值"就要小得多。而視頻模型的訓(xùn)練數(shù)據(jù)幾乎清一色是真實(shí)世界的視頻,抽象草圖對它們而言是真正陌生的領(lǐng)域。視覺提示工程能發(fā)揮作用,正是因?yàn)樗鼜浹a(bǔ)了輸入格式與模型訓(xùn)練分布之間的那道鴻溝。當(dāng)那道鴻溝本來就不存在時(shí),VIPE自然也就無用武之地。
此外,研究團(tuán)隊(duì)還發(fā)現(xiàn)了一個(gè)值得關(guān)注的現(xiàn)象:雖然Gemini 3.1 Pro作為純文字視覺問答模型,在VPCT原始數(shù)據(jù)集上能達(dá)到96%的超高正確率,但當(dāng)研究團(tuán)隊(duì)把桶翻轉(zhuǎn)過來倒置時(shí),正確率立刻崩潰到4%。更關(guān)鍵的是,這個(gè)模型能準(zhǔn)確識別出桶是倒置的,但仍然會(huì)告訴你球會(huì)"落入"某個(gè)倒置的桶——它理解視覺信息,卻無法把這個(gè)信息與物理常識正確結(jié)合。這說明當(dāng)前的視覺語言模型在VPCT上的高分,很可能來自某種視覺統(tǒng)計(jì)捷徑,而非真正的物理推理能力。
八、研究者留給整個(gè)領(lǐng)域的建議
基于上述發(fā)現(xiàn),研究團(tuán)隊(duì)提出了一個(gè)在學(xué)術(shù)評估層面頗具實(shí)踐意義的建議:在用視覺推理基準(zhǔn)評測視頻模型時(shí),如果評測集本身是抽象的、非寫實(shí)的,那么測出來的成績往往只是模型真實(shí)能力的下限,而非真實(shí)水平。就像不能用讓魚在陸地上爬行的測試來評估魚的運(yùn)動(dòng)能力一樣,用抽象草圖來評估視頻模型的推理能力,本質(zhì)上是在用錯(cuò)誤的測試環(huán)境得出偏低的結(jié)論。
研究團(tuán)隊(duì)建議:只要技術(shù)條件允許,評測者應(yīng)該主動(dòng)用視覺提示工程把抽象測試場景轉(zhuǎn)化為寫實(shí)場景,然后再測試模型能力。這樣得到的結(jié)果才能更真實(shí)地反映模型的內(nèi)在推理潛力。當(dāng)然,研究團(tuán)隊(duì)也坦承,模型對視覺風(fēng)格如此敏感本身就是一個(gè)需要被修正的問題——理想中的模型應(yīng)該能夠在任何視覺風(fēng)格下都表現(xiàn)穩(wěn)定,不需要用戶幫它"換衣服"才能正常工作。這與早期語言模型對措辭高度敏感的問題如出一轍,當(dāng)年人們發(fā)現(xiàn)"Obama worked as a ___"和"Obama is a ___ by profession"會(huì)得到截然不同的填充結(jié)果,如今類似的敏感性正在視覺模態(tài)上重演。
歸根結(jié)底,這項(xiàng)研究想傳遞的信息并不復(fù)雜:對于當(dāng)前的視頻生成模型,你給它看的圖片長什么樣,會(huì)極大地影響它能解出多少題。這個(gè)發(fā)現(xiàn)既是一個(gè)可以立即利用的實(shí)踐技巧,也是一個(gè)提醒——在我們慶祝AI推理能力取得新高分之前,也許應(yīng)該先問一句:這個(gè)高分是在"陸地上"測出來的,還是"水里"測出來的?
Q&A
Q1:視覺提示工程(VIPE)具體是怎么改變圖片的,會(huì)不會(huì)改變題目本身?
A:VIPE的核心原則是只改視覺風(fēng)格,不改題目邏輯。舉個(gè)例子,原來的物理題里有一個(gè)白色圓圈和幾條黑色斜線,VIPE會(huì)把圓圈改成真實(shí)的紅色臺球,把斜線改成實(shí)木貨架,但障礙物的數(shù)量、角度、位置完全不變。題目依然是那道題,只是看起來更真實(shí)了。整個(gè)過程會(huì)有一個(gè)過濾步驟,由AI(Gemini 3.1 Pro)仔細(xì)核查改造前后是否有邏輯變化,確保題目沒有被意外修改。
Q2:視覺提示工程和多次重復(fù)生成視頻相比,哪種更劃算?
A:視覺提示工程更劃算。以VPCT物理推理任務(wù)為例,生成一段8秒視頻約需3.2美元,而完成一次包含5個(gè)候選圖片的視覺提示工程只需約0.4美元,不到視頻生成費(fèi)用的八分之一。實(shí)驗(yàn)數(shù)據(jù)顯示,在相同預(yù)算下,把錢花在探索更多不同的視覺變體上,比反復(fù)生成同一張圖片的視頻效率更高。當(dāng)然兩種方法也可以疊加使用,效果會(huì)進(jìn)一步提升。
Q3:視頻模型為什么在寫實(shí)圖片上表現(xiàn)更好,在草圖上表現(xiàn)更差?
A:視頻模型是用海量真實(shí)世界視頻訓(xùn)練出來的,它的"記憶"里充滿了真實(shí)場景里物體的運(yùn)動(dòng)規(guī)律。當(dāng)它面對寫實(shí)圖片時(shí),能調(diào)用這些記憶預(yù)測物體怎么動(dòng);面對抽象草圖時(shí),它沒有足夠的參考,只能亂猜,結(jié)果就是視頻里物體隨機(jī)消失、變形,根本沒法正確推理。研究團(tuán)隊(duì)通過實(shí)驗(yàn)證實(shí),每向真實(shí)感邁進(jìn)一小步,模型生成的視頻連貫性就會(huì)明顯提升,從0%一路升到59%。
給AI"換一身行頭",視頻模型的推理能力竟能大幅提升 天天快報(bào)
給AI"換一身行頭",視頻模型的推理能力竟能大幅提升,視覺,草圖,視頻模
上海浦東引領(lǐng)區(qū)投資中心、和元生物成立創(chuàng)投合伙企業(yè)
人民財(cái)訊8月17日電,企查查APP顯示,近日,上海和元弘盛一期創(chuàng)業(yè)投資合
8月17日生意社混二甲苯基準(zhǔn)價(jià)為6753.33元/噸
8月17日,生意社混二甲苯基準(zhǔn)價(jià)為6753 33元 噸,與本月初(6526 67元 噸
豐林集團(tuán)(601996.SH):收到《稅務(wù)事項(xiàng)通知書》
,格隆匯
今日關(guān)注:8月15日滬鋅期貨收盤上漲0.41%,報(bào)25740元
證券之星消息,8月15日滬鋅主力期貨(ZNM)合約收盤上漲0 41%,報(bào)25740
三星電子上半年研發(fā)投入創(chuàng)紀(jì)錄達(dá)27萬億韓元
三星電子上半年研發(fā)投入創(chuàng)紀(jì)錄達(dá)27萬億韓元
生意社環(huán)氧氯丙烷8月14日均線下穿 均差為-10.00元/噸
據(jù)生意社監(jiān)測,環(huán)氧氯丙烷8月14日...
每日熱議!坐實(shí)“利潤第一股”?5.0億元元經(jīng)營性現(xiàn)金流凈流入,邁富時(shí)AI商業(yè)化不只看增速
邁富時(shí)2026年中期業(yè)績顯示,報(bào)告期...
英偉達(dá)800V白皮書2.0發(fā)布 電氣設(shè)備產(chǎn)業(yè)鏈迎新機(jī)遇-快訊
CFi CN訊:8月12日英偉達(dá)正式發(fā)布...
消息稱亞洲私募股權(quán)公司Trustar Capital正接近達(dá)成收購阿里巴巴集團(tuán)游戲業(yè)務(wù)的交...
消息稱亞洲私募股權(quán)公司TrustarCap...