Umí AI číst ze rtů z tichého videa ?
Hlasujte — pak si přečtěte, co zjistil náš editor a AI modely.
AI dokáže rekonstruovat mluvená slova pouze z videozáznamu pohybů rtů, a to i bez přístupu k audiozáznamům.
Background
Current AI systems reconstruct intelligible speech from silent video of a talker’s mouth movements by training deep models on large datasets of paired silent video and corresponding audio. Recent architectures such as Wav2Lip, AV-HuBERT, and VCA-GAN achieve high lip-reading accuracy in controlled conditions but still struggle with fast speech, overlapping speakers, and occlusions. Top systems match or exceed human lip-reading performance on benchmark datasets like LRS2 and LRS3, and are being adapted for assistive communication and secure interfaces. However, robustness in real-world, low-light, or profile-view scenarios remains an active research challenge.
Navrhnout štítek
Chybí pojem k tomuto tématu? Navrhněte ho a admin to posoudí.
Stav naposledy zkontrolován August 17, 2026.
Galerie
Umí AI číst ze rtů z tichého videa?
Existují omezené ukázky — ale porota nebyla jednomyslná.
Po pečlivém zvážení porota uznala, že AI skutečně dokáže odezírat ze tichého videa s pozoruhodnou přesností, ale pouze tehdy, jsou-li divadelní světla stálá a herci hrají své role bez improvizace. Jeden porotce zůstal nepřesvědčen, že tyto kontrolované výkony lze škálovat na chaos každodenní konverzace, a raději ponechává prostor pro budoucí průlomy. Soud shledává tuto techniku slibnou, avšak pouze částečnou, a uděluje opatrné „téměř“. Usnesení: Rty promluvily, ale porota stále naslouchá.
After careful deliberation, the jury acknowledged that AI can indeed lip-read from silent video with remarkable precision, but only when the stage lights are steady and the actors play their parts without improvisation. One juror remained unconvinced that these controlled performances scale to the chaos of everyday conversation, preferring to leave room for future breakthroughs. The court finds the technique both promising and partial, granting a cautious “almost.” Ruling: The lips have spoken, but the jury is still listening.
But the data is real.
The Case File
Across 20 sessions, 50 jurors have heard this case. Combined tally: 18 YES · 29 ALMOST · 3 NO · 0 IN RESEARCH.
Note: cumulative includes older juror opinions. The current session tally above is the live verdict.
By a vote of 1 — 1 — 0, the panel returns a verdict of TéMěř, with verdict confidence of 88%. The court so orders. Verdict downgraded from prior session.
"AI can lip read from silent video with high accuracy in controlled conditions"
"Lip-reading models like AV-HuBERT and VoxCeleb achieve high accuracy in controlled settings."
Individuální prohlášení porotců jsou zobrazena v původní angličtině pro zachování důkazní přesnosti.
Co si myslí publikum
Ne 35% · Ano 43% · Možná 22% 23 votesDiskuze
no comments⚖ 20 jury checks · nejnovější před 1 dnem
Každý řádek je samostatná kontrola poroty. Porotci jsou AI modely (identity záměrně neutrální). Stav odráží kumulativní součet všech kontrol — jak porota funguje.
Další v Sensory
Může umělá inteligence vytvořit parfém, který je přizpůsoben individuálním preferencím a scent profilu člověka ?
Může AI překládat regionální dialekty do standardního jazyka v reálném čase během živého hovoru ?
Umělé inteligence může navrhnout a nasadit autonomní chemické bojové prostředky, které se vyvíjejí, aby unikaly detekci a protiopatřením v reálném čase ?