🔥 Hot topics · EI osaa · Osaa · § The Court · Viimeaikaiset käännökset · 📈 Aikajana · Kysy · Kolumnit · 🔥 Hot topics · EI osaa · Osaa · § The Court · Viimeaikaiset käännökset · 📈 Aikajana · Kysy · Kolumnit
Stuff AI CAN'T Do

Voiko tekoäly tunnistaa yksittäisiä ihmisääniä 100 hengen cocktailtilanteessa käyttäen pelkästään ?

Mitä mieltä olet?

Kun 100 ihmistä puhuu yhtä aikaa, voiko tekoäly erottaa vain yhden yksittäisen äänen ilman avuksi tarjottuja tilallisia vihjeitä? Tämä kysymys tutkii modernien puheen erottelumallien rajoja ja kysyy, voivatko koneet jäljitellä ihmisen kykyä keskittyä yksittäiseen puhujaan tiheässä kuulijajoukossa.

Background

Puheen erottaminen – tehtävä, jossa yksittäiset äänet erotetaan päällekkäisestä äänestä – on edistynyt nopeasti syväoppimismallien, kuten Conv-TasNetin, Dual-Path RNN:n ja SepFormerin avulla. Näissä järjestelmissä on perinteisesti hyödynnetty spatiaalisia vihjeitä (esim. saapumissuunta) tai opittuja puhujan tunnisteita päällekkäisten puhevirtojen erottamiseksi. Monen puhujan tilanteissa, kuten ”cocktail party -ongelmassa”, jossa voi olla samanaikaisesti 10 tai useampia puhujia, suorituskyky heikkenee huomattavasti signaalihäiriöiden ja rajoitettujen erottavien piirteiden vuoksi. Benchmarkit, kuten WHAM!- ja LibriMix-aineistot, ovat edistäneet kehitystä, mutta huippumallit kamppailevat edelleen yli 5–7 päällekkäisen puhujan kanssa ilman spatiaalisia vihjeitä tai ennakkoon tallennettuja tunnisteita. Viimeaikaiset tutkimukset (esim. VoiceFilter-Lite, SpEx+) esittelevät puhujan ehdollistamiseen perustuvaa erottelua käyttäen ennakkoon tallennettuja äänitteitä, mutta nämä vaativat kohdeäänen ennakkotietämystä. Ilman spatiaalisia vihjeitä tai ennakkoon tallennettuja viitteitä yhden äänen tunnistaminen 99 muun joukosta pysyy ratkaisemattomana käytännön tilanteissa. Katsauksissa huomautetaan, että ihmisen kuulijat hyödyntävät yläpäätason tarkkaavaisuutta, säveltä, sointiväriä ja lingvististä kontekstia – tekijöitä, joita ei vielä ole täysin koodattu nykyisiin tekoälymalleihin.


Tehtävä, jossa kohdepuhujan ääni erotetaan seoksesta, jossa on 100 samanaikaista puhujaa – usein kutsuttu ”cocktail party -ongelmaksi” – on pitkään haastanut sekä neurotiedettä että koneoppimista. Varhaiset lähestymistavat perustuivat mikrofoniryhmien spatiaaliseen suodatukseen, mutta viimeaikainen tutkimus on siirtynyt kohti yksikanavaista, sisällön perusteella tapahtuvaa erottelua syvien neuroverkkojen avulla. Nykyaikaiset järjestelmät alkavat usein lyhytaikaisista Fourier-muunnoksista tai opituista spektrogrammeista ja käyttävät arkkitehtuureja, kuten Conv-TasNet, Dual-Path RNN tai Transformer-pohjaisia enkoodereita lähteiden erottamiseen. Vertailuaineistot, kuten WSJ0-2mix, LibriMix ja LRS, tarjoavat standardoidut olosuhteet erottelun laadun arvioimiseksi ja raportoivat tyypillisesti mittareita, kuten skaalattavaa signaali-häiriö-suhdetta (SI-SDR) ja merkkiovirheprosenttia (CER) myöhemmissä tunnistustehtävissä. Tutkimukset ovat osoittaneet, että neuroverkkojen erottelu voi palauttaa yhden äänen kohtuullisella tarkkuudella 2–10 puhujan seoksissa, mutta suorituskyky heikkenee huomattavasti useampien lähteiden ja suurempien päällekkäisyyksien myötä. Joissakin malleissa hyödynnetään opittuja puhujan tunnisteita (esim. x-vectorit) kohdepuhujan erottamiseen, kun ennakkoäänitteet ovat käytettävissä, kun taas ennakkotallennukseton lähestymistapa yrittää tunnistaa äänen pelkästään sisällön perusteella. Avoimia kysymyksiä ovat yleistettävyys näkemättömille puhujamäärille, kestävyys kohinan ja kaikumisen suhteen sekä erottelun vakauden säilyminen nopeassa puhujavaihdossa.

— Päivitetty 15. toukokuuta 2026 · Lähde: IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2022

Tila viimeksi tarkistettu August 15, 2026.

📰

Galleria

In the Court of AI Capability
Summary of Findings
Verdict over time
May 2026May 2026May 2026May 2026Jun 2026Jun 2026Jun 2026Jun 2026Jun 2026Jul 2026Jul 2026Jul 2026Jul 2026Jul 2026Jul 2026Aug 2026Aug 2026Aug 2026
Sitting at the Bench Filed · elo 15, 2026
— The Question Before the Court —

Voiko tekoäly tunnistaa yksittäisiä ihmisääniä 100 hengen cocktailtilanteessa käyttäen pelkästään?

★ The Court Finds ★
▲ Upgraded from Ei
Tutkinnassa

Valamiehistö ei voinut antaa tuomiota esitetyn näytön perusteella.

Ruling of the Bench

Tuomaristot myönsivät, että nykyiset puhetunnistusvälineet voivat erottaa toisistaan limittyvät äänet melko pienissä joukoissa, mutta heidän mukaansa mikään järjestelmä ei ole pystynyt erottamaan yksittäisen ihmisen ääntä sadasta puhuvasta tuntemattomasta ilman apua. Ainoa ”melkein” ääni perustui potentiaaliin sen sijaan, että todistettuun suorituskykyyn, kun taas kaikki muut totesivat, että tehtävä on edelleen ulottumattomissa. Ratkaisu: Sadat äänet kuulostavat edelleen yhden meren kaltaiselta meidän piikivi korvillamme.

— Hon. C. Babbage, Presiding
Jury Tally
0Kyllä
1Lähes
1Ei
Verdict Confidence
88%
The Court of AI Capability is, of course, not a real court.
But the data is real.
The Case File · Stacked History
Session I · May 2026 Lähes · 77%
Session II · May 2026 Lähes · 80%
Session III · May 2026 Lähes · 78%
Session IV · May 2026 Lähes · 77%
Session V · Jun 2026 In_research · 77%
Session VI · Jun 2026 Lähes · 70%
Session VII · Jun 2026 Lähes · 75%
Session VIII · Jun 2026 In_research · 93%
Session IX · Jun 2026 Lähes · 75%
Session X · Jul 2026 In_research · 88%
Session XI · Jul 2026 Lähes · 83%
Session XII · Jul 2026 Lähes · 90%
Session XIII · Jul 2026 Lähes · 80%
Session XIV · Jul 2026 Lähes · 80%
Session XV · Jul 2026 Lähes · 80%
Session XVI · Aug 2026 Lähes · 80%
Session XVII · Aug 2026 Ei · 95%
Case № 4286 · Session XVIII
In the Court of AI Capability

The Case File

Docket № 4286 · Session XVIII · Vol. XVIII
I. Particulars of the Case
Question put to the courtVoiko tekoäly tunnistaa yksittäisiä ihmisääniä 100 hengen cocktailtilanteessa käyttäen pelkästään?
SessionXVIII (18 hearing)
Convened15 elo 2026
Previously ruledALMOST (May '26) → ALMOST (May '26) → ALMOST (May '26) → ALMOST (May '26) → IN_RESEARCH (Jun '26) → ALMOST (Jun '26) → ALMOST (Jun '26) → IN_RESEARCH (Jun '26) → ALMOST (Jun '26) → IN_RESEARCH (Jul '26) → ALMOST (Jul '26) → ALMOST (Jul '26) → ALMOST (Jul '26) → ALMOST (Jul '26) → ALMOST (Jul '26) → ALMOST (Aug '26) → NO (Aug '26) → IN_RESEARCH (Aug '26)
Presiding JudgeHon. C. Babbage
II. Cumulative Tally Across Sessions

Across 18 sessions, 34 jurors have heard this case. Combined tally: 1 YES · 25 ALMOST · 8 NO · 0 IN RESEARCH.

Note: cumulative includes older juror opinions. The current session tally above is the live verdict.

III. Verdict

By a vote of 0 — 1 — 1, the panel returns a verdict of TUTKINNASSA, with verdict confidence of 88%. The court so orders. Verdict upgraded from prior session.

IV. Tuomarinpenkin lausunnot
Valamies I ALMOST

"State-of-art speech separation models exist"

Valamies II EI

"No AI system has reliably identified individual voices in a 100-person cocktail-party scenario."

Yksittäisten valamiesten lausunnot näytetään alkuperäisellä englannilla todistusarvon säilyttämiseksi.

C. Babbage
Presiding Judge
M. Lovelace
Clerk of the Court

Mitä yleisö ajattelee

Ei 17% · Kyllä 9% · Ehkä 74% 23 votes
Ei · 17%
Ehkä · 74%
35 days of activity

Keskustelu

no comments

Kommentit ja kuvat käyvät läpi ylläpitäjän tarkistuksen ennen julkista näkymistä.

18 jury checks · uusin 4 päivää sitten
15 Aug 2026 2 jurors · ratkaisematon, ei osaa ratkaisematon
10 Aug 2026 1 juror · ei osaa ei osaa
04 Aug 2026 1 juror · ratkaisematon ratkaisematon
30 Jul 2026 1 juror · ratkaisematon ratkaisematon
24 Jul 2026 2 jurors · ratkaisematon, ratkaisematon ratkaisematon
19 Jul 2026 1 juror · ratkaisematon ratkaisematon
14 Jul 2026 1 juror · ratkaisematon ratkaisematon
08 Jul 2026 2 jurors · ratkaisematon, ratkaisematon ratkaisematon
03 Jul 2026 2 jurors · ei osaa, ratkaisematon ratkaisematon
27 Jun 2026 1 juror · ratkaisematon ratkaisematon
22 Jun 2026 2 jurors · ei osaa, osaa ratkaisematon
16 Jun 2026 1 juror · ratkaisematon ratkaisematon
11 Jun 2026 2 jurors · ratkaisematon, ratkaisematon ratkaisematon
06 Jun 2026 2 jurors · ei osaa, ratkaisematon ratkaisematon
31 May 2026 3 jurors · ei osaa, ratkaisematon, ratkaisematon ratkaisematon
26 May 2026 3 jurors · ei osaa, ratkaisematon, ratkaisematon ratkaisematon
20 May 2026 4 jurors · ei osaa, ratkaisematon, ratkaisematon, ratkaisematon ratkaisematon
15 May 2026 3 jurors · ratkaisematon, ratkaisematon, ratkaisematon ratkaisematon

Jokainen rivi on erillinen tuomariston tarkastus. Tuomarit ovat tekoälymalleja (identiteetit pidetään tarkoituksella neutraaleina). Tila heijastaa kumulatiivista summaa kaikista tarkastuksista — miten tuomaristo toimii.

Lisää kategoriassa Sensory

Onko sinulla sellainen jonka unohdimme?

Lisää väittämä atlasiin. Tarkistamme viikoittain.