Datan laatu AI-hankkeissa – millaista dataa tekoäly tarvitsee?

Siirry sivun sisältöön

Tekoälyn hyödyntämisessä huomio kiinnittyy helposti malleihin ja uusiin käyttötapauksiin. Käytännössä monen AI-hankkeen onnistuminen ratkaistaan kuitenkin datassa: siinä, millaista tietoa tekoälylle tarjotaan ja kuinka hyvin sen merkitys ja konteksti tunnetaan.

Ambientian webinaarissa Datan laatu – avain onnistuneisiin AI-hankkeisiin tarkasteltiin, miksi data muodostuu usein tekoälyn hyödyntämisen pullonkaulaksi, milloin data on riittävän hyvää ja mitä metadata, konteksti ja hiljainen tieto merkitsevät AI-ratkaisuille.

Kaiken datan ei kuitenkaan tarvitse olla täydellistä ennen liikkeelle lähtöä. Olennaisempaa on ymmärtää, mitä juuri kyseinen käyttötapaus vaatii ja millä tarkkuudella ratkaisun pitää toimia, jotta siitä syntyy arvoa.

 

Miksi data on AI-hankkeen pullonkaula?

Yksi tekoälyyn liittyvä vaarallinen oletus on ajatus siitä, että riittävän älykäs järjestelmä pystyisi jotenkin kompensoimaan heikkolaatuista dataa. Käytännössä tekoäly on kuitenkin riippuvainen siitä aineistosta ja kontekstista, jonka varassa se toimii.

Ihminen osaa usein huomata raportissa luvun, joka ei yksinkertaisesti voi pitää paikkaansa. Hän tunnistaa poikkeaman kokemuksensa, muun tiedon ja tilanteeseen liittyvän hiljaisen ymmärryksen avulla. Tekoälyn kohdalla tällaista tervettä epäluuloa ei voida pitää itsestäänselvyytenä. Jos järjestelmälle tarjotaan väärää tietoa, se voi käyttää sitä osana päättelyään aivan kuten oikeaakin tietoa. Tämä korostuu erityisesti silloin, kun AI-ratkaisu koostuu useista peräkkäisistä vaiheista tai agenteista: alkupään virhe voi kulkea koko ketjun läpi ja sen alkuperän jäljittäminen voi olla vaikeaa.

Toinen tyypillinen ongelma on datan puuttuminen. Organisaatio on voinut harjoittaa samaa liiketoimintaa vuosia tai vuosikymmeniä, mutta se ei tarkoita, että toiminnasta olisi syntynyt AI:n hyödynnettävissä olevaa historiaa. Tieto voi olla hajallaan järjestelmissä, epäyhtenäisessä muodossa tai yksinkertaisesti ihmisten päässä. Jos tarvittavaa dataa ei ole koskaan kerätty, tekoäly ei voi jälkikäteen muodostaa puuttuvaa historiaa tyhjästä.

Datan määrä ei yksin riitä

Datan laadusta puhuttaessa huomio kiinnittyy usein oikeellisuuteen ja täydellisyyteen. AI-ratkaisujen näkökulmasta yhtä keskeisiä kysymyksiä ovat kuitenkin datan kattavuus, historia ja ennen kaikkea sen merkitys.

Hyvin suppea tai hajanainen aineisto voi ohjata tekoälyä väärään suuntaan, vaikka yksittäiset tietueet itsessään olisivat oikein. Jos tavoitteena on tunnistaa ilmiöitä tai muodostaa kokonaiskuvaa useista lähteistä, myös aineiston laajuudella on merkitystä.

Vielä tärkeämmäksi nousee semanttinen konteksti. Organisaation ihmisille jonkin tietokentän, termin tai järjestelmän merkitys saattaa olla itsestään selvä. Tekoälylle se ei ole sitä. Sama käsite voi tarkoittaa eri järjestelmissä eri asioita, järjestelmämuutokset voivat muuttaa tiedon merkitystä ajan myötä ja taulukon tekninen nimi voi kertoa hyvin vähän siitä, mitä tieto liiketoiminnassa todella tarkoittaa.

Tässä metadata, dokumentaatio ja yhteisesti määritellyt käsitteet muuttuvat tärkeiksi. Niiden tehtävä ei ole vain auttaa ihmisiä löytämään tietoa, vaan tehdä datan merkitys riittävän eksplisiittiseksi myös järjestelmälle, joka ei tunne organisaation historiaa tai toimintatapoja.

Hiljainen tieto on tekoälylle näkymätöntä

Organisaatioissa hyödynnetään paljon hiljaista tietoa, jota ei ole kirjattu järjestelmiin tai ohjeisiin. Kokeneet asiantuntijat tietävät, mitä jokin raportti todellisuudessa kertoo, mitkä luvut vaativat tulkintaa, milloin järjestelmä vaihtui ja keneltä pitää kysyä, jos jokin tieto näyttää oudolta.

Tällainen toimintamalli voi toimia vuosia, koska ihmiset paikkaavat datan puutteita omalla osaamisellaan. Tekoälyn käyttöönotto paljastaa helposti sen heikkouden. AI ei tiedä sitä, mitä sille ei ole tavalla tai toisella kerrottu.

Siksi yksi datan kehittämisen keskeisistä tehtävistä on siirtää olennaista tietoa pois pelkästä ihmisten muistista ja tehdä siitä dokumentoitua ja koneen hyödynnettävissä olevaa kontekstia. Mitä enemmän tekoälyn odotetaan toimivan itsenäisesti erilaisten tietolähteiden kanssa, sitä tärkeämmäksi tämä muuttuu.

Milloin data on riittävän hyvää?

Täydellisen datan tavoittelu voi muodostua myös esteeksi. Jos AI-hanketta ei haluta aloittaa ennen kuin koko organisaation data on puhdasta, dokumentoitua ja yhdenmukaista, ensimmäinen kokeilu saattaa siirtyä jatkuvasti eteenpäin.

Datan laadulle ei ole yhtä yleispätevää rajaa. Se, mikä on riittävän hyvää yhdessä käyttötapauksessa, voi olla täysin riittämätöntä toisessa.

Keskeinen kysymys on, kuinka tarkka lopputuloksen pitää olla, jotta ratkaisusta syntyy arvoa. Perinteinen deterministinen järjestelmä voidaan rakentaa tuottamaan täsmälleen ennalta määritelty tulos. Tekoälyn vahvuus on usein jossain muualla. Jos monimutkaisen tehtävän ratkaiseminen perinteisellä tavalla vaatisi suuren määrän integraatioita ja pitkän kehitysprojektin, mutta AI pystyy nopeasti tuottamaan riittävän hyvän suuntaa-antavan lopputuloksen, pienempi tarkkuus voi olla hyväksyttävä kompromissi. Eksaktia lukua vaativassa käyttötapauksessa sama tarkkuustaso ei tietenkään riitä.

Siksi datan laatua kannattaa arvioida suhteessa käyttötapaukseen, riskiin ja tavoiteltuun lopputulokseen. Kysymys ei ole vain siitä, onko data abstraktisti hyvää tai huonoa, vaan siitä, pystyykö sen pohjalta rakennettu ratkaisu tekemään sen, mitä siltä odotetaan.

Testaa ensin, paranna sen jälkeen

Käytännöllinen tapa lähestyä asiaa on iterointi. Rajataan käyttötapaus, kokeillaan nykyisellä datalla ja arvioidaan lopputulos. Jos tulos ei ole riittävän hyvä, selvitetään mistä se johtuu ja parannetaan juuri niitä datan osa-alueita, jotka osoittautuvat käyttötapauksen kannalta merkityksellisiksi.

Tämä ei tarkoita, ettei datan laatua pitäisi kehittää systemaattisesti. Päinvastoin. Datan laatu on jatkuva prosessi, sillä myös käyttötarpeet muuttuvat. Uusi käyttötapaus voi synnyttää tarpeen tarkemmalle metadatalle, paremmalle historialle tai kokonaan uudelle datalle.

Iteratiivinen lähestymistapa auttaa kuitenkin välttämään tilanteen, jossa organisaatio yrittää ratkaista etukäteen jokaisen mahdollisen dataongelman tietämättä, mitkä niistä todella estävät arvon syntymisen. Lopulta ratkaiseva testi on käytännöllinen: vastaako toteutus tarpeeseen ja tuottaako se arvoa?

Myös ratkaisun rakenne vaikuttaa siihen, kuinka hyvä datan pitää olla. Jos tekoäly tuottaa tietoa asiantuntijan päätöksenteon tueksi ja ihminen tarkistaa lopputuloksen, järjestelmä voi sietää enemmän epävarmuutta kuin ratkaisu, joka tekee päätöksiä automaattisesti.

Data governance ei saa jäädä irralliseksi

AI-hankkeessa datan laatu ei ole vain tekninen kysymys. Samasta datasta voivat olla vastuussa eri näkökulmista eri henkilöt: yksi huolehtii sisällöstä, toinen laadusta, kolmas tietoturvasta ja neljäs järjestelmistä. Tällainen työnjako ei itsessään ole ongelma, kunhan vastuut ja toimintatavat ovat selkeitä.

Haaste syntyy silloin, kun nämä näkökulmat kohtaavat vasta yksittäisen AI-hankkeen aikana. Käyttötapaus voi olla liiketoiminnallisesti hyödyllinen mutta tietoturvan näkökulmasta ongelmallinen. Toisaalta liian raskas tai epäselvä hyväksyntäprosessi voi johtaa siihen, että hyödyllisiä kokeiluja ei saada lainkaan liikkeelle.

Laatu ja tietoturva voidaan organisatorisesti erottaa toisistaan, mutta käytännössä niiden välillä kulkee paljon samoja riippuvuuksia. Olennaista on, että organisaatiossa tiedetään, millä perusteilla dataa saa käyttää, millaiset laatuvaatimukset siihen kohdistuvat ja kuka pystyy tekemään tarvittavat päätökset ilman, että jokainen uusi käyttötapaus joutuu aloittamaan keskustelun tyhjästä.

Sensitiivinen data vaatii tietoisen valinnan

Kaikkea dataa ei luonnollisesti voida käsitellä samalla tavalla. Ratkaisua suunniteltaessa pitää ymmärtää, kuinka arvokasta tai sensitiivistä käsiteltävä tieto on ja mitä tapahtuisi, jos se päätyisi väärään paikkaan.

Asiakas- ja tilaustiedot voivat esimerkiksi olla monelle organisaatiolle aineistoa, jonka käsittelyssä tarvitaan aivan eri varovaisuutta kuin julkisessa tai muuten vähäriskisessä datassa. Lähtökohtana ei myöskään pidä olla oletus siitä, että julkiseen kielimallipalveluun syötetty tieto olisi automaattisesti samalla tavalla organisaation omassa hallinnassa kuin sen omissa järjestelmissä.

Vaihtoehtoja on useita. Malleja voidaan ajaa omissa ympäristöissä, jos käyttötapaus sitä edellyttää, mutta tämä tuo mukanaan kustannuksia ja teknisen osaamisen tarvetta. Toisissa tilanteissa dataa voidaan muokata ennen ulkopuolisen mallin käyttöä niin, ettei varsinainen sensitiivinen sisältö välity mallille. Webinaarissa esiin nostettu esimerkki on teknisten nimien ja rakenteiden automaattinen obfuskointi ennen julkisen kielimallin käyttöä ja niiden palauttaminen vastauksen jälkeen. Näin mallin kyvykkyyttä voidaan hyödyntää paljastamatta sille alkuperäistä sisältöä.

Tietoturvan onnistuminen ei kuitenkaan ratkea vain arkkitehtuurilla. Jos turvalliset toimintatavat ovat henkilöstölle liian vaikeita, hitaita tai epäselviä, ihmiset alkavat helposti kiertää niitä. Siksi käytännön toimintamallien, koulutuksen ja helppokäyttöisten työkalujen merkitys on suuri.

Tekoäly voi myös parantaa datan laatua

AI:n ja datan suhde ei kulje vain yhteen suuntaan. Hyvä data auttaa rakentamaan parempia AI-ratkaisuja, mutta tekoälyä voidaan käyttää myös datan laadun valvontaan.

Perinteisessä testauksessa tarkistetaan yleensä sellaisia ongelmia, jotka joku on osannut ennakoida tai jotka on jo kerran havaittu. Mahdollisten poikkeamien määrä voi kuitenkin olla niin suuri, ettei jokaiselle kannata rakentaa erillistä sääntöä tai tarkistusta.

Tekoäly voi toimia tällaisessa ympäristössä ylimääräisenä silmäparina. Se voi käydä esimerkiksi suuren määrän tauluja tai tietorakenteita läpi ja tunnistaa tilanteita, joissa jotain puuttuu kokonaan, rakenne poikkeaa selvästi aikaisemmasta tai jokin arvo on aivan eri kokoluokassa kuin pitäisi. Tarkoitus ei ole korvata deterministisiä tarkistuksia eikä rakentaa sataprosenttista laadunvarmistusta, vaan saada kiinni sellaisia harvinaisia ongelmia, joita kukaan ei ole osannut ennakolta määritellä.

Erityisen arvokasta tämä voi olla silloin, kun data siirtyy nopeasti asiakkaiden tai muiden loppukäyttäjien käyttöön. Jos poikkeama havaitaan ennen kuin virheellinen tieto leviää eteenpäin, pienelläkin lisävarmistuksella voi olla suuri vaikutus.

Ihminen säilyy päätöksenteon ytimessä

Tekoäly pystyy vähentämään merkittävästi ihmisen kognitiivista kuormaa. Se voi hakea tietoa, yhdistellä aineistoja, tunnistaa poikkeamia ja valmistella päätöksenteossa tarvittavaa materiaalia. Tämä voi vapauttaa asiantuntijan keskittymään niihin tilanteisiin, joissa tarvitaan laajaa kontekstia, kokemusta ja harkintaa.

Merkittävää päätöksentekoa ei kuitenkaan ole järkevää siirtää sellaisenaan tekoälyn vastuulle. Mitä suuremmat seuraukset päätöksellä on, sitä tärkeämmäksi nousevat ihmisen tekemä arviointi ja lopputuloksen validointi.

Tämä muuttaa myös AI-ratkaisujen hankintaa. Perinteisessä IT-järjestelmässä toimittaja voi usein osoittaa melko yksiselitteisesti, että tietty laskenta tai prosessi toimii määrittelyn mukaisesti. Tekoälyratkaisussa käyttävän organisaation on usein itse arvioitava, palveleeko syntyvä lopputulos todellista käyttötarvetta.

Siksi tekoälyä ei voi kokonaan ulkoistaa samalla tavalla kuin joitakin perinteisiä teknologioita. Organisaatio tarvitsee riittävästi omaa ymmärrystä pystyäkseen arvioimaan ratkaisun toimintaa, tunnistamaan sen rajoitteita ja validoimaan tuloksia. Samalla tämä osaaminen tukee tekoälyn jalkauttamista koko organisaatioon.

AI nostaa datan laatutasoa

Tekoälyn yleistyminen voi muuttaa myös käsitystä siitä, mitä pidämme hyväksyttävänä datan laatuna. Monet nykyiset datan ongelmat pysyvät piilossa, koska ihmiset ovat oppineet elämään niiden kanssa.

Joku tietää, että tietyssä raportissa on aina tietty virhe. Toinen tietää, mistä oikea tieto pitää hakea. Kolmas tietää, kenelle poikkeuksesta pitää ilmoittaa. Organisaatio siis käytännössä ylläpitää heikkolaatuista dataa ihmisten kokemuksen ja manuaalisten korjausliikkeiden avulla.

Kun tekoälyä aletaan käyttää laajemmin, tällaiset piilevät riippuvuudet muuttuvat ongelmiksi. AI ei automaattisesti tiedä, kuka organisaatiossa osaa tulkita tietyn poikkeaman tai miksi vanha järjestelmä tuottaa eri tavalla nimettyä dataa. Tämän seurauksena datan laadun rima voi nousta selvästi nykyistä korkeammalle.

Tämä ei tarkoita, että jokaisen organisaation pitäisi välittömästi rakentaa kokonaan uusi data-arkkitehtuuri. Tarpeet vaihtelevat suuresti käyttötapausten mukaan. Monelle olennaisempaa on aloittaa nykyisen datan muuttaminen helpommin saavutettavaan, ymmärrettävään ja AI:n käytettävissä olevaan muotoon sekä kehittää laatua vähitellen.

Samalla kannattaa kasvattaa osaamista ajoissa. Pienikin jatkuva panostus dataan ja AI-kyvykkyyksiin voi olla parempi vaihtoehto kuin tilanne, jossa tarve muuttuu muutaman vuoden päästä kiireelliseksi ja organisaatio huomaa sekä teknologian että osaamisen olevan jäljessä.

Liikkeelle pienistä käyttötapauksista

Kun organisaatio haluaa saada tekoälystä hyötyä nopeasti, ensimmäisen kysymyksen ei välttämättä pitäisi olla: Mihin kaikkeen voisimme käyttää tekoälyä? Parempi lähtökohta on tarkentaa, mitä ongelmaa halutaan ratkaista.

Usein ensimmäiseksi kannattaa valita pieni ja rajattu käyttötapaus, jonka avulla organisaatio oppii sekä teknologiasta että omasta datastaan. Webinaarissa esiin nostettiin esimerkki asiakaspalvelusta: AI voisi hakea asiakkaan historiasta olennaisia tietoja, koostaa KPI-tietoja ja nostaa esiin trendejä ennen asiakaskohtaamista. Asiakaspalvelijan ei tarvitsisi tuntea koko asiakkaan historiaa ulkoa, mutta lopullinen vuorovaikutus ja harkinta jäisivät edelleen ihmiselle.

Tällainen käyttötapaus on aivan eri mittaluokassa kuin esimerkiksi koko tuotantoprosessin optimointi materiaalihankinnoista toimitukseen. Suurikin tavoite voi olla järkevä, mutta ensimmäisenä AI-projektina se tuo kerralla ratkaistavaksi valtavan määrän asioita, joista organisaatiolla ei vielä välttämättä ole kokemusta.

Tekoälyn kiinnostava potentiaali löytyykin osittain ongelmista, joita ei aikaisemmin ole pidetty ratkaisemisen arvoisina. Jos asiantuntija käyttää kaksi päivää kuukaudessa yksinkertaiseen manuaaliseen työhön, perinteisen automaatioratkaisun rakentaminen ei ehkä olisi koskaan maksanut itseään takaisin. AI voi muuttaa tämän laskelman.

Kun tällaisia pieniä parannuksia kertyy useita, niiden yhteisvaikutus voi olla paljon suurempi kuin yhdellä näyttävällä AI-hankkeella. Tavoitteena ei tarvitse olla ihmisten korvaaminen, vaan ajan vapauttaminen mekaanisesta työstä tehtäviin, joissa ihmisen osaamisesta syntyy enemmän arvoa.

Hyvä AI-hanke alkaa datasta – mutta ei pääty siihen

Datan laatu on yksi tekoälyn hyödyntämisen keskeisistä edellytyksistä, mutta sitä ei pidä nähdä erillisenä esiprojektina, joka täytyy saada valmiiksi ennen kuin mitään voidaan tehdä.

Parempi lähestymistapa on yhdistää datan kehittäminen konkreettisiin käyttötapauksiin. Valitaan todellinen ongelma, määritellään tarvittava tarkkuus, kokeillaan nykyisellä datalla ja validoidaan lopputulos. Samalla opitaan, mitä dataa puuttuu, missä konteksti on epäselvä ja mitä organisaation pitää seuraavaksi kehittää.

Näin AI-hankkeet ja datan laadun parantaminen tukevat toisiaan. Organisaatio ei jää odottamaan täydellistä dataa, mutta ei myöskään rakenna tekoälyratkaisuja sokkona puutteellisen perustan päälle.

Ja ehkä juuri siinä on tärkein muutos: tekoäly pakottaa organisaatiot tekemään näkyväksi asioita, joiden kanssa ne ovat aikaisemmin vain oppineet elämään.

Lisää aiheeseen liittyvää

Blogi

EU Data Act tulee – oletko valmis?

Euroopan unioni on työstämässä Data Actia eli datasäädöstä. Mutta mikä on EU Data Act ja miksi jokaisen yrityksen kannattaa nyt tutustua siihen etukenossa?

Lue lisää

Julkaistu 6.10.2023 | Päivitetty 19.1.2024