Edellisessä osassa käsittelimme neljää asiaa, jotka ratkaisevat, tuottaako data organisaatiollesi oikeasti arvoa: saavutettavuus, luotettavuus, ajantasaisuus ja ymmärrettävyys. Periaatteet eivät kuitenkaan yksin riitä, sillä ilman käytännön toteutusta ne ovat vain kauniita ajatuksia. Lupasimme kertoa, miltä näitä neljää tukeva data-alusta käytännössä näyttää, ja nyt on aika lunastaa lupaus.
Rakennuspalikoita on karkeasti jaoteltuna seitsemän kappaletta. Joku viisastelija (tekoäly) sanoi, että seitsemän osa-aluetta on liikaa yhteen blogipostaukseen. No mutta, kun vähemmällä ei pärjää, niin seitsemän palikkaa on luvassa.
Data-alusta ei ole yksittäinen tuote, vaan kokonaisratkaisu
Yleisin väärinkäsitys on, että data-alusta olisi vain yksittäinen tuote, joka hankitaan ja otetaan käyttöön. Käytännössä kyse on kokonaisuudesta, jossa jokaisella osa-alueella on oma selkeä tehtävänsä. Se on joissakin tapauksissa mahdollista hankkia yhtenä tuotteena, mutta silloinkin on tärkeää ymmärtää, miten tuote vastaa kaikkiin tarvittaviin osa-alueisiin.
Jaamme kokonaisuuden seitsemään osa-alueeseen: integraatiot, tietovarasto, laskentaresurssit, transformaatiot, jakelu, tekoäly ja hallinta. Jako pätee organisaation koosta riippumatta. Pienessä yrityksessä useampi osa-alue voi toteutua samalla teknologialla ja saman ihmisen käsissä. Suuressa organisaatiossa kukin niistä saattaa koostua useista palveluista ja tiimeistä. Peruslogiikka on kuitenkin sama, ja jokaisen osa-alueen pitäisi olla olemassa jossain muodossa. Nämä kannattaa rakentaa tietoisesti sen sijaan, että ne syntyvät vahingossa.
Käydään osa-alueet läpi siinä järjestyksessä, jossa data niiden läpi kulkee.
1. Integraatiot
Kaikki alkaa siitä, että data saadaan liikkeelle. Organisaation data syntyy kymmenissä, joskus sadoissa eri järjestelmissä: CRM:ssä, taloushallinnossa, verkkokaupassa, markkinointialustoilla ja tuotannonohjauksessa. Jokainen niistä tuottaa dataa omassa muodossaan ja omalla aikataulullaan.
Integraatiot ovat se mekanismi, jolla data haetaan lähdejärjestelmistä ja tuodaan alustalle. Tarjolla on sekä valmiita palveluja että räätälöityjä ratkaisuja, ja useimmissa organisaatioissa käytössä on molempia.
Tämä on se osa-alue, joka aliarvioidaan useimmin. Integraatioiden rakentaminen ei yleensä ole vaikeaa, mutta niiden ylläpito on. Lähdejärjestelmät muuttuvat, rajapinnat päivittyvät ja datavolyymit kasvavat. Konkreettinen esimerkki: CRM-toimittaja päivittää rajapintaansa, eikä asiakasdata enää virtaa alustalle. Jos virheidenhallintaa ja hälytyksiä ei ole, kukaan ei huomaa ongelmaa ennen kuin joku ihmettelee, miksi tuoreen viikon asiakkaat puuttuvat raportilta.
Tässä kerroksessa ratkaistaan myös ajantasaisuus. Päivittyykö data kerran vuorokaudessa eräajona vai jatkuvana virtana? Valinta vaikuttaa suoraan kokonaisuuden monimutkaisuuteen ja kustannuksiin, joten sen pitää perustua todelliseen liiketoimintatarpeeseen.
2. Tietovarasto
Kun data on saatu liikkeelle, se tarvitsee kodin. Tietovarasto on keskitetty paikka, jossa organisaation data säilytetään yhtenäisellä tavalla ja jossa se on kaikkien muiden osa-alueiden käytettävissä. Samasta osa-alueesta puhutaan myös nimillä data lake, joka tarkoittaa raakadatan säilyttämistä sellaisenaan, ja lakehouse, jossa tähän on lisätty tietovarastolle tyypilliset ominaisuudet, kuten taulurakenteet ja transaktiot.
Tietovarasto ei ole pelkkä tallennuspaikka, vaan sen rakenne ohjaa koko alustan toimintaa. Tyypillisesti data järjestetään kolmeen tai neljään kerrokseen. Ensimmäisessä kerroksessa data säilytetään sellaisenaan, alkuperäisessä muodossaan. Toisessa kerroksessa data on puhdistettu ja yhtenäistetty. Kolmannessa se on muokattu liiketoimintavalmiiksi. Databricks on lanseerannut tähän helposti lähestyttävän ja hieman juhlallisen termin, ”medallion architecture”, jossa kerrokset on nimetty pronssiksi, hopeaksi ja kullaksi jalostusasteen mukaan. Toisen ja kolmannen kerroksen väliin saatetaan lisätä vaihe, jossa tehdään uudelleenkäytettävät välilaskennat ennen loppukäyttäjille tarkoitettuja näkymiä.
Monissa nykyaikaisissa ratkaisuissa, kuten Snowflake tai Databricks, tallennus ja laskenta on erotettu toisistaan, mikä on merkittävä ero perinteisiin tietokantoihin verrattuna. Tämä johtaa suoraan seuraavaan osa-alueeseen.
3. Laskentaresurssit
Data ei jalostu itsestään. Jokainen kysely, datan käsittely ja mallin koulutusajo kuluttaa laskentaresursseja. Perinteisten tietovarastojen kanssa on totuttu siihen, että laskentaresurssit ovat ne, jotka palvelimelle aikoinaan hankittiin. Moderneissa pilvipohjaisissa ratkaisuissa tiedon käsittelyyn tarkoitettuja resursseja voidaan aktiivisesti säätää sen mukaan, mitä milloinkin tarvitaan.
Käytännössä tämä tarkoittaa kahta asiaa. Ensinnäkin resurssit skaalautuvat, jolloin kuukauden vaihteen raskas ajo voi käyttää enemmän tehoa kuin hiljainen tiistai-iltapäivä. Toiseksi eri työkuormat voidaan erottaa toisistaan, jolloin raskas datan käsittely ei hidasta johdon raportointia.
Tähän liittyy vahvasti kustannusten hallinta. Kun laskennasta maksetaan käytön mukaan, kustannus on parempi pitää suunnittelukysymyksenä eikä laskutuspäivän yllätyksenä. Huonosti kirjoitettu kysely tai turhaan täydellä teholla pyörivä ympäristö näkyy suoraan laskussa. Siksi laskentaresurssien mitoitus ja seuranta kannattaa ottaa mukaan jo suunnitteluvaiheessa.
4. Transformaatiot
Raakadata ei sellaisenaan palvele ketään. Transformaatiot ovat se työ, jossa datasta tulee käyttökelpoista: poistetaan duplikaatit, korjataan muotovirheet, yhtenäistetään rakenne, lasketaan tunnusluvut ja yhdistetään eri lähteiden data toisiinsa.
Tämä työ kannattaa tehdä samoilla periaatteilla kuin ohjelmistokehitys. Kun transformaatiot ovat versioituja, testattuja ja dokumentoituja, muutokset ovat hallittuja ja virheet löytyvät ennen kuin ne päätyvät raportille. Nykyaikaiset transformaatiotyökalut, kuten dbt, on rakennettu juuri tätä varten.
Edellisessä tekstissä puhuttiin luotettavuudesta ja yhteisistä määritelmistä. Juuri tässä ne konkretisoituvat. Kun laskentalogiikka on kirjoitettu kerran ja yhteen paikkaan, ei enää synny tilannetta, jossa kaksi ihmistä saa samaan kysymykseen eri luvun.
5. Jakelu
Data-alustan arvo mitataan lopulta siinä, miten hyvin se palvelee loppukäyttäjiä. Jakelu on se osa-alue, jonka kanssa ihmiset ovat päivittäin tekemisissä.
Käytännössä jakelu tarkoittaa, että jalostettu data on saatavilla siellä, missä sitä tarvitaan. Analyytikko hakee datan Power BI:hin tai Qlikkiin. Talousosasto avaa näkymän Exceliin. Data engineer kirjoittaa SQL-kyselyn suoraan tietovarastoon. Rajapintojen kautta dataa viedään myös takaisin operatiivisiin järjestelmiin, esimerkiksi asiakassegmentti CRM:ään markkinoinnin käyttöön.
Jakeluun liittyy nykypäivänä vahvasti myös tekoäly. Amityn Agentic BI on tästä hyvä esimerkki. Perinteinen raportointi vastaa niihin kysymyksiin, jotka on osattu ennakoida raporttia rakennettaessa. Agenttipohjainen lähestymistapa vastaa myös ennakoimattomiin kysymyksiin ja vie analyysin askeleen pidemmälle, etsimällä syitä poikkeamalle tai valmistelemalla seuraavan toimenpiteen.
Jotta kaikki nämä kanavat näyttäisivät saman totuuden, tarvitaan niiden väliin yhteinen kerros. Tätä kutsutaan semanttiseksi kerrokseksi, joka on myös oleellinen osa data-alustaa, vaikka se on perinteisesti nähty raportointityökalun osa-alueena. Semanttinen kerros on liiketoimintalähtöinen määrittely siitä, mitä käsitteet ja mittarit tarkoittavat: mikä lasketaan myynniksi, kuka on aktiivinen asiakas, miten kate muodostuu. Kun myynti on määritelty kerran, BI-työkalu, Excel, tekoälytyökalu ja agentit näyttävät kaikki saman luvun.
6. Tekoäly
Tekoälyyn viitattiin jo aiemmassa osiossa. Se on osa-alue, joka vie alustan askelta pidemmälle. Käytännössä kyse on kolmesta eri asiasta:
Koneoppimismallit tuottavat ennusteita ja luokitteluja: mikä asiakas on vaarassa poistua, mikä laite todennäköisesti hajoaa, mihin luokkaan tämä tapahtuma kuuluu. Niillä on oma elinkaarensa. Malli pitää kouluttaa, versioida, viedä tuotantoon ja ennen kaikkea seurata, koska mallin tarkkuus heikkenee ajan myötä, kun todellisuus sen ympärillä muuttuu.
Kielimallit tuovat mukaan kyvyn käsitellä luonnollista kieltä ja jäsentämätöntä dataa. Kielimalleilla pystytään tehostamaan kehitystä ja jalostamaan dataa. Ne eivät kuitenkaan tunne organisaatiosi lukuja ilman, että ne kytketään data-alustaan. Kielimallin arvo syntyy siitä, mitä kontekstia sille annetaan, ei mallista itsestään.
Agentit yhdistävät kielimallin päättelyn ja pääsyn työkaluihin. Agentti ei ainoastaan vastaa kysymykseen, vaan pystyy suorittamaan monivaiheisen tehtävän: hakemaan dataa, tekemään laskennan, tarkistamaan tuloksen ja kirjaamaan sen eteenpäin. Tämä nostaa hallinnan vaatimuksia. Pitää olla selvää, mihin agentti pääsee käsiksi, mitä se saa tehdä ja mistä jälkikäteen näkee, mitä se teki.
7. Hallinta
Seitsemännen osa-alueen puuttuminen kostautuu ensimmäisenä. Hallinta varmistaa, että kaikki edellä kuvattu toimii yhdessä luotettavasti päivästä toiseen.
Orkestraatio tarkoittaa, että integraatiot, transformaatiot ja lataukset suoritetaan oikeassa järjestyksessä ja oikeaan aikaan. Kun CRM-data päivittyy kuudelta aamulla, transformaatiot ajetaan sen jälkeen ja raportit ovat valmiina kahdeksalta, kyse on orkestraatiosta.
Monitorointi kertoo, kun jokin menee pieleen. Automaattiset hälytykset huomauttavat epäonnistuneesta ajosta, odotetusta poikkeavista rivimääristä tai datasta, joka ei ole enää tuoretta. Ilman monitorointia virheet huomataan vasta silloin, kun joku kyseenalaistaa luvun kokouksessa. Tämä kytkeytyy vahvasti myös datan laadun varmistukseen ja seurantaan, joka ansaitsisi kokonaan oman blogipostauksen.
Metadata täydentää kokonaisuuden. Mistä tämä luku tulee, milloin se on viimeksi päivitetty ja kuka omistaa tiedot? Datakatalogi kokoaa nämä tiedot yhteen ja tekee alustasta läpinäkyvän.
Käyttäjähallinta vastaa siihen, kenellä on oikeudet tietoihin ja resursseihin. Käytännössä oikeudet kannattaa sitoa rooleihin eikä yksittäisiin henkilöihin, jolloin uuden työntekijän aloittaminen tai tehtävän vaihtuminen ei vaadi käsityötä jokaisessa järjestelmässä erikseen. Kun oikeudet on määritelty keskitetysti data-alustalla, samat säännöt pätevät riippumatta siitä, tuleeko käyttäjä raportointityökalun, Excelin vai tekoälyagentin kautta.
Yhteenveto: osat palvelevat kokonaisuutta
Data-alusta ei ole vain yksittäinen teknologia, vaan seitsemän osa-alueen kokonaisuus. Integraatiot tuovat datan sisään. Tietovarasto säilyttää sen. Laskentaresurssit suorittavat työkuormat. Transformaatiot jalostavat. Jakelu vie datan käyttäjille. Tekoäly tuo kyvyn tehdä päätelmiä ja toimenpiteitä. Hallinta pitää kaiken toiminnassa.
Data-alusta on yksi tärkeimmistä resursseista nykyajan organisaatioille. Kaikkea ei tarvitse rakentaa kerralla valmiiksi. Kannattaa kuitenkin tietää, missä kunnossa kukin osa-alue on omassa organisaatiossa, sillä heikoin lenkki määrittää sen, kuinka tehokkaassa käytössä datasi on. Jos haluat keskustella oman organisaatiosi data-alustan tilanteesta, ota meihin yhteyttä.



