Warré-arkivet
Interessen for birøkt på bienes premisser fikk meg til å begynne med Warré-kuber og førte meg til den internasjonale gruppen warrebeekeeping. Jeg hadde selv mye å lære, men ønsket også å bidra til fellesskapet. I birøktfaglige spørsmål hadde jeg lite å komme med, mens programvareutvikling var noe jeg kunne. Slik oppsto ideen om å gjøre medlemmenes mangeårige erfaringer tilgjengelige igjen gjennom et arkiv.
Erfaringene i et fellesskap
Gruppen warrebeekeeping har diskutert Warré-kuber siden 2007. Samtalene handler om det praktiske arbeidet med biene, observasjoner, vanskeligheter og ulike fremgangsmåter. Gjennom årene har det samlet seg mer enn 33 000 meldinger, i tillegg til fotoalbum og vedlegg.
Et spørsmål fikk ofte flere svar med utgangspunkt i ulike erfaringer. Arkivet bevarer derfor hele diskusjoner, også oppfølgingsspørsmål og uenigheter.
Da Yahoo avviklet gruppetjenesten sin, sto dette materialet i fare for å gå tapt. Tilgangen til det gamle innholdet forsvant allerede mot slutten av 2019, og selve tjenesten ble stengt helt i 2020. Uten en egen sikkerhetskopi ville mange års diskusjoner ikke lenger ha vært tilgjengelige for gruppen. Materialet vi tok vare på, danner grunnlaget for dagens arkiv.
Siden oktober 2020 har gruppen fortsatt i Google Groups. Arkivet samler de bevarte Yahoo-innleggene og de nyere diskusjonene, slik at den felles historien fortsatt kan leses på tvers av plattformbyttet.
Fra det første arkivet til en ny løsning
Rundt 2020 hadde jeg allerede laget et første nettsted for arkivet. Den gangen programmerte jeg det selv, i møysommelig detaljarbeid. Agentbasert programvareutvikling har siden gitt meg langt større muligheter. Jeg kunne ta fatt på arkivet igjen og lage funksjoner som går langt utover den opprinnelige visningen av innleggene.
Jeg benyttet anledningen til å bygge applikasjonen på nytt og beholde de eksisterende dataene. Arbeidet omfatter nå alt fra bearbeiding av enkeltmeldinger til flerspråklig søk og tematiske oppsummeringer med sporbare kilder.
Lesbare meldinger
En stor del av en e-postliste består av gjentatt tekst. Svar inneholder tidligere meldinger, ofte med flere sitater og signaturer inni hverandre. Hvis søket behandlet alt dette likt, ville det finne det samme utsagnet om igjen i andre personers svar.
Bearbeidingen skiller derfor forfatterens eget bidrag fra sitert tekst og signaturer. Den egne teksten utgjør bare rundt 41 prosent av råmaterialet. Et svar som er skrevet under et sitat, må ikke forsvinne underveis. De opprinnelige meldingene blir derfor bevart, slik at den bearbeidede visningen kan kontrolleres mot dem.
Det lå også arbeid i å knytte navn og bilder til riktig sammenheng. Enkelte medlemmer skrev under ulike navn, mens fotoalbumene ofte manglet en pålitelig kobling til diskusjonene. Slike hull lot jeg stå åpne fremfor å gjette meg til en sammenheng.
Kunnskap på tvers av språk
Arkivet kombinerer vanlig fulltekstsøk med semantisk søk. Det ene finner bestemte ord, det andre finner innlegg med beslektet innhold. Et spørsmål på tysk kan dermed føre til en relevant engelsk diskusjon der forfatteren brukte helt andre ord. Resultatene samles i én treffliste.
Grensesnittet finnes på engelsk, tysk og fransk. Oversettelser gjør lesingen enklere, samtidig som den engelske originalteksten fortsatt er tilgjengelig. En egen ordliste for birøkt bidrar til at faguttrykk, blant annet navn på kubedeler, brukes konsekvent i ulike innlegg.
Tematiske oppsummeringer under arbeid
Som neste steg forbereder jeg tematiske oppsummeringer som ennå ikke er publisert. De samler erfaringer fra flere diskusjoner og tar også med uenigheter. Innleggene de bygger på, kan fortsatt spores som kilder. En erfaringsbeskrivelse skal være gjenkjennelig som nettopp det; den blir ikke allmenngyldig dokumentasjon bare fordi den oppsummeres.
Før jeg publiserer oppsummeringene, vil jeg gå gjennom alle selv og snakke med medlemmene om hvorvidt, og i hvilken form, de kan gjøres offentlig tilgjengelige. Anonymisering alene avklarer ikke hva fellesskapet ønsker å dele utenfor gruppen. De opprinnelige innleggene, bildene og vedleggene forblir forbeholdt medlemmene.
Den tekniske løsningen
Jeg bygget arkivet med PHP, en relasjonsdatabase og litt JavaScript. Sidene genereres på serveren, uten et frontend-rammeverk eller et eget byggesteg. Søkevektorene ligger også i den eksisterende databasen. En rask, innledende sammenligning avgrenser kandidatene før en mer nøyaktig vurdering.
KI brukes til søk, oversettelse og bearbeiding av innhold, mens originaldataene holdes atskilt. Forslag til opprydding kontrolleres før de tas i bruk, og endringer må kunne spores tilbake til kildeteksten. Også etter bearbeidingen skal det være mulig å lese hva som sto i den opprinnelige meldingen.
Innblikk.
-
Forhåndsvisning av de foreslåtte offentlige oppsummeringene -
Utkast til en oppsummering om valg av Warré-kube