To stemmer snakker i munnen på hverandre. Overlappen markeres med en skråstrek i transkripsjonen, en pause på under et sekund med et komma i parentes, et avbrutt ord fullføres av den andre taleren. Ingenting av dette hører hjemme i en vanlig skriftlig tekst, men i et muntlig korpus er det nettopp dette som blir data.

Et korpus er, enkelt sagt, en samling ekte språkbruk satt sammen for å bli søkt i og telt på – ikke et håndplukket utvalg eksempler en forsker synes illustrerer et poeng, men råmateriale nok til at mønstre kan telles og sammenlignes. Det som skiller et korpus fra et vanlig arkiv, er nettopp søkbarheten: teksten eller lyden er organisert slik at et enkelt spørsmål kan stilles til hele materialet på én gang.

Skriftlig og muntlig er to forskjellige datatyper

Et skriftlig korpus består av tekster som allerede finnes i en fast form: aviser, bøker, offentlige dokumenter. Et muntlig korpus må derimot skapes gjennom opptak og deretter gjøres tilgjengelig gjennom transkripsjon, et arbeid som tar langt lengre tid enn å samle inn tekst som allerede er skrevet ned. En times samtale kan kreve mange timers arbeid før den er skrevet ut, tidfestet og klar til å bli søkt i. Selve lydfilen er sjelden det forskeren søker i direkte; det er den tidkodede teksten som gjør materialet håndterlig.

Lyd er ikke skrift som venter på å bli skrevet ned.

COLA, corpus oral de lenguaje adolescente, er et muntlig korpus av spansk ungdomsspråk, bygget opp ved Universitetet i Bergen som en videreføring av COLT, Bergen Corpus of London Teenage Language. Opptakene i COLA er gjort i Madrid, Buenos Aires og Santiago de Chile, med talere mellom 13 og 19 år, og hver by utgjør sin egen deldatabase innenfor det samlede materialet.

Et slikt materiale brukes ikke til én ting. Fra det samme opptaksgrunnlaget er det bygget forskningslinjer om pragmatiske markører, om tiltaleformer og vokativer, om gruppeleksikon, om forsterkere, og om banning – hver linje stiller sitt eget spørsmål til de samme transkripsjonene, uten å måtte samle inn nytt materiale for hver nye undersøkelse.

Konvensjonene bak transkripsjonen

Ungdommene i COLA gjorde opptakene selv, med minidiskspillere, uten voksne til stede. Metoden er hentet fra British National Corpus, beskrevet av Crowdy i 1991, og materialet ble transkribert i programmet Transcriber, som lar forskeren markere replikkskifte, pauser og overlappende tale. Løsningen er den samme grunntanken som gjorde COLT, forgjengeren i London, mulig: talerne selv, ikke en forsker med mikrofon i hånden, avgjør hva som blir sagt.

En transkripsjon uten disse markørene ville sett ut som en ryddig dialog. Den ryddigheten er falsk. Ekte samtale er full av avbrytelser, halvferdige setninger og lyder som verken er ord eller stillhet, og nettopp disse trekkene er noe forskningslinjer om for eksempel pragmatiske markører er avhengige av å få med seg. Du kan se selve formatet i transkripsjonene fra prosjektet, der replikkskifte, pauser og overlapp er markert linje for linje, i stedet for å bli glattet ut til vanlig, sammenhengende prosa.

Fra opptak til søk i et muntlig korpusFire trinn: opptak, transkripsjon, koding og søk. Under: en skjematisk konkordans der søkeordet står midt i hver linje med konteksten på begge sider.1Opptakungdommene tok opp egne samtaler på minidisk2Transkripsjonreplikkskifte, pauser og overlapp markeres i Transcriber3Kodingmaterialet merkes slik at det kan søkes i4Søkkonkordans: alle forekomster av et ord i sin sammenhengKONKORDANS, SKJEMATISKsøkeordsøkeordsøkeordsøkeord
Arbeidsgangen i et muntlig korpus, og hvordan en konkordans stiller søkeordet opp linje for linje.

Konkordansen: å telle i stedet for å gjette

En forsker som lurer på hvor ofte unge bruker et bestemt uttrykk, kan ikke stole på magefølelsen alene. Inntrykket av at «alle sier det sånn nå» er ofte upresist, formet av hvem man selv tilfeldigvis snakker med. Et korpus gjør det mulig å søke opp alle forekomster av et ord eller uttrykk og se dem i sin opprinnelige sammenheng, en liste som kalles en konkordans.

Konkordansen viser mer enn at ordet finnes. Den viser hvem som sier det, i hvilken sammenheng, og hvor ofte, sammenlignet med alternative former talerne kunne ha valgt i stedet. Listen kan sorteres etter ordet som kommer rett før eller rett etter søkeordet, slik at et mønster i konteksten trer fram uavhengig av hvilken samtale hver enkelt forekomst kommer fra. Forskjellen mellom en intuisjon og en frekvens er forskjellen mellom å tro og å telle.

NoTa: talespråk fra Oslo

Det finnes tilsvarende prosjekter for norsk. Norsk talespråkskorpus – Oslo-delen, kjent som NoTa, er samlet inn ved Universitetet i Oslo og dokumenterer muntlig språkbruk i hovedstaden. Det er ikke en del av COLA-materialet, men det hører til samme familie av korpus: opptak av virkelig, spontan tale, gjort søkbare for forskning i stedet for å bli stående som løse anekdoter. Et slikt korpus lever av det samme, litt kjedelige arbeidet som COLA: opptak, transkripsjon, koding, og først deretter søk.

Ved siden av dette finnes det en kontrastiv forskningslinje i COLA-materialet, beskrevet nærmere i publikasjonslisten, som sammenligner spansk ungdomsspråk med engelsk og norsk, blant annet gjennom engelske låneord i norsk og chilensk ungdomstale. Om de samme mønstrene også gjelder utenfor akkurat de ungdomsgruppene som er spilt inn, er et spørsmål materialet alene ikke kan svare på, og det er nettopp den typen åpne spørsmål et korpus er godt egnet til å reise, selv når det ikke kan avgjøre svaret alene.

Spørsmål om språkkorpus

Hva er forskjellen på et korpus og en ordbok?

En ordbok beskriver hva et ord betyr og hvordan det bøyes, som en samlet konklusjon. Et korpus viser i stedet hvert enkelt tilfelle av at ordet er brukt, i sin egen sammenheng, slik at et mønster kan telles fram i stedet for å bli slått fast på forhånd.

Hva er en konkordans?

En konkordans er en liste over alle forekomstene av et søkeord i et korpus, vanligvis med litt tekst før og etter hver forekomst. Den gjør det mulig å se hvordan et ord faktisk brukes i mange ulike samtaler eller tekster samtidig.

Hvorfor markeres pauser og overlapp i en transkripsjon?

Fordi de er en del av hvordan samtale faktisk fungerer. Uten disse markørene ville transkripsjonen se ryddigere ut enn samtalen egentlig var, og forskning på for eksempel replikkskifte eller nøling ville miste grunnlaget sitt.

Er skriftlige korpus mindre nyttige enn muntlige?

Ikke mindre nyttige, men nyttige til andre spørsmål. Et skriftlig korpus viser den redigerte normen i en tekst, mens et muntlig korpus viser hva talere faktisk gjør i spontan, uforberedt tale. Begge deler er nødvendige, avhengig av hva undersøkelsen gjelder.

Hvordan ble COLA-opptakene gjort mulig uten forskere til stede?

Ungdommene fikk utstyre seg med minidiskspillere og tok opp egne, vanlige samtaler seg imellom. Metoden er hentet fra British National Corpus, som beskrevet av Crowdy i 1991, og skal fange talespråk som ikke er påvirket av at en forsker lytter med i rommet.