[ Blogg ]

Kort af vélrænu námi: verkefnaflokkarnir sem fyrirtæki þurfa að þekkja

  • 3. september 2026
  • 5 mín lestur

Þegar stjórnendur hugsa um gervigreind hugsa flestir um spjallforrit: ChatGPT, Claude og félaga. En spjallforrit eru eitt horn á miklu stærra korti. Vélrænt nám skiptist í tugi verkefnaflokka og hver þeirra leysir sína tegund af vandamáli. Fyrirtæki sem þekkir kortið spyr ekki "hvað getur ChatGPT gert fyrir okkur" heldur "hvaða flokkur leysir þetta verkefni". Sú spurning opnar mun fleiri dyr.

Kortið er skipulagt eftir inntaki og úttaki

Einfaldasta leiðin til að skilja kortið er að spyrja tveggja spurninga um hvert verkefni: hvað fer inn og hvað á að koma út? Texti inn og texti út er eitt verkefni. Mynd inn og listi af hlutum út er annað. Talað mál inn og ritaður texti út er það þriðja. Hver samsetning af inntaki og úttaki er sérstakur verkefnaflokkur með sín líkön, sín gagnasöfn og sínar bestu lausnir.

Ensku heitin á flokkunum eru vísvitandi höfð á ensku hér. Þau eru leitarorðin á Hugging Face, stærsta opna líkanasafni heims, þar sem hver flokkur listar bæði líkön og gagnasöfn. Sá sem kann heitin getur sjálfur flett upp hvað er til, hvað er opið og hvað er nothæft.

Natural Language Processing: allt sem snýst um texta

Textaflokkarnir eru þeir sem flestir þekkja best, en þeir eru fleiri en spjall:

  • Text Generation: líkanið skrifar texta út frá fyrirmælum. Þetta er flokkurinn sem spjallforritin byggja á.
  • Summarization: langt skjal inn, stutt samantekt út. Fundargerðir, skýrslur, greinar.
  • Translation: texti á einu tungumáli inn, sama efni á öðru út.
  • Text Classification og Token Classification: texti fær merkimiða. Heil setning flokkast sem kvörtun eða hrós, eða einstök orð merkjast sem nöfn, staðir og upphæðir.
  • Question Answering: spurning og skjal inn, svar út. Til eru útgáfur sem svara spurningum beint upp úr töflum.
  • Zero-Shot Classification: flokkun í flokka sem líkanið hefur aldrei séð áður, án sérþjálfunar.
  • Sentence Similarity: hve líkar eru tvær setningar að merkingu? Grunnurinn að merkingarleit.
  • Text Ranking: raðar skjölum eftir því hve vel þau svara fyrirspurn.
  • Feature Extraction: breytir texta í talnavigra sem önnur kerfi geta unnið með.
  • Fill-Mask: líkanið fyllir í eyður í texta, grunnverkefnið á bak við mörg málskilningslíkön.

Computer Vision: allt sem snýst um myndir

Myndvinnsluflokkarnir eru fjölbreyttari en margir átta sig á:

  • Image Classification: hvað er á myndinni? Einn merkimiði á mynd.
  • Object Detection: hvaða hlutir eru á myndinni og hvar? Rammi utan um hvern hlut.
  • Image Segmentation: hvaða pixlar tilheyra hvaða hlut? Nákvæmari útgáfa af sömu spurningu.
  • Text-to-Image og Image-to-Image: mynd verður til úr texta, eða mynd er umbreytt í aðra mynd.
  • Text-to-Video og Image-to-Video: sama hugmynd, en úttakið er myndband.
  • Depth Estimation: hve langt er hver hluti myndar frá myndavélinni?
  • Keypoint Detection: finnur lykilpunkta, til dæmis liðamót á fólki eða horn á hlutum.
  • Mask Generation: býr til nákvæmar útlínur hluta, oft með einum smelli.
  • Zero-Shot útgáfur: flokkun og hlutgreining án sérþjálfunar á viðkomandi hlutum.
  • Text-to-3D og Image-to-3D: þrívíddarlíkan verður til úr texta eða mynd.

Multimodal: þegar inntakið er blandað

Áhugaverðustu flokkarnir fyrir skrifstofuvinnu eru oft þeir sem taka við fleiri en einni tegund gagna í einu:

  • Image-Text-to-Text: mynd og spurning inn, textasvar út.
  • Visual Question Answering: sérhæfð útgáfa, spurt er beint um innihald myndar.
  • Document Question Answering: spurt er upp úr skjölum með uppsetningu, töflum og myndum, til dæmis reikningum eða handbókum.
  • Audio-Text-to-Text og Video-Text-to-Text: hljóð eða myndband ásamt texta inn, texti út.
  • Visual Document Retrieval: leit í skjalasafni þar sem útlit skjalanna skiptir máli, ekki bara textinn.
  • Any-to-Any: líkön sem taka við og skila hvaða samsetningu sem er.

Audio: allt sem snýst um hljóð

  • Automatic Speech Recognition: talað mál inn, ritaður texti út.
  • Text-to-Speech: texti inn, talað mál út.
  • Text-to-Audio: texti inn, hljóð eða tónlist út.
  • Audio Classification: hvaða hljóð er þetta? Vélarhljóð, viðvörun, tónlist.
  • Voice Activity Detection: hvenær í upptöku er einhver að tala?

Tabular og tímaraðir: allt sem snýst um töflugögn

Þessir flokkar fá minnsta athygli í fjölmiðlum en skila oft mestu í rekstri:

  • Tabular Classification: spáir flokki út frá töflugögnum, til dæmis hvort viðskiptavinur sé líklegur til að hætta.
  • Tabular Regression: spáir tölu út frá töflugögnum, til dæmis verði eða áhættu.
  • Time Series Forecasting: spáir framtíðargildum út frá sögulegri þróun, til dæmis sölu næstu vikna.

Til viðbótar eru þrír flokkar sem flest fyrirtæki þurfa aðeins að vita að séu til: Reinforcement Learning, þar sem líkan lærir af tilraunum og umbun, Robotics, þar sem líkön stýra vélbúnaði, og Graph Machine Learning, þar sem gögnin eru net af tengslum, til dæmis viðskiptatengsl eða aðfangakeðjur.

Hvað þýðir kortið fyrir íslensk fyrirtæki?

Kortið verður fyrst gagnlegt þegar flokkarnir eru tengdir við raunveruleg verkefni. Nokkur dæmi sem eiga við hjá íslenskum fyrirtækjum:

  • Object Detection á hillumyndir. Sölufulltrúi tekur mynd af hillu í verslun og líkanið telur hvaða vörur eru sýnilegar. Hilluhlutdeild, sem áður var metin með talningu á staðnum, verður mælanleg úr myndasafni.
  • Document Question Answering á innri handbækur. Starfsfólk spyr á mannamáli og fær svar beint upp úr gæðahandbók, öryggisreglum eða kjarasamningi, með tilvísun í rétta síðu.
  • Automatic Speech Recognition á fundi og hlaðvörp. Upptökur verða að leitarbærum texta. Fundur frá því í fyrra, þar sem ákvörðunin var tekin, finnst á sekúndum.
  • Time Series Forecasting á árstíðabundna eftirspurn. Ferðaþjónusta, smásala og veitingarekstur á Íslandi sveiflast eftir árstíðum. Spálíkan á sölusögu bætir innkaup, mönnun og birgðahald.
  • Sentence Similarity á eigið efni. Leit á vef eða innra neti sem finnur rétta svarið þótt orðalagið sé annað en í skjalinu. "Get ég fengið endurgreitt" finnur skjalið sem heitir "Skilareglur".

Takið eftir að ekkert þessara verkefna er spjall. Öll eru þau samt vélrænt nám og fyrir öll eru til opin líkön á Hugging Face. Rétta spurningin er aldrei "hvað getur ChatGPT gert" heldur "hvaða flokkur leysir þetta verkefni".

Það sem þú getur gert strax

  • Skrifaðu niður þrjú verkefni og greindu inntak og úttak. Veldu þrjú tímafrek verkefni í þínum rekstri og skráðu fyrir hvert þeirra: hvað fer inn og hvað á að koma út? Berðu svörin saman við flokkana hér að ofan.
  • Skoðaðu Hugging Face í 20 mínútur. Farðu á huggingface.co, veldu einn flokk sem passar við þitt verkefni og skoðaðu hvaða líkön og gagnasöfn eru þar. Þú þarft ekki að skilja tæknina til að sjá hvað er til.
  • Spurðu hvar gögnin þín liggja ónotuð. Myndir, upptökur, sölusaga, skjalasafn. Hver gagnategund á sína flokka á kortinu. Gögn sem enginn les í dag geta orðið mælitæki á morgun.

[ Hafa samband ]

Bókaðu frítt stöðumat

90 mínútur sem borga sig strax: við kortleggjum gervigreindarnotkun, áhættur og 3 til 5 sjálfvirknivæðanleg verkflæði og skilum skýrslu innan viku. Engin skuldbinding.

Engin skuldbinding

[ Beint samband ]

hallo@vestra.is+354 863 7496

Bolholt 8
105 Reykjavík