Hér getur þú sent okkur nýjar spurningar um vísindaleg efni.
Hafðu spurninguna stutta og hnitmiðaða og sendu aðeins eina í einu. Einlægar og vandaðar spurningar
um mikilvæg efni eru líklegastar til að kalla fram vönduð og greið svör. Ekki er víst að tími vinnist til að
svara öllum spurningum.
Persónulegar upplýsingar um spyrjendur eru eingöngu notaðar í starfsemi vefsins, til dæmis til að
svör verði við hæfi spyrjenda. Spurningum er ekki sinnt ef spyrjandi villir á sér heimildir eða segir ekki
nægileg deili á sér.
Spurningum sem eru ekki á verksviði vefsins er eytt.
Að öðru leyti er hægt að spyrja Vísindavefinn um allt milli himins og jarðar!
Upprunalega spurningin var í nokkrum liðum. Fyrri hlutanum er svarað hér en seinni hlutanum í þessu svari:
Hvaðan kemur gervigreind? hvenær var fyrst reynt við hugmyndina, hvar, hvers vegna? Hverjir voru fyrstir til þess að gera hana opna almenningi, var það Chat eða voru aðrir að þjálfa hana til annarra nota en almennings "hjálpar"?
Til hvers voru líkönin þróuð
Árið 2018 birti OpenAI rannsóknina sem kynnti fyrsta GPT-líkanið. Heitið vísar til þess að líkanið býr til texta (e. generative), er forþjálfað (e. pre-trained) og byggist á umbreyti (e. transformer). Upprunalegi umbreytirinn kom fram árið 2017 og byggðist eingöngu á athygliskerfum og sleppti eldri gerðum netlaga sem unnu textann orð fyrir orð í röð. Umbreytirinn sem OpenAI kynnti var frábrugðin hinum upprunalega á tvo vegu. Í fyrsta lagi notaði hann aðeins annan helming upphaflega netsins, svokallaðan afkóðara (e. decoder), sem spáir fyrir um næsta tóka út frá því sem á undan er komið. Í öðru lagi var hann ekki þjálfaður beint fyrir eitt verkefni, eins og upprunalegi umbreytirinn hafði verið þjálfaður fyrir þýðingar, heldur fyrst forþjálfað á stóru safni ómerkts texta, rúmlega sjö þúsund bókum, og síðan þjálfað sérstaklega fyrir hvert verkefni, til dæmis að svara spurningum eða flokka skjöl. Markmiðið var að sama grunnlíkanið gæti nýst víða og að það væri betri byrjunarpunktur fyrir sérþjálfun heldur en að byrja hvert sérþjálfunarverkefni með óþjálfað net.[1]
Slík líkön eru nú kölluð grunnlíkön (e. foundation models). Hugtakið kom fram í skýrslu fræðafólks við Stanford-háskóla árið 2021 og er þar skilgreint sem líkan sem er þjálfað á miklu og fjölbreyttu gagnamagni og má síðan aðlaga að fjölda ólíkra verkefna. Hugmyndin sjálf var þá þegar vel þekkt í tölvusjón (e. computer vision), þar sem net sem höfðu verið þjálfuð til að flokka myndir í ImageNet-safninu höfðu um árabil verið endurnýtt í önnur myndgreiningarverkefni. Munurinn var að myndirnar í ImageNet höfðu verið merktar af fólki, en forþjálfun mállíkana þarf enga slíka merkingu, því viðmiðið er textinn sjálfur. Það gerði rannsakendum kleift að nota margfalt stærra gagnasafn því einungis þurfti að safna gögnunum saman en ekki að merkja þau. Í lok árs 2018 varð þessi nálgun ráðandi í málvinnslu með forþjálfuðum umbreytilíkönum á borð við GPT og BERT.[2]
Google þróaði einnig BERT, sem var kynnt í forprentun árið 2018 og í ráðstefnugrein 2019. Það lærði meðal annars að fylla í eyður í texta með upplýsingum frá báðum hliðum eyðunnar og var ætlað til málvinnsluverkefna, svo sem að finna svar í texta eða meta merkingartengsl setninga. Það var ekki hannað sem spjallmenni. Höfundarnir gerðu bæði forritskóða og þjálfuð líkön aðgengileg öðrum.[3] Sams konar líkön hafa síðan verið þjálfuð fyrir mörg tungumál. Fyrir íslensku var IceBERT kynnt árið 2022. Það var þjálfað á íslenskum textum, meðal annars nýju safni texta af vefnum, og náði þá bestum árangri sem þekktist í ýmsum íslenskum málvinnsluverkefnum.[4]
Með GPT-2 árið 2019 og GPT-3 árið 2020 varð ljóst að líkan sem hafði lært af nógu miklum texta gat sinnt ýmsum verkefnum, til dæmis spurningasvörun og þýðingum, án þess að vera þjálfað sérstaklega fyrir hvert þeirra. Nóg var að lýsa verkefninu í textanum sem líkanið fékk, stundum með fáeinum dæmum. Höfundar GPT-3 kölluðu þetta nám innan samhengis (e. in-context learning). Þessi geta var ekki forrituð inn í líkönin, heldur kom hún fram af sjálfu sér við forþjálfunina og styrktist eftir því sem líkönin stækkuðu.[5][6]
Hvers vegna ætti æfing í að giska á næsta orð að skila slíkri getu? Höfundar GPT-2 bentu á að í venjulegum texta af netinu leynast ótal dæmi um verkefni sem eru leyst í framhjáhlaupi. Þeir tóku dæmi úr þjálfunargögnum sínum, meðal annars setninguna „I’m not the cleverest man in the world, but like they say in French: Je ne suis pas un imbecile“. Líkan sem á að spá fyrir um framhaldið á eftir orðunum „like they say in French“ stendur sig betur ef það kann að þýða. Á sama hátt fylgja svör oft spurningum í texta og samantektir fylgja greinum. Með því að læra að spá fyrir um framhald á nógu fjölbreyttum texta æfir líkanið því óbeint fjölda verkefna sem enginn lagði sérstaklega fyrir það.[7] Hversu langt sú geta nær í raun þarf að mæla með prófunum. Um það er fjallað nánar í svari við spurningunni Hvernig geta stór mállíkön leyst verkefni sem þeim hefur ekki verið kennt sérstaklega að leysa?
Rannsóknarlíkönin GPT-2 og GPT-3 voru þó ekki tilbúin spjallþjónusta fyrir almenning. Þau voru í eðli sínu textaframhaldslíkön: þau héldu áfram með hvaða texta sem þeim var réttur, hvort sem framhaldið var gagnlegt, satt eða viðeigandi. Höfundar GPT-3 bentu sjálfir á að líkanið héldi í bjaga úr þjálfunargögnunum og að hægt væri að misnota það.[8] Í rannsókn OpenAI á InstructGPT árið 2022 kom fram að stærri líkön fylgi ekki sjálfkrafa ætlun notandans betur og geti gefið svör sem eru ósönn, meiðandi eða einfaldlega gagnslaus. Til að gera forþjálfað líkan að nothæfum aðstoðarmanni þurfti því viðbótarþjálfun: líkanið var þjálfað áfram á dæmum um fyrirmæli og æskileg svör og á mati fólks á svörum, þannig að það lærði að fylgja fyrirmælum og forðast meiðandi svör.[9]Tilvísanir:
^ Bommasani, R. o.fl. (2021). On the Opportunities and Risks of Foundation Models. Skýrsla, Center for Research on Foundation Models, Stanford University. arXiv:2108.07258. https://arxiv.org/abs/2108.07258
^ Devlin, J., Chang, M.-W., Lee, K. og Toutanova, K. (2019; forprentun 2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT 2019, 4171–4186. https://doi.org/10.18653/v1/N19-1423
^ Snæbjarnarson, V., Símonarson, H. B., Ragnarsson, P. O., Ingólfsdóttir, S. L., Jónsson, H., Thorsteinsson, V. og Einarsson, H. (2022). A Warm Start and a Clean Crawled Corpus – A Recipe for Good Language Models. Proceedings of the Thirteenth Language Resources and Evaluation Conference (LREC 2022), 4356–4366. https://aclanthology.org/2022.lrec-1.464/
^ Brown, T. B. o.fl. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 33, 1877–1901. https://arxiv.org/abs/2005.14165
^ Ouyang, L. o.fl. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems, 35, 27730–27744. https://arxiv.org/abs/2203.02155
Hafsteinn Einarsson. „Hvenær var fyrsta GPT-mállíkanið kynnt til sögunnar?“ Vísindavefurinn, 5. október 2026, sótt 5. október 2026, https://visindavefur.is/svar.php?id=89764.
Hafsteinn Einarsson. (2026, 5. október). Hvenær var fyrsta GPT-mállíkanið kynnt til sögunnar? Vísindavefurinn. https://visindavefur.is/svar.php?id=89764
Hafsteinn Einarsson. „Hvenær var fyrsta GPT-mállíkanið kynnt til sögunnar?“ Vísindavefurinn. 5. okt. 2026. Vefsíða. 5. okt. 2026. <https://visindavefur.is/svar.php?id=89764>.