Hvaðan kemur gervigreind? hvenær var fyrst reynt við hugmyndina, hvar, hvers vegna? Hverjir voru fyrstir til þess að gera hana opna almenningi, var það Chat eða voru aðrir að þjálfa hana til annarra nota en almennings "hjálpar"?Stór mállíkön (e. large language models, LLMs), eins og þau sem liggja að baki nútímaspjallmennum, eru líkön sem læra mynstur í tungumáli út frá stóru safni texta. Saga þeirra er hluti af sögu gervigreindar, en spjallforrit og önnur gervigreindarkerfi fyrir árið 2017 voru ekki mállíkön af sömu gerð og líkön á borð við ChatGPT. Stór mállíkön eiga sér langa forsögu og voru bæði rannsökuð og gerð aðgengileg utan rannsóknardeilda tæknifyrirtækja áður en ChatGPT kom fram árið 2022. Þau voru meðal annars þróuð til að vinna með texta, svara spurningum og bæta vélþýðingar, og margar af lykilhugmyndunum að baki þeim urðu einmitt til í rannsóknum á sviði vélþýðinga. ChatGPT gerði fólki auðvelt að eiga samtal við slíkt líkan, en var hvorki fyrsta mállíkanið né fyrsta leið almennings til að prófa þau. Frá líkum á stöfum til stórra tauganeta Ein forsenda mállíkana er að tungumál hafi mynstur sem hægt sé að lýsa með líkum. Bandaríski stærðfræðingurinn Claude Shannon setti þá hugmynd fram árið 1948 í greininni „A Mathematical Theory of Communication“. Þar lýsti hann texta sem slembiferli þar sem líkur á næsta staf ráðast af stöfunum á undan, og sýndi hvernig búa má til sífellt raunverulegri eftirlíkingar af ensku með því að taka tillit til lengra samhengis: fyrst eins stafs á undan, svo tveggja og loks heilla orða.[1] Árið 1951 birti hann svo rannsókn þar sem fólk var látið giska á næsta staf í texta til að mæla hve fyrirsjáanleg enska væri.[2] Sú rannsókn var mæling á tungumálinu, ekki líkan, og einföldu tölfræðilíkönin frá 1948 eiga fátt sameiginlegt með tauganetum nútímans. Þau sýna þó að hugmyndin um að spá fyrir um framhald texta er miklu eldri en tæknin á bak við nútímaspjallmenni.

Ein forsenda mállíkana er að tungumál hafi mynstur sem hægt sé að lýsa með líkum. Bandaríski stærðfræðingurinn Claude Shannon setti þá hugmynd fram árið 1948 í greininni „A Mathematical Theory of Communication“.
- ^ Shannon, C. E. (1948). A Mathematical Theory of Communication. The Bell System Technical Journal, 27(3), 379–423. https://ieeexplore.ieee.org/document/6773024
- ^ Shannon, C. E. (1951). Prediction and Entropy of Printed English. The Bell System Technical Journal, 30(1), 50–64. https://ieeexplore.ieee.org/document/6773263
- ^ Bengio, Y., Ducharme, R., Vincent, P. og Jauvin, C. (2003). A Neural Probabilistic Language Model. Journal of Machine Learning Research, 3, 1137–1155. https://www.jmlr.org/papers/volume3/bengio03a/bengio03a.pdf
- ^ Bengio o.fl. (2003).
- ^ Brown, T. B. o.fl. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 33, 1877–1901. https://arxiv.org/abs/2005.14165
- ^ Bahdanau, D., Cho, K. og Bengio, Y. (2015). Neural Machine Translation by Jointly Learning to Align and Translate. International Conference on Learning Representations (ICLR 2015). Forprentun birt á arXiv 1. september 2014 (arXiv:1409.0473). https://arxiv.org/abs/1409.0473
- ^ Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł. og Polosukhin, I. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30. https://arxiv.org/abs/1706.03762
- Yfirlitsmynd: Neural network (machine learning) - Wikipedia. (Sótt 22.09.2026). Myndin er birt undir CC-leyfi.
- Professor Emeritus Claude Shannon, founder of digital communications, dies at 84 - MIT News - Massachusetts Institute of Technology. (Sótt 22.09.2026).