1. Mitä malli oikeasti tekee, kun se tuottaa tekstiä?
z, joista muodostetaan
jakauma yleensä softmaxilla.
Varsinainen näytepolitiikka voi olla esimerkiksi greedy, beam, top-k, top-p tai niiden muunnos.
Siksi “malli arpoo yhden” on arkkitehtuurin tasolla liian epätarkka kuvaus.
- Holtzman et al. (ICLR 2020), The Curious Case of Neural Text Degeneration peer-reviewed
- Finlayson et al. (ICLR 2024), Closing the Curious Case of Neural Text Degeneration peer-reviewed
- Sennrich et al. (ACL 2016), Neural Machine Translation of Rare Words with Subword Units peer-reviewed
- Jia et al. (2025), A Comprehensive Survey of Discrete Tokenizers survey / preprint
2. Neuroverkot ja biologinen mallintaminen
3. Päättelevätkö kielimallit?
- Wei et al. (NeurIPS 2022), Chain-of-Thought Prompting Elicits Reasoning in Large Language Models peer-reviewed
- Snell et al. (ICLR 2025), Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Parameters peer-reviewed
- Guo et al. / DeepSeek-AI (Nature 2025), DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning peer-reviewed / Nature
- Shojaee et al. (2025), The Illusion of Thinking research report
- Lawsen et al. (2025), Comment on The Illusion of Thinking preprint
4. Miksi lineaarinen regressio on huono analogia LLM:lle?
y = mx + c.
5. Onko LLM “musta laatikko” vai ei?
- Zhao et al. (ACM Computing Surveys 2024), Explainability for Large Language Models: A Survey peer-reviewed survey
- Elhage et al. (2022), Toy Models of Superposition preprint / foundational
- Bricken et al. (2023), Towards Monosemanticity lab research
- Palikhe et al. (2025), Towards Transparent AI: A Survey on Explainable Large Language Models survey / preprint
Miksi mallin sisäistä toimintaa on lähes mahdoton tulkita?
Ihmiset mieltävät aivot tai tietokoneohjelmat usein lokeroina: "Täällä sijaitsee tieto Ranskan pääkaupungista" tai "Tämä koodirivi tunnistaa kissan". Nykyaikaisissa neuroverkoissa näin ei kuitenkaan ole. Sisältö on hajautettua, monimerkityksistä ja matemaattisesti sotkeutunutta.
1. Polysemanttisuus (Monimerkityksisyys)
Yksi yksittäinen "neuroni" (dimensio vektorissa) ei vastaa yhtä käsitettä. Sama neuroni saattaa aktivoitua, kun malli käsittelee koodia, puhuu kissoista tai kääntää ranskaa. Vastaavasti yksi käsite (esim. "kissa") on ripoteltu tuhansien eri neuronien aktivaatiokuvioiksi (superpositio).
2. Epälineaarisuus ja Mittakaava
Malli kertoo valtavia matriiseja keskenään ja ajaa tulokset epälineaaristen funktioiden (kuten GELU) läpi satoja kertoja. Koska funktiot leikkaavat osan tiedosta pois ja vääristävät loput, on matemaattisesti äärimmäisen vaikeaa laskea prosessia taaksepäin selvittääkseen, mikä alkuperäinen syy johti tiettyyn tulosteeseen.
1. Käsitteiden hajautuminen vs. Ihmisen oletus
2. Matemaattinen kaaos (Miksi laatikkoa ei voi "peruuttaa")
Ihmisen lukema teksti muutetaan valtaviksi lukutaulukoiksi (vektoreiksi), joissa on usein yli 4000 ulottuvuutta per sana. Tämä data kerrotaan satojen peräkkäisten painoarvomatriisien kanssa miljardeja kertoja.
6. Rajoittaako malleja data vai laskenta?
- Kaplan et al. (2020), Scaling Laws for Neural Language Models foundational
- Hoffmann et al. (2022), Training Compute-Optimal Large Language Models peer-reviewed / NeurIPS
- Shumailov et al. (Nature 2024), AI Models Collapse When Trained on Recursively Generated Data peer-reviewed
- Schaeffer et al. (2025), Position: Model Collapse Does Not Mean What You Think position / openreview
- Snell et al. (ICLR 2025), Scaling LLM Test-Time Compute Optimally peer-reviewed
7. Tietoisuus ja reaaliaikainen oppiminen
- Butlin et al. (Trends in Cognitive Sciences 2025), Identifying Indicators of Consciousness in AI Systems peer-reviewed
- Butlin et al. (2023), Consciousness in Artificial Intelligence preprint / influential
- Bengio (Science 2025), Illusions of AI Consciousness peer-reviewed commentary
- Goodfellow, Bengio & Courville (2016), Deep Learning textbook
- Akyürek (MIT thesis 2025), Inference-Time Learning Algorithms of Language Models thesis
- Dherin et al. (2025), Learning Without Training: The Implicit Dynamics of In-Context Learning preprint
- Zhang et al. (ACL 2025), Many-Shot In-Context Learning peer-reviewed