තවත් භාෂාවලින්: English · தமிழ்

03. මහා පරිමාණ භාෂා ආකෘති (LLMs), GPTs සහ පද්ධති නිර්මාණ සැලැස්ම

ප්‍රධාන තේමාව: මහා පරිමාණ භාෂා ආකෘතියක් යනු සත්‍යය ගබඩා කර තැබූ විශ්වකෝෂයක් නොවේ. එය මානව භාෂාවේ රටාවන් ගණිතමය දෛශික සහ න්‍යාස මගින් ග්‍රහණය කරගත්, ඊළඟට වඩාත්ම ගැළපෙන වචනය අනුමාන කරන ප්‍රබල සම්භාවිතා එන්ජිමකි (Probabilistic Engine).


1. සංකල්පීය ධූරාවලිය: AI, Generative AI, LLM සහ GPT

බොහෝ දෙනෙකු සාකච්ඡාවලදී AI, Generative AI, LLM සහ ChatGPT යන වචන එකම අර්ථයෙන් පටලවා භාවිත කරති. නමුත් ඉංජිනේරුමය වශයෙන් ඒවා අතර ඇත්තේ පැහැදිලි ධූරාවලිගත (Hierarchical) සම්බන්ධයකි:

LLM සහ GPT ධූරාවලිය රූපය 3.1: AI සිට GPT දක්වා සංකල්පීය ධූරාවලිය — කෘත්‍රිම බුද්ධිය (AI) → උත්පාදක කෘත්‍රිම බුද්ධිය (Generative AI) → මහා පරිමාණ භාෂා ආකෘති (LLMs) → Generative Pre-trained Transformers (GPT).

  • කෘත්‍රිම බුද්ධිය (Artificial Intelligence - AI): පරිගණක මගින් මිනිස් බුද්ධිය අනුකරණය කිරීමේ සමස්ත පුළුල් ක්ෂේත්‍රය (කුඩය).
  • උත්පාදක කෘත්‍රිම බුද්ධිය (Generative AI): පවතින දත්ත වර්ගීකරණයෙන් ඔබ්බට ගොස් අලුත් අන්තර්ගතයන් (පෙළ, රූප, කේත, ශබ්ද) නිපදවන AI උප කුලකය.
  • මහා පරිමාණ භාෂා ආකෘති (Large Language Models - LLMs): මුළු භාෂාවක්ම අරගෙන, ලෝකයේ ඇති සමස්ත සාහිත්‍යය සහ ලේඛන අධ්‍යයනය කර, මිනිස් භාෂාවේ රටාවන් ගණිතමය වශයෙන් හඳුනාගත් දැවැන්ත ආකෘති.
  • GPT (Generative Pre-trained Transformer): LLM එකක් නිර්මාණය කිරීම සඳහා භාවිත කරන වඩාත්ම සාර්ථක සහ විප්ලවීය ස්නායුක ජාල පද්ධති නිර්මාණයයි (Neural Network Architecture). 2017 වසරේදී ගූගල් පර්යේෂකයන් විසින් හඳුන්වා දුන් ඓතිහාසික පර්යේෂණ පත්‍රිකාව වන Vaswani et al. (2017) — "Attention Is All You Need" මගින් මෙම Transformer විප්ලවය ආරම්භ විය. අද OpenAI හි ChatGPT මෙන්ම Google Gemini, Anthropic Claude සහ DeepSeek ක්‍රියාත්මක වන්නේද මෙම Transformer මූලධර්මය මතය (මෙම සමස්ත තාක්ෂණික විකාශනය පිළිබඳව ඉඩසර ඇකඩමියේ පළවූ The Gen AI Evolutionary Journey: 2017 to 2035 ලිපියෙන් වැඩිදුර හැදෑරිය හැක).

2. සොබාදහමේ ආදර්ශය, ජපානයේ බුලට් දුම්රිය සහ ස්නායුක ජාල (Biomimicry to Neural Networks)

මෙහිදී අප මූලික ඉංජිනේරුමය ප්‍රශ්නයක් ඇසිය යුතුය: පරිගණක විද්‍යාඥයන් භාෂාව තේරුම් ගැනීමට සහ උත්පාදනය කිරීමට "ස්නායුක ජාල" (Neural Networks) තෝරාගත්තේ ඇයි?

මීට පිළිතුර සොයාගත හැක්කේ ඉංජිනේරු විද්‍යාවේ අතිශය විප්ලවීය සංකල්පයක් වන ජෛව අනුකරණය (Biomimicry) තුළිනි. ජෛව අනුකරණය යනු මිනිසා මුහුණ දෙන අතිශය සංකීර්ණ තාක්ෂණික අභියෝග විසඳා ගැනීම සඳහා, සොබාදහම විසින් වසර මිලියන ගණනක පරිණාමීය ක්‍රියාවලිය ඔස්සේ පරිපූර්ණ කර ඇති ස්වභාවික ආකෘතීන්, හැඩතල සහ යාන්ත්‍රණයන් ආදර්ශයට ගැනීමයි.

ජපානයේ ෂින්කන්සෙන් (Shinkansen) බුලට් දුම්රිය සහ පිළිහුඩුවාගේ පාඩම

ජෛව අනුකරණයේ විශිෂ්ටතම ප්‍රායෝගික උදාහරණය වාර්තා වන්නේ 1990 දශකයේ ජපානයෙනි.

ජපානයේ අධිවේගී ෂින්කන්සෙන් (Shinkansen) බුලට් දුම්රිය පැයට කිලෝමීටර 300 ඉක්මවූ වේගයකින් ධාවනය වන විට බරපතළ වායුගතික (Aerodynamic) සහ පාරිසරික අර්බුදයකට මුහුණ දුන්නේය. දුම්රිය ඉතා අධික වේගයෙන් පටු උමං මාර්ග (Tunnels) තුළට ඇතුළු වන විට, දුම්රියේ ඉදිරිපස මුහුණත මගින් උමග තුළ ඇති වාතය පිස්ටනයක් (Piston) මෙන් සම්පීඩනය කළේය. මෙම සම්පීඩිත වායු රළ උමගේ අනෙක් කෙළවරින් පිටවූයේ අකුණු පිපිරීමක් වැනි දැවැන්ත කන් බිහිරි කරවන පිපුරුම් ශබ්දයක් (Sonic Boom / Tunnel Boom) නිකුත් කරමිනි. මෙම ශබ්දය කිලෝමීටරයක් දුරින් පිහිටි ගම්මානවල නිවෙස්වල ජනෙල් පියන් සෙලවීමට සහ ප්‍රදේශවාසීන්ට මහත් පීඩාවක් ඇති කිරීමට සමත් විය. නීතිමය ශබ්ද සීමාවන් ඉක්මවා යාම නිසා දුම්රියේ වේගය අඩු කිරීමට ඉංජිනේරුවන්ට සිදුවිය.

මෙම අර්බුදයට විසඳුම සොයාගත්තේ JR-West දුම්රිය සමාගමේ ප්‍රධාන තාක්ෂණික ඉංජිනේරුවරයෙකු සහ දැඩි පක්ෂි නිරීක්ෂකයෙකු (Birdwatcher) වූ එයිජි නකට්සු (Eiji Nakatsu) මහතා විසිනි.

නකට්සු මහතා සොබාදහම නිරීක්ෂණය කරමින් එක් සුවිශේෂී ප්‍රශ්නයක් මතු කළේය: "අඩු ඝනත්වයක් ඇති වාතයේ සිට ක්ෂණිකව වැඩි ඝනත්වයක් ඇති ජලය තුළට අධික වේගයෙන් කිමිදෙන විට, දිය බිඳක් හෝ විසිරෙන්නේ නැතිව, කිසිදු තරංගයක් හෝ ශබ්දයක් නිකුත් නොකර ජලයට ඇතුළු වන්නේ කුමන සත්ත්වයාද?"

පිළිතුර වූයේ පිළිහුඩුවාය (Kingfisher).

පිළිහුඩුවා අහසේ සිට ජලයේ සිටින මත්ස්‍යයෙකු දෙසට කිමිදෙන විට, ඌගේ දිගටි, කේතුකාකාර සහ වක්‍රාකාර හොට (Streamlined Conical Beak) මගින් ජල ප්‍රතිරෝධය සුමටව දෙපසට කපා දමයි. එහි ප්‍රතිඵලයක් ලෙස කිසිදු ජල විසිරීමක් හෝ ප්‍රතිරෝධක කම්පනයක් හටගන්නේ නැත. මීට අමතරව, බකමූණන්ගේ පියාපත්වල ඇති සියුම් දාර (Serrations) මගින් වායු ඝෝෂාව උරාගන්නා ආකාරයද නකට්සු මහතාගේ අවධානයට ලක්විය.

1997 දී එළිදැක්වූ Shinkansen 500 Series දුම්රියේ ඉදිරිපස මීටර් 15 ක් දිග නාසය නිර්මාණය කරන ලද්දේ පිළිහුඩුවාගේ හොටේ නිශ්චිත වායුගතික හැඩය පරිගණක ගත කරමිනි. එහි ප්‍රතිඵලය විස්මිත විය: 1. උමං පිපුරුම් ශබ්දය (Tunnel Boom) සම්පූර්ණයෙන්ම තුරන් විය: නීතිමය පාරිසරික ශබ්ද සීමාවන්ට යටත්ව දුම්රියට ධාවනය කිරීමට හැකිවිය. 2. වායු ප්‍රතිරෝධය (Aerodynamic Drag) 30% කින් අඩු විය. 3. විදුලි පරිභෝජනය 15% කින් අඩු විය. 4. දුම්රියේ වේගය 10% කින් වැඩි කරමින් පැයට කිලෝමීටර 300 ක මෙහෙයුම් වේගයක් අඛණ්ඩව පවත්වා ගැනීමට හැකිවිය.

ජපානයේ ෂින්කන්සෙන් බුලට් දුම්රිය සහ පිළිහුඩුවාගේ ජෛව අනුකරණය රූපය 3.2: ජෛව අනුකරණය (Biomimicry) ප්‍රායෝගිකව — ජලයට කිමිදෙන පිළිහුඩුවාගේ (Kingfisher) කේතුකාකාර හොටේ හැඩය ආදර්ශයට ගෙන ප්‍රතිනිර්මාණය කළ ජපානයේ ෂින්කන්සෙන් 500 Series බුලට් දුම්රියේ වායුගතික නාසය (Aerodynamic Nose). එමගින් උමං පිපුරුම් ශබ්දය (Tunnel Boom) සම්පූර්ණයෙන්ම තුරන් කර වායු ප්‍රතිරෝධය 30% කින් අඩු කරගන්නා ලදී.


යාන්ත්‍රික ජෛව අනුකරණයේ සිට සංජානන ජෛව අනුකරණය දක්වා: ස්නායුක ජාල (Neural Networks)

ජපාන ඉංජිනේරුවන් දුම්රියේ අධිවේගී වායු ප්‍රතිරෝධය විසඳීමට පක්ෂීන්ගේ හැඩය ආදර්ශයට ගත්තා සේද, පරිගණක විද්‍යාඥයන් සහ AI පද්ධති නිර්මාණ ශිල්පීන් මිනිස් භාෂාවේ සහ සංජානනයේ (Cognition) රටා හඳුනාගැනීම සඳහා ආදර්ශයට ගත්තේ මානව මොළයේ ජීව විද්‍යාත්මක ස්නායුක ජාලයයි (Biological Neural Network). මෙය හැඳින්වෙන්නේ සංජානන ජෛව අනුකරණය (Cognitive Biomimicry) ලෙසිනි.

මිනිස් මොළයේ දළ වශයෙන් බිලියන 86 ත් 100 ත් අතර ජීව විද්‍යාත්මක නියුරෝන (Biological Neurons) පවතින අතර, ඒවා ට්‍රිලියන සිය ගණනක් වූ සිනැප්ස (Synapses) මගින් එකිනෙකට සම්බන්ධ වී ඇත. කුඩා දරුවෙකු වචන ඉගෙන ගන්නා විට සිදුවන්නේ නීති පොත් කියවීම නොවේ; මොළය හරහා විද්‍යුත්-රසායනික සංඥා ගමන් කරමින්, එකවර ක්‍රියාත්මක වන නියුරෝන අතර සබඳතා ශක්තිමත් වීමයි ("Neurons that fire together, wire together").

පරිගණක ඉංජිනේරුවන් වටහාගත්තේ සාම්ප්‍රදායික මෘදුකාංග මෙන් දෘඪ නීති (if-else logic) ලිවීමෙන් භාෂාව පරිගණකයකට ඉගැන්විය නොහැකි බවයි. භාෂාව යනු අතිශය නම්‍යශීලී, සන්දර්භගත පද්ධතියකි. එබැවින් ඔවුහු මිනිස් මොළයේ නියුරෝන සහ සිනැප්ස ක්‍රියාත්මක වන ආකාරය ගණිතමය සමීකරණ මගින් පරිගණකයක ප්‍රතිනිර්මාණය කළහ. එය කෘත්‍රිම ස්නායුක ජාලයයි (Artificial Neural Network - ANN). අද අප කතා කරන GPT සහ LLM යනු බිලියන සහ ට්‍රිලියන ගණනක් පැරාමීටර (Parameters) සහිතව පරිගණක මත ගොඩනැගූ දැවැන්ත කෘත්‍රිම ස්නායුක ජාල පද්ධතීන්ය.

ජීව විද්‍යාත්මක සිනැප්සයේ සිට කෘත්‍රිම ස්නායුක ජාලය දක්වා රූපය 3.3: සංජානන ජෛව අනුකරණය (Cognitive Biomimicry) — මානව මොළයේ ජීව විද්‍යාත්මක සිනැප්සය සහ විද්‍යුත් සංඥා සම්ප්‍රේෂණය (Biological Synapse & Action Potential) ආදර්ශයට ගනිමින් කෘත්‍රිම ස්නායුක ජාලයක (ANN) ආදාන ස්ථරය (Input Layer), සැඟවුණු ස්ථර (Hidden Layers 1-3), ප්‍රතිදාන ස්ථරය (Output Layer) සහ සිනැප්ටික බර තැබීම් (Synaptic Connections) ගණිතමය වශයෙන් ගොඩනැගී ඇති ආකාරය පිළිබඳ සෘජු සංසන්දනය.

ජීව විද්‍යාත්මක මොළය සහ කෘත්‍රිම ස්නායුක ජාලය (LLM) අතර 1:1 ඉංජිනේරුමය සමාන්තරය:

අංකය ජීව විද්‍යාත්මක මොළය (Biological Brain) කෘත්‍රිම ස්නායුක ජාලය / LLM (Artificial Neural Network) ඉංජිනේරුමය ක්‍රියාකාරිත්වය (Engineering Function)
01 ජීව විද්‍යාත්මක නියුරෝනය (Biological Neuron) කෘත්‍රිම නෝඩය / ස්ථරය (Artificial Node / Layer) සංඥා ආදාන එකතු කර, සක්‍රියතා ශ්‍රිතයක් (Activation Function) හරහා ඊළඟ නෝඩ වෙත සම්ප්‍රේෂණය කිරීම.
02 සිනැප්සය (Synapse - සබඳතාව) බර තැබීම හෙවත් පැරාමීටරය (Weight / Parameter) නෝඩ දෙකක් අතර තොරතුරු ගලායාමේ ප්‍රබලතාවය තීරණය කරන සංඛ්‍යාත්මක අගය (නූතන LLM වල මේවා බිලියන සිය ගණනකි).
03 සිනැප්ටික ප්‍රත්‍යාස්ථතාව (Synaptic Plasticity) පසුපසට ප්‍රචාරණය (Backpropagation & Gradient Descent) ආකෘතිය වරදක් කළ විට, එම වරද අවම වන පරිදි ස්නායුක ජාලයේ බර තැබීම් (Weights) ගණිතමයව යාවත්කාලීන කරමින් ඉගෙන ගැනීම.
04 ළමා අවදියේ ඉගෙනුම සහ අත්දැකීම් (Experience & Learning) දැවැන්ත පූර්ව පුහුණුව (Pre-training on Trillions of Tokens) ට්‍රිලියන සංඛ්‍යාත වචන සහ රටා කියවමින්, ස්නායුක ජාලය තුළ භාෂාවේ සහ ලෝකයේ සම්භාවිතා රටා තැන්පත් කරගැනීම.
05 සංජානනය සහ ප්‍රතිචාර දැක්වීම (Cognition & Output) අනුමාන ප්‍රතිදානය (Inference / Next-Token Generation) නව විමසුමක් (Prompt) ලැබුණු විට, සකස් කළ ස්නායුක ජාලය හරහා ගණනය කර වඩාත්ම උචිත ඊළඟ වචන මාලාව ක්ෂණිකව උත්පාදනය කිරීම.

පරිණාමීය ප්‍රශස්තකරණය සහ තීරණාත්මක සීමා රේඛාව (The Evolutionary Boundary)

මෙහිදී අප තේරුම් ගත යුතු ගැඹුරුම තාක්ෂණික පාඩම් දෙකක් තිබේ:

  1. සොබාදහමේ ඉංජිනේරු ප්‍රශස්තකරණය (Evolutionary Optimization): මිනිසාට අලුතින් රෝදය හෝ ජාල පද්ධති නිර්මාණ මුල සිට නිර්මාණය කිරීමට අවශ්‍ය නැත. සොබාදහම විසින් වසර මිලියන සිය ගණනක ස්වභාවික වරණය (Natural Selection) හරහා අපගේ මොළය නිර්මාණය කර ඇත්තේ විශ්වයේ පවතින අතිශය අවම ශක්තියක් වැය කරමින් (වොට් 20 ක බලයකින්) උපරිම රටා ග්‍රහණය කරගත හැකි අසමසම ජෛව පරිගණකයක් ලෙසිනි. AI විද්‍යාඥයන් ස්නායුක ජාල තෝරාගත්තේ මිනිස් මොළයේ එම පරිපූර්ණ කාර්යක්ෂමතාව නිසාය.

  2. තීරණාත්මක සීමා රේඛාව (The Critical Engineering Boundary): කෙසේ වෙතත්, ඉංජිනේරුමය විචාරශීලීත්වයෙන් යුතු නායකයෙකු ලෙස ඔබ මෙහි සැබෑ සීමාව පැහැදිලිව හඳුනාගත යුතුය:

    ජපානයේ බුලට් දුම්රියේ නාසය පිළිහුඩුවාගේ හොටේ හැඩයට හැදූ පමණින්, එම යකඩ දුම්රිය පියාපත් සලමින් අහසේ පියාසර කරන, බිත්තර දමන සජීවී පිළිහුඩුවෙකු බවට පත් වන්නේ නැත! එය තවමත් දුම්රිය මාර්ගයේ දුවන යාන්ත්‍රික දුම්රියක්මය.

හරියටම ඒ ආකාරයෙන්ම, මහා පරිමාණ භාෂා ආකෘති (LLMs) මානව මොළයේ ස්නායුක ජාල ව්‍යුහය ආදර්ශයට ගෙන ගණිතමය වශයෙන් නිර්මාණය කළ පමණින්, එම පරිගණක ආකෘතියට මිනිස් ජීව විද්‍යාත්මක විඥානයක් (Consciousness), ආත්මීය හැඟීමක්, චේතනාවක් හෝ අවබෝධයක් ලැබෙන්නේ නැත! එය තවමත් කරන්නේ නියුරෝන ජාලයක ගණිතමය බර තැබීම් (Matrix Multiplications) හරහා ඊළඟ වචනය කුමක් විය හැකිදැයි අනුමාන කරන සංඛ්‍යානමය ගණනය කිරීමක් පමණි (P(w_t | w_<t)).

මෙම යථාර්ථය වටහා ගැනීම රාජ්‍ය පරිපාලන නායකයන්ට අතිශය තීරණාත්මක වන්නේ, එවිට අප AI තාක්ෂණයේ දැවැන්ත කාර්යක්ෂමතාව නිසි පරිදි අත්පත් කරගන්නා අතරම, එය මිනිසෙකු ලෙස සලකා මුළාවට පත්වීමෙන් (Anthropomorphism) වැළකී සිටින බැවිනි.


3. LLM එකක් සැබවින්ම ගොඩනැගෙන්නේ කෙසේද? (The Google Search Analogy)

මෙය තේරුම් ගැනීමට ගූගල් සෙවුම් යන්ත්‍රය (Google Search) ක්‍රියාත්මක වන ආකාරය දෙස බලමු.

ගූගල් සෙවුම් යන්ත්‍රය කරන්නේ ලෝකයේ අන්තර්ජාලයේ ඇති සියලුම වෙබ් අඩවි කියවා, එහි ඇති වචන විශාල පටුනක් හෙවත් ඉන්ඩෙක්ස් එකක් (Index) බවට පත් කර තබා ගැනීමයි. ඔබ වචනයක් සෙවූ විට, එය තම ඉන්ඩෙක්ස් එක පිරික්සා වඩාත්ම ගැළපෙන ලින්ක් එක (Link) ඔබට ලබා දෙයි.

මහා පරිමාණ භාෂා ආකෘති (LLMs) ක්‍රියාත්මක වන්නේද ඊට සමාන, නමුත් ඊට වඩා සිය දහස් ගුණයකින් සංකීර්ණ ගණිතමය තලයකය:

  1. එය මුළු අන්තර්ජාලයම, ලෝකයේ ඩිජිටල් කර ඇති සියලුම පොත්පත්, පර්යේෂණ පත්‍රිකා, ශබ්දකෝෂ, නීති පොත් සහ සංවාද සම්පූර්ණයෙන්ම කියවයි.
  2. කියවා, ඒ සියලු පෙළ කොටස් කුඩා කැබලි හෙවත් ටෝකන (Tokens) වලට කඩා දමයි.
  3. මා කලින් සඳහන් කළ පරිදි, පරිගණකයට මේ ඉංග්‍රීසි හෝ සිංහල අකුරු තේරෙන්නේ නැත. එබැවින්, එය කරන්නේ මෙම සෑම ටෝකනයක්ම සංඛ්‍යාත්මක අගයන් බවට පත් කර, භාෂාවේ වචන එකිනෙක ගැළපෙන ආකාරය පිළිබඳව අතිවිශාල ගණිතමය ආකෘතියක් (Mathematical Language Model) ගොඩනගා ගැනීමයි.

4. උසස් පෙළ සංයුක්ත ගණිතය සහ Transformer මොළය

බොහෝ දෙනෙකු අසන ප්‍රශ්නයක් නම්: "මේ ආකෘතිවල මොළය ක්‍රියාත්මක වන්නේ කෙසේද?" යන්නයි.

මෙහි මොළය වන්නේ බහු ස්ථර ට්‍රාන්ස්ෆෝමර් පද්ධති නිර්මාණයයි (Multi-layer Transformer Architecture).

ඔබ ශ්‍රී ලංකාවේ උසස් පෙළ (A/L) සංයුක්ත ගණිතය (Combined Mathematics) හදාරන දරුවෙකුගෙන් විමසුවහොත්, ඔවුන් ඉගෙන ගන්නා න්‍යාස (Matrices) සහ දෛශික (Vectors) සැබෑ ලෝකයේ ප්‍රායෝගිකව යොදාගන්නේ කොතැනදැයි බොහෝ විට ඔවුන් නොදන්නවා විය හැක. නමුත් අද මුළු ලෝකයම හොල්ලන කෘත්‍රිම බුද්ධිය ක්‍රියාත්මක වන්නේ හරියටම ඒ ගණිතමය මූලධර්ම මතය!

දත්ත ආදානය සහ ටෝකනීකරණය රූපය 3.4: මහා පරිමාණ භාෂා ආකෘතියක (LLM) මූලික පද්ධති නිර්මාණ සැලැස්ම — දැවැන්ත දත්ත සමුදාය, ටෝකනීකරණය සහ එම්බෙඩින්, ට්‍රාන්ස්ෆෝමර් මොළය, පුහුණු ක්‍රියාවලිය (Pre-training & RLHF) සහ අනුමාන ප්‍රතිදානය (Inference).

රූපය 3.4 හි අදියර 5 ගැඹුරු ඉංජිනේරු විග්‍රහය:

  1. අදියර 1: දැවැන්ත දත්ත සමුදාය (Massive Dataset — අමුද්‍රව්‍ය): * ඩිජිටල්කරණය කළ පොත්පත් (Books), විශ්වකෝෂ, ලේඛන (Text Documents), විවෘත අන්තර්ජාල වෙබ් අඩවි (Websites) සහ පරිගණක කේත (Code Repositories). * මෙම අතිවිශාල දත්ත පිරිසිදු කර (Deduplication & Quality Filtering), අසත්‍ය හෝ විෂ සහිත අන්තර්ගත ඉවත් කර ආකෘතිය වෙත යොමු කෙරේ.
  2. අදියර 2: දත්ත ආදානය, ටෝකනීකරණය සහ එම්බෙඩින් (Data Input, Tokenization & Embedding): * ටෝකනීකරණය (Tokenizer): වාක්‍ය සහ ඡේද කුඩා අක්ෂර ඛණ්ඩ හෙවත් ටෝකන (Tokens) බවට කඩා දැමීම. * දෛශික එම්බෙඩින් (Vector Embedding): සෑම ටෝකනයකටම මානයන් දහස් ගණනක් ඇති බහුමාන ගණිතමය අවකාශයක ඛණ්ඩාංක ලබා දීම. අර්ථයෙන් සමාන වචන ("ප්‍රාදේශීය ලේකම්" සහ "දිසාපති") මෙම අවකාශයේ ඉතා සමීපව ස්ථානගත වේ.
  3. අදියර 3: ට්‍රාන්ස්ෆෝමර් පද්ධති නිර්මාණ සැලැස්ම (The Transformer "Brain"): * ස්වයං-අවධානය (Self-Attention Mechanism): වාක්‍යයක එක් වචනයක් අනෙක් සියලුම වචන සමග දක්වන සන්දර්භගත සම්බන්ධය ගණනය කිරීම. (උදා: "ඔහු බලපත්‍රය අත්සන් කර එය ලේකම්වරයාට දුන්නේය" යන්නෙහි "එය" යනු කුමක්දැයි හඳුනා ගැනීම). * සංකේතක සහ විකේතක ස්ථර (Encoder & Decoder Layers): ආදාන තොරතුරු සංජානනය කිරීම සහ ඊළඟ වචන පිළිවෙළින් නිපදවීම. * එකතු කිරීම් සහ ප්‍රමිතිකරණ ස්ථර (Add & Norm Layers): ස්නායුක ස්ථර සිය ගණනක් හරහා තොරතුරු ගලා යාමේදී ගණිතමය සංඥා දුර්වල වීම (Vanishing Gradients) වළක්වා ස්ථායීතාව රැකගැනීම. * ඉදිරියට-පෝෂණය වන ස්නායුක ජාල (Feed-Forward Networks - FFN): සකස් කළ දත්ත මතකය තුළ තැන්පත් කරමින් සංකීර්ණ රටා ග්‍රහණය කරගැනීම.
  4. අදියර 4: ඉගෙනුම් සහ පුහුණු ක්‍රියාවලිය (Training & Learning Process): * පූර්ව පුහුණුව (Pre-training — Unsupervised Learning): ට්‍රිලියන ගණනක් වචන කියවමින්, "ඊළඟ වචනය කුමක්දැයි" අනුමාන කිරීම (Next-Word Prediction). මෙහිදී ආකෘතිය භාෂාවේ සමස්ත ව්‍යාකරණ සහ තර්කනය ග්‍රහණය කරගනී. * මානව ප්‍රතිපෝෂණ මගින් සුසර කිරීම (Fine-Tuning / RLHF): මිනිස් විශේෂඥයන් විසින් ආකෘතියේ පිළිතුරු ශ්‍රේණිගත කර, රාජ්‍ය සේවයට හා සමාජයට උචිත, ආරක්ෂිත, විනීත සහ සත්‍යවාදී පිළිතුරු දීමට ආකෘතිය හැඩගැස්වීම (Alignment with Human Intent).
  5. අදියර 5: අනුමානය සහ පෙළ උත්පාදනය (Inference & Text Generation): * පරිශීලකයා විසින් දෙන ලද විමසුම (Prompt) මත පදනම්ව, ගණිතමය සම්භාවිතා උපායමාර්ග (Decoding & Sampling Strategies — Temperature, Top-p) භාවිත කරමින් වඩාත්ම සුදුසු ප්‍රතිදානය (Generated Text Output) ක්ෂණිකව උත්පාදනය කිරීම.

5. පූර්ව පුහුණුව (Pre-training) සහ ශක්තිමත් කිරීමේ ඉගෙනුම (RLHF)

ආකෘතියක් ක්ෂණිකව බුද්ධිමත් වන්නේ නැත. එය ගොඩනැගෙන්නේ පියවරෙන් පියවර සිදුකරන අතිවිශාල පුහුණු ක්‍රියාවලියකිනි:

  1. පූර්ව පුහුණුව (Pre-training): * ආකෘතියට බිලියන ගණනක වාක්‍ය ලබා දී, එහි අතරමැද ඇති වචනයක් වසා තබා "ඊළඟ වචනය කුමක්දැයි" අනුමාන කිරීමට සලස්වයි. * එය වැරදි වචනයක් අනුමාන කළ විට, ගණිතමය වශයෙන් දඬුවම් කර (Backpropagation) එහි බර තැබීම් සකස් කරයි. නිවැරදි වූ විට එම රටාව තහවුරු කරයි. * මේ ආකාරයට ට්‍රිලියන ගණනක් වාර පුහුණු වන විට, ආකෘතියට මිනිස් භාෂාවේ ව්‍යාකරණ, තර්කනය සහ දැනුම පිළිබඳ අතිවිශිෂ්ට ග්‍රහණයක් ලැබේ.
  2. මානව ප්‍රතිපෝෂණ මගින් සුසර කිරීම (RLHF - Reinforcement Learning from Human Feedback): * ආකෘතිය ලබා දෙන පිළිතුරු මිනිස් පරීක්ෂකයන් විසින් ශ්‍රේණිගත කරමින්, වඩාත් විනීත, ප්‍රයෝජනවත් සහ නිවැරදි පිළිතුරු ලබා දීමට ආකෘතිය මෙහෙයවයි.

6. සම්භාවිතා එන්ජිමක් මිස සත්‍යයේ එන්ජිමක් නොවේ (A Plausibility Engine, Not a Truth Engine)

රාජ්‍ය නිලධාරියෙකු ලෙස ඔබ ඔබේ මනසේ නොමැකෙන ලෙස සටහන් කරගත යුතු අංක එකේ ඉංජිනේරුමය සත්‍යය මෙයයි:

Warning

LLM එකක් යනු සත්‍යය පිරික්සන යන්ත්‍රයක් නොවේ. එය වඩාත්ම ගැළපෙන ඊළඟ වචනය අනුමාන කරන සම්භාවිතා එන්ජිමකි.

ආකෘතියට සත්‍යය යනු කුමක්ද, අසත්‍යය යනු කුමක්ද කියා කිසිදු ආත්මීය හැඟීමක් නොමැත. ඔබ ප්‍රශ්නයක් ඇසූ විට එය කරන්නේ, තමන් සතු සත්‍ය තොරතුරු ගබඩාවකින් කරුණු තහවුරු කිරීම නොව, ඔබේ ප්‍රශ්නයට පිළිතුරක් ලෙස පැමිණිය හැකි වඩාත්ම විශ්වාසනීය සහ සුමට වචන මාලාව ගණිතමය සම්භාවිතාව මත ගොඩනැගීමයි.

එමනිසා, ආකෘතියක් යම් කරුණක් නොදන්නා විට පවා, එය කිසිදු පැකිලීමකින් තොරව, අතිශය අලංකාර නිල භාෂාවෙන්, සම්පූර්ණයෙන්ම ගෙතූ අසත්‍ය තොරතුරක් (Hallucination) ඉදිරිපත් කළ හැක. නිලධාරියෙකු ලෙස ඔබ ආකෘතියේ "හැඩයට" නොරැවටී "සත්‍යතාවය" තහවුරු කරගත යුත්තේ එබැවිනි.


7. භාෂාමය පක්ෂග්‍රාහීත්වය සහ භූ-දේශපාලනය: ආකෘති වෙනස් වන්නේ ඇයි?

සැසිවාරවලදී බොහෝ නිලධාරීන් නගන සාධාරණ මැසිවිල්ලක් තිබේ: "සර්, අපි සිංහලෙන් ප්‍රශ්නයක් ඇහුවාම ChatGPT සමහර වෙලාවට විකාර උත්තර දෙනවා. හැබැයි ඉංග්‍රීසියෙන් ඇහුවාම සුපිරියට උත්තර එනවා. ඇයි එහෙම වෙන්නේ?"

මීට හේතුව මෙම ආකෘති පුහුණු කළ දත්තවල පවතින දැවැන්ත භාෂාමය සහ සංස්කෘතික පක්ෂග්‍රාහීත්වයයි (Training Bias):

  1. බටහිර ඉංග්‍රීසි ආධිපත්‍යය (Western Knowledge Bias): * ChatGPT, Claude වැනි ඇමරිකානු ආකෘති පුහුණු කර ඇත්තේ අතිමහත් බහුතරයක් බටහිර ලෝකයේ ඉංග්‍රීසි සාහිත්‍යය, බටහිර නීතිය සහ දත්ත පදනම් කරගෙනය. පෙරදිග සංස්කෘතිය, ශ්‍රී ලංකාවේ චක්‍රලේඛ හෝ අපේ ග්‍රාමීය ජීවන රටාව පිළිබඳ දත්ත ඒවා සතුව ඇත්තේ අතිශය සීමිත ප්‍රතිශතයකි.
  2. ගූගල් Gemini හි සිංහල වාසිය: * අනෙක් ඇමරිකානු ආකෘතිවලට සාපේක්ෂව Google Gemini සතුව සිංහල භාෂාව සම්බන්ධයෙන් කැපී පෙනෙන වාසියක් පවතී. ඊට හේතුව ගූගල් සමාගම වසර විස්සකට වැඩි කාලයක් තිස්සේ ශ්‍රී ලංකාවේ සිංහල සහ දෙමළ වෙබ් අඩවි, ප්‍රවෘත්ති වාර්තා සහ සෙවුම් පද (Google Search Index) තම දත්ත පද්ධති තුළ ගබඩා කරගෙන සිටීමයි. එබැවින් සාපේක්ෂව සිංහල ව්‍යාකරණ සහ වචන භාවිතයේදී Gemini ඉහළ නිරවද්‍යතාවක් දක්වයි.
  3. චීන DeepSeek ආකෘතියේ රහස: * චීනයේ DeepSeek ආකෘතිය සමග සිංහලෙන් ගනුදෙනු කරන විට එය පුදුම සහගත ලෙස හොඳින් සිංහල තේරුම් ගන්නා බව ඔබට පෙනෙනු ඇත. ඊට හේතුව, චීන භාෂාව යනු ඉංග්‍රීසි මෙන් සරල අක්ෂර මාලාවක් නොව අතිශය සංකීර්ණ රූපමය අක්ෂර සහ ස්වර රටා සහිත භාෂාවකි. චීන භාෂාව මත සහ ඉංග්‍රීසි නොවන පුළුල් බහුභාෂා දත්ත මත ගැඹුරින් පුහුණු කර ඇති බැවින්, අපේ සිංහල භාෂාවේ ඇති සංකීර්ණ වාක්‍ය රටාවන්ට හැඩගැසීමේ ස්වභාවික හැකියාවක් DeepSeek සතුය.
  4. දෙමළ භාෂාව සහ සිංහල භාෂාව අතර වෙනස: * ශ්‍රී ලංකාවේ දෙමළ භාෂාව භාවිත කරන නිලධාරීන්ට AI මෙවලම් භාවිතය සාපේක්ෂව පහසුය. මන්ද, ඉන්දියාවේ තමිල්නාඩුව ඇතුළු ලොව පුරා කෝටි ගණනක් දෙමළ ජනතාව විසින් අන්තර්ජාලයට එක්කර ඇති අතිවිශාල දෙමළ සාහිත්‍යයක් සහ ඩිජිටල් දත්ත පද්ධතියක් පවතින බැවිනි. * නමුත් සිංහල භාෂාව කතා කරන්නේ ලෝකයේ අපේ රටේ කෝටි දෙකකට ආසන්න ජනතාව පමණි. අප අන්තර්ජාලයට එක්කර ඇති ඩිජිටල් සිංහල අන්තර්ගතය ඉතා සීමිතය. එබැවින් සිංහල භාෂාවෙන් AI භාවිත කිරීමේදී අප විශේෂයෙන් විමසිලිමත් විය යුතුය.

8. බහු-ආකෘතික ඒකාබද්ධතාව සහ විශ්ව දෛශික අවකාශය (Multimodal AI Systems)

අද වන විට මෙම ආකෘති හුදු පෙළ (Text) වලට පමණක් සීමා වී නොමැත. නවීන Frontier ආකෘති ක්‍රියාත්මක වන්නේ පූර්ණ බහු-මාදිලි (Multimodal) පද්ධති වශයෙනි.

බහු-ආකෘතික ඒකාබද්ධතාව රූපය 3.5: බහු-ආකෘතික උත්පාදක AI පද්ධතියක පද්ධති නිර්මාණ සැලැස්ම — බහු-මාදිලි දත්ත ආදානය (Text, Photos, Videos, Audio, Code), ඒකාබද්ධ බහුමාන දෛශික අවකාශය (Multimodal Vector Space), බහු-ශීර්ෂ ට්‍රාන්ස්ෆෝමරය සහ බහු-මාදිලි ප්‍රතිදානය.

රූපය 3.5 හි බහු-ආකෘතික පද්ධති පද්ධති නිර්මාණ විග්‍රහය:

  1. බහු-මාදිලි දැවැන්ත දත්ත සමුදාය (Massive Multimodal Dataset): * ලේඛන පෙළ (Text Documents), ඡායාරූප (Photos), වීඩියෝ (Videos), ශ්‍රව්‍ය පටිගත කිරීම් (Audio) සහ පරිගණක කේත (Code).
  2. බහු-මාදිලි දත්ත ආදානය සහ ටෝකනීකරණය (Multimodal Ingestion & Tokenizer): * පැරණි ක්‍රමයේදී මෙන් රූපයක් දුටු විට එය අකුරුවලට පෙරළන්නේ නැත (No text-intermediate bottleneck). * ඡායාරූප සහ වීඩියෝ රාමු කුඩා පික්සල් කොටු (16x16 Patches) ලෙස කඩා දෘශ්‍ය ටෝකන (Visual Tokens) බවටද, ශ්‍රව්‍ය තරංග සංඛ්‍යාත වර්ණාවලි (Spectrograms) හරහා ශ්‍රව්‍ය ටෝකන (Audio Tokens) බවටද සෘජුව පරිවර්තනය කරයි.
  3. ඒකාබද්ධ බහු-මාදිලි දෛශික අවකාශය (Unified Multimodal Vector Space): * මෙය සමස්ත පද්ධතියේ විශිෂ්ටතම ඉංජිනේරු ජයග්‍රහණයයි! * ශ්‍රී ලංකා ජාතික හැඳුනුම්පතක ඡායාරූපය (Image Patch), සිංහලෙන් කියන "ජාතික හැඳුනුම්පත" යන හඬපටය (Audio Wave), සහ ඉංග්‍රීසියෙන් ලියූ "National Identity Card" යන පෙළ (Text) යන සියල්ලම මෙම බහුමාන ගණිතමය අවකාශයේ ස්ථානගත වන්නේ එකම ඛණ්ඩාංක කලාපයකය. එමගින් යන්ත්‍රයට මාදිලි අතර බාධාවකින් තොරව සංසන්දනය කිරීමේ හැකියාව ලැබේ.
  4. බහු-ශීර්ෂ ට්‍රාන්ස්ෆෝමර් මාදිලිය (Multi-Headed Cross-Attention Architecture): * විවිධ මාදිලි අතර හරස්-අවධානය (Cross-Attention) ක්‍රියාත්මක වේ. නිදසුනක් ලෙස, පරිලෝකනය කළ ඔප්පුවක ඇති අත්සන දෙස බලන අතරතුරම, එහි ලියා ඇති ඉඩම් හිමිකරුගේ නම පෙළ සමග සසඳා බැලීමට ආකෘතියට හැකියාව ලැබේ.
  5. බහු-මාදිලි පූර්ව පුහුණුව සහ මානව සුසර කිරීම (Multimodal Pre-training & RLHF): * ඊළඟ දත්ත වර්ගය අනුමාන කිරීම (Next-Data-Type Prediction) ඔස්සේ වීඩියෝ, ශබ්ද සහ පෙළ මිශ්‍ර දත්ත මත පුහුණු වීම. * ආරක්ෂිත මාර්ගෝපදේශ සහ ව්‍යාජ නිර්මාණ (Deepfakes) වැළැක්වීමේ ආරක්‍ෂිත පෙරහන් (Multimodal Safety Alignment).
  6. විශ්ව බහු-මාදිලි ප්‍රතිදානය (Universal Generation & Output): * පරිශීලකයාට ඕනෑම මාධ්‍යයකින් විමසුමක් දිය හැක (උදා: පැමිණිල්ලක හඬපටයක් + ආපදා ඡායාරූපයක්). * පද්ධතිය විසින් සම්භාවිතා උපායමාර්ග (Decoding & Sampling) ඔස්සේ සිංහල නිල වාර්තාවක්, හානිය ලකුණු කළ සිතියමක්, හෝ විසඳුම් කේතයක් උත්පාදනය කර ලබා දෙයි.

රාජ්‍ය නිලධාරියාට මෙමගින් ලැබෙන ප්‍රායෝගික වටිනාකම:

  • අතින් ලියන ලද පැරණි ඉඩම් ඔප්පුවක හෝ ලිපියක ඡායාරූපයක් (Image) ඇතුළත් කර එහි අන්තර්ගතය තත්පරයකින් කියවා ගැනීම (Vision OCR).
  • මහජන දිනයේදී පුරවැසියෙකු ඉදිරිපත් කරන ගැටලුවක හඬපටයක් (Audio) ඇතුළත් කර ක්ෂණික නිල විමර්ශන සටහනක් සකස් කිරීම.
  • සංකීර්ණ සංවර්ධන සැලැස්මක සිතියමක් හෝ ප්‍රස්ථාරයක් විග්‍රහ කර එහි නොගැළපීම් හඳුනා ගැනීම.

ඊළඟ පරිච්ඡේදයේදී, මෙම ස්වභාවික භාෂා විප්ලවය හේතුවෙන් මානව ශාස්ත්‍ර නැවත කරලියට පැමිණෙන්නේ කෙසේද, සහ සාමාන්‍ය පුරවැසියා මුහුණ දෙන ඩිජිටල් පරතරය AI මගින් පියවන්නේ කෙසේද යන්න සාකච්ඡා කරමු.