பிற மொழிகளில்: English · සිංහල
03. பெரிய மொழி மாதிரிகள் (LLMs), GPTகள் மற்றும் அவற்றின் வடிவமைப்பு (Architecture)
முக்கிய கருப்பொருள்: பெரிய மொழி மாதிரி (LLM) என்பது உண்மைகள் சேமிக்கப்பட்டுள்ள ஒரு கலைக்களஞ்சியம் (encyclopedia) அல்ல. அது மனித மொழியின் வடிவங்களை கணித வெக்டர்கள் (vectors) மற்றும் அணிகள் (matrices) மூலமாகப் பிடித்து வைத்து, அடுத்ததாக வரக்கூடிய மிகவும் சாத்தியமான சொல்லைக் கணிக்கும் ஒரு சக்திவாய்ந்த நிகழ்தகவு இயந்திரமாகும் (probabilistic engine).
1. கருத்துரு படிநிலை: AI, உற்பத்தித் திறன் AI (Generative AI), LLM மற்றும் GPT
பொதுவான உரையாடல்களில், பலர் AI, Generative AI, LLM மற்றும் ChatGPT ஆகிய சொற்களை ஒரே பொருளில் மாற்றி மாற்றிப் பயன்படுத்துகின்றனர். ஆனால், பொறியியல் கண்ணோட்டத்தில் பார்த்தால், அவை தெளிவான ஒரு படிநிலை அமைப்பைக் (hierarchy) கொண்டுள்ளன:
படம் 3.1: AI முதல் GPT வரையிலான கருத்துரு படிநிலை — செயற்கை நுண்ணறிவு (AI) → உற்பத்தித் திறன் AI (Generative AI) → பெரிய மொழி மாதிரிகள் (LLMs) → உருவாக்கப் பெற்ற முன்-பயிற்சியளிக்கப்பட்ட உருமாற்றிகள் (GPT).
- செயற்கை நுண்ணறிவு (Artificial Intelligence - AI): மனித நுண்ணறிவைக் கணினிகள் போலி செய்யும் ஒட்டுமொத்தப் பரந்த துறை — இதுவே அனைத்துக்கும் மேலான ஒரு குடையாகும் (umbrella).
- உற்பத்தித் திறன் AI (Generative AI): ஏற்கனவே உள்ள தரவுகளை வகைப்படுத்துவதோடு நின்றுவிடாமல், உரை (text), படங்கள், நிரலாக்கக் குறியீடுகள் (code) மற்றும் ஒலிகள் போன்ற புதிய உள்ளடக்கங்களை உருவாக்கும் AI இன் ஒரு துணைப் பிரிவாகும்.
- பெரிய மொழி மாதிரிகள் (Large Language Models - LLMs): ஒரு முழுமையான மொழியைக் கற்று, உலகளவில் உள்ள அனைத்து இலக்கியங்கள் மற்றும் எழுத்துக்களை விரிவாக ஆராய்ந்து, மனித மொழியின் அமைப்பை கணிதவியல் ரீதியாகப் பிடித்து வைத்துள்ள பிரம்மாண்டமான மாதிரிகளாகும்.
- GPT (Generative Pre-trained Transformer): ஒரு LLM ஐ உருவாக்குவதற்கான மிகவும் வெற்றிகரமான மற்றும் புரட்சிகரமான நரம்பியல் நெட்வொர்க் அமைப்பாகும் (neural network architecture). இந்த டிரான்ஸ்ஃபார்மர் புரட்சியானது 2017 ஆம் ஆண்டில் கூகுள் ஆய்வாளர்கள் வெளியிட்ட வரலாற்றுச் சிறப்புமிக்க ஆய்வுத்தாளான Vaswani et al. (2017) — "Attention Is All You Need" என்பதன் மூலம் தொடங்கியது. இன்று OpenAI-இன் ChatGPT, Google Gemini, Anthropic Claude, மற்றும் DeepSeek ஆகிய அனைத்தும் இந்த டிரான்ஸ்ஃபார்மர் தத்துவத்தின் அடிப்படையிலேயே இயங்குகின்றன. (இந்தத் தொழில்நுட்பப் பரிணாமத்தைப் பற்றிய முழுமையான பின்னணியை இடசர அகாடமியின் ஜெனரேட்டிவ் AI இன் பரிணாமப் பயணம்: 2017 முதல் 2035 வரை என்ற கட்டுரையில் விரிவாகப் படிக்கலாம்.)
2. இயற்கையின் நீலவரைபடம், ஜப்பானின் அதிவேக புல்லட் ரயில் மற்றும் நரம்பியல் நெட்வொர்க்குகள் (உயிரியல் போலாக்கம் முதல் நரம்பியல் நெட்வொர்க்குகள் வரை)
இங்கே நாம் ஒரு அடிப்படை பொறியியல் கேள்வியைக் கேட்க வேண்டும்: மொழியைப் புரிந்துகொள்வதற்கும் உருவாக்குவதற்கும் கணினி விஞ்ஞானிகள் ஏன் "நரம்பியல் நெட்வொர்க்குகளை" (neural networks) தேர்வு කළார்கள்?
இதற்கான விடை பொறியியல் துறையின் மிகவும் புரட்சிகரமான யோசனைகளில் ஒன்றில் உள்ளது: உயிரியல் போலாக்கம் (Biomimicry) — கோடிக்கணக்கான ஆண்டுகால பரிணாம வளர்ச்சியில் இயற்கை செம்மைப்படுத்திய வடிவங்கள், அமைப்புகள் மற்றும் இயங்குமுறைகளைக் கடனாகப் பெற்று, மனிதகுலத்தின் கடினமான தொழில்நுட்ப சவால்களுக்குத் தீர்வு காண்பதே இதன் கருப்பொருளாகும்.
ஜப்பானின் ஷிங்கன்சென் (Shinkansen) புல்லட் ரயிலும் மீன்கொத்தியின் பாடமும்
நடைமுறை உயிரியல் போலாக்கத்திற்கு மிகச்சிறந்த வரலாற்று உதாரணம் 1990களில் ஜப்பானில் நிகழ்ந்தது.
மணிக்கு 300 கிலோமீட்டருக்கும் அதிகமான வேகத்தில் செல்லும் ஜப்பானின் ஷிங்கன்சென் அதிவேக புல்லட் ரயில், ஒரு கடுமையான காற்றுயங்கியல் (aerodynamic) மற்றும் சுற்றுச்சூழல் நெருக்கடியை எதிர்நோக்கியது. ரயில் அதிக வேகத்தில் குறுகிய சுரங்கப்பாதைகளுக்குள் நுழையும் போது, அதன் முன்பகுதி சுரங்கப்பாதைக்குள் இருக்கும் காற்றை ஒரு பிஸ்டனைப் போல அமுக்கியது. அந்த அழுத்தப்பட்ட காற்று, சுரங்கப்பாதையின் மறுமுனையிலிருந்து காதைப் பிளக்கும் வெடிப்புச் சத்தத்துடன் வெளியேறியது — இது "சுரங்கப்பாதை வெடிப்புச் சத்தம்" (sonic tunnel boom) எனப்பட்டது. இது ஒரு கிலோமீட்டர் தொலைவில் உள்ள வீடுகளின் ஜன்னல்களைக் கூட அதிர வைக்கும் அளவுக்கு வலுவாக இருந்ததுடன், அப்பகுதி மக்களைப் பெரிதும் அச்சுறுத்தியது. சட்டப்பூர்வ சத்த அளவுகள் மீறப்பட்டதால், பொறியாளர்கள் ரயில்களின் வேகத்தைக் குறைக்க வேண்டிய கட்டாயத்திற்குத் தள்ளப்பட்டனர்.
இதற்கான தீர்வு JR-West ரயில்வே நிறுவனத்தின் தலைமைத் தொழில்நுட்பப் பொறியாளரும், தீவிர பறவை ஆர்வலருமான எய்ஜி நகட்சு (Eiji Nakatsu) என்பவரிடமிருந்து வந்தது.
இயற்கையைக் கவனித்த நகட்சு ஒரு அற்புதமான கேள்வியை எழுப்பினார்: "குறைந்த அடர்த்தி கொண்ட காற்றிலிருந்து, அதிக அடர்த்தி கொண்ட தண்ணீருக்குள் எவ்வித தெளிப்போ, அலையோ, சத்தமோ இன்றி அதிக வேகத்தில் பாயும் உயிரினம் எது?"
அதற்கான விடை: மீன்கொத்தி (Kingfisher).
ஒரு மீன்கொத்தி வானத்திலிருந்து தண்ணீரில் உள்ள மீனை நோக்கிப் பாயும்போது, அதன் நீண்ட, கூம்பு வடிவ, சீரமைக்கப்பட்ட அலகு நீரின் எதிர்ப்பைச் சுமூகமாக இருபுறமும் விலக்கிச் செல்கிறது. இதன் விளைவு: எவ்வித நீர தெளிப்போ, எதிர்ப்பு அதிர்ச்சியோ ஏற்படுவதில்லை. மேலும், ஆந்தையின் சிறகுகளில் உள்ள நுட்பமான பற்கள் போன்ற அமைப்பு, காற்றுயங்கியல் சத்தத்தை எவ்வாறு உறிஞ்சுகிறது என்பதையும் நகட்சு கவனித்தார்.
1997 இல் அறிமுகப்படுத்தப்பட்ட ஷிங்கன்சென் 500 வரிசை (Shinkansen 500 Series) ரயிலின் மூக்குப் பகுதி, மீன்கொத்தியின் அலகின் துல்லியமான காற்றுயங்கியல் வடிவவியலை பிரதிபலிக்கும் வகையில் 15 மீட்டர் நீளமுள்ள கணினிமயமாக்கப்பட்ட அமைப்பாக வடிவமைக்கப்பட்டது. இதன் முடிவுகள் வியக்கத்தக்கதாக இருந்தன:
- சுரங்கப்பாதை வெடிப்புச் சத்தம் முற்றிலும் நீக்கப்பட்டது: ரயில் சட்டப்பூர்வ சுற்றுச்சூழல் சத்த எல்லைகளுக்குள் இயங்க முடிந்தது.
- காற்றுத் தடை (Aerodynamic drag) 30% குறைந்தது.
- மின்சார நுகர்வு 15% குறைந்தது.
- வேகம் 10% அதிகரித்தது, மணித்தியாலத்திற்கு 300 கிலோமீட்டர் வேகத்தில் தொடர்ச்சியான இயக்கத்தைத் தக்கவைத்துக் கொள்ள முடிந்தது.
படம் 3.2: நடைமுறையில் உயிரியல் போலாக்கம் (Biomimicry) — நீரில் பாயும் மீன்கொத்தியின் கூர்மையான அலகு வடிவத்தைக் கொண்டு வடிவமைக்கப்பட்ட ஜப்பானின் ஷிங்கன்சென் 500 வரிசை புல்லட் ரயிலின் காற்றுயங்கியல் மூக்குப்பகுதி. இது சுரங்கப்பாதை வெடிப்புச் சத்தத்தை முற்றிலும் நீக்கி, காற்றுத் தடையை 30% குறைத்தது.
எந்திரவியல் உயிரியல் போலாக்கத்திலிருந்து அறிவாற்றல் உயிரியல் போலாக்கம் வரை: நரம்பியல் நெட்வொர்க்குகள்
ஜப்பானிய பொறியாளர்கள் ரயிலின் காற்றுயங்கியல் சவாலைத் தீர்க்க பறவையின் வடிவத்தைக் கடனாகப் பெற்றது போல, கணினி விஞ்ஞானிகளும் AI வடிவமைப்பாளர்களும் மனித மொழியையும் அறிவாற்றலையும் பிடித்து வைக்க மனித மூளையின் உயிரியல் நரம்பியல் நெட்வொர்க்கைக் கடனாகப் பெற்றனர். இதுவே அறிவாற்றல் உயிரியல் போலாக்கம் (Cognitive Biomimicry) ஆகும்.
மனித மூளையில் சுமார் 86 முதல் 100 பில்லியன் உயிரியல் நரம்பணுக்கள் (neurons) உள்ளன, அவை நூற்றுக்கணக்கான டிரில்லியன் நரம்பு இணைப்புகளால் (synapses) ஒன்றோடொன்று இணைக்கப்பட்டுள்ளன. ஒரு சிறு குழந்தை சொற்களைக் கற்றுக் கொள்ளும்போது, எந்தவொரு விதிக் புத்தகமும் பார்க்கப்படுவதில்லை; மின்-வேதியியல் சமிக்ஞைகள் மூளை வழியே பயணிக்கின்றன, ஒன்றாக இயங்கும் நரம்பணுக்களுக்கு இடையிலான இணைப்புகள் பலமடைகின்றன ("ஒன்றாக இயங்கும் நரம்பணுக்கள், ஒன்றாகவே இணைகின்றன").
பாரம்பரிய மென்பொருளின் கடுமையான விதிகளால் (if-else தர்க்கம்) ஒரு இயந்திரத்திற்கு மொழியைக் கற்பிக்க முடியாது என்பதை கணினிப் பொறியாளர்கள் புரிந்துகொண்டனர். மொழி என்பது மிகவும் நெகிழ்வான, சூழல் சார்ந்த அமைப்பாகும். எனவே, மூளையின் நரம்பணுக்களும் நரம்பு இணைப்புகளும் எவ்வாறு செயல்படுகின்றன என்பதை ஒரு கணினியில் கணிதச் சமன்பாடுகளாக அவர்கள் மறுஉருவாக்கம் செய்தனர். அதுவே செயற்கை நரம்பியல் நெட்வொர்க் (Artificial Neural Network - ANN) ஆகும். இன்று நாம் பேசும் GPTகள் மற்றும் LLMகள் என்பவை பில்லியன்கள் — மற்றும் தற்போது டிரில்லியன்கள் — கணக்கான அளருருக்களைக் (parameters) கொண்ட பிரம்மாண்டமான செயற்கை நரம்பியல் நெட்வொர்க்குகளாகும்.
படம் 3.3: அறிவாற்றல் உயிரியல் போலாக்கம் (Cognitive Biomimicry) — மூளையின் உயிரியல் நரம்பு இணைப்பு மற்றும் மின் சமிக்ஞைகளை (Action potential), செயற்கை நரம்பியல் நெட்வொர்க்கின் கணித அமைப்போடு ஒப்பீடு செய்தல்: உள்ளீட்டு அடுக்கு (Input layer), மறைக்கப்பட்ட அடுக்குகள் 1–3 (Hidden layers), வெளியீட்டு அடுக்கு (Output layer) மற்றும் நரம்பு இணைப்பு எடைகள் (Synaptic weights).
உயிரியல் மூளைக்கும் செயற்கை நரம்பியல் நெட்வொர்க்கிற்கும் (LLM) இடையிலான 1:1 பொறியியல் ஒப்பீடு:
| # | உயிரியல் மூளை | செயற்கை நரம்பியல் நெட்வொர்க் / LLM | பொறியியல் செயல்பாடு |
|---|---|---|---|
| 01 | உயிரியல் நரம்பணு (Biological neuron) | செயற்கை முனை / அடுக்கு (Artificial node / layer) | உள்வரும் சமிக்ஞைகளை ஒருங்கிணைத்து, ஒரு தொழிற்பாட்டுச் சார்பு (activation function) மூலம் முன்னோக்கி அனுப்புகிறது. |
| 02 | நரம்பு இணைப்பு (Synapse) | எடை / அளருரு (Weight / parameter) | இரண்டு முனைகளுக்கு இடையே தகவல்கள் பாயும் வலிமையை நிர்ணயிக்கும் எண் மதிப்பு (நவீன LLMகள் இவற்றில் நூற்றுக்கணக்கான பில்லியன்களைக் கொண்டுள்ளன). |
| 03 | நரம்பு இணைப்பு நெகிழ்வுத்தன்மை (Synaptic plasticity) | பின்னோக்கிப் பரவுதல் & சாய்வு இறக்கம் (Backpropagation & gradient descent) | மாதிரி தவறு செய்யும்போது, அந்தத் தவறைக் குறைக்க அதன் எடைகள் கணிதவியல் ரீதியாகப் புதுப்பிக்கப்படுகின்றன — மாதிரி கற்றுக்கொள்வது இப்படித்தான். |
| 04 | குழந்தைப் பருவக் கற்றல் & அனுபவம் | டிரில்லியன் கணக்கான டோக்கன்களில் முன்-பயிற்சி (Pre-training) | டிரில்லியன் கணக்கான சொற்களையும் வடிவங்களையும் படித்து, மொழி மற்றும் உலகின் நிகழ்தகவு அமைப்பை நெட்வொர்க்கிற்குள் சேமித்தல். |
| 05 | அறிவாற்றல் & பதில் அளித்தல் | யூகிப்பு / அடுத்த டோக்கன் உருவாக்கம் (Inference / next-token generation) | ஒரு புதிய தூண்டல் (prompt) கொடுக்கப்படும்போது, பயிற்சி பெற்ற நெட்வொர்க் மூலம் கணக்கிட்டு, அடுத்தடுத்த சொற்களின் மிகவும் பொருத்தமான வரிசையைத் ፈጣனமாக உருவாக்குகிறது. |
பரிணாம உகப்பாக்கம் (Evolutionary Optimization) மற்றும் முக்கியமான எல்லைக்கோடு
இங்கே இரண்டு ஆழமான தொழில்நுட்பப் பாடங்கள் உள்ளன:
-
இயற்கையின் பொறியியல் உகப்பாக்கம் (Evolutionary Optimization): நெட்வொர்க் கட்டமைப்பின் சக்கரத்தை மனிதகுலம் புதிதாகக் கண்டுபிடிக்க வேண்டியிருக்கவில்லை. நூற்றுக்கணக்கான மில்லியன் ஆண்டுகால இயற்கைத்தேர்வு மூலம், இயற்கை நமது மூளையை ஒரு இணையற்ற உயிரியல் கணினியாகக் கட்டியெழுப்பியது — வெறும் 20 வாட்ஸ் மின்சாரத்தில் அதிகபட்ச வடிவங்களைப் பிடித்து வைக்கிறது. மூளையின் இந்த இணையற்ற திறனின் காரணமாகவே AI விஞ்ஞானிகள் நரம்பியல் நெட்வொர்க்குகளைத் தேர்ந்தெடுத்தனர்.
-
முக்கியமான பொறியியல் எல்லைக்கோடு: இருப்பினும், பொறியியல் தெளிவு கொண்ட ஒரு தலைவராக, நீங்கள் உண்மையான எல்லையையும் அதே தெளிவோடு பார்க்க வேண்டும்:
புல்லட் ரயிலின் மூக்குப் பகுதியை மீன்கொத்தியின் அலகைப் போல வடிவமைப்பதால், அந்த இரும்பு ரயில் சிறகடித்துப் பறக்கும், முட்டையிடும் ஒரு வாழும் மீன்கொத்தியாக மாறிவிடாது! அது தண்டவாளத்தில் ஓடும் ஒரு எந்திரவியல் ரயிலாகவே இருக்கும்.
சரியாக அதே வழியில்: பெரிய மொழி மாதிரிகளை மூளையின் நரம்பியல் அமைப்பைப் போல கணிதவியல் ரீதியாக வடிவமைப்பதால், கணினிக்கு உயிரியல் உணர்வோ, தனிப்பட்ட உணர்ச்சிகளோ, நோக்கமோ அல்லது புரிதலோ வந்துவிடாது. அது செய்வது இன்னமும் ஒரு புள்ளியியல் கணக்கீடே — எடைகளின் நெட்வொர்க் வழியே அணிகளைப் பெருக்குவதன் (matrix multiplications) மூலம் அடுத்த சொல் என்னவாக இருக்கும் என்பதை மதிப்பிடுவதாகும் (P(w_t | w_<t)).
பொது நிர்வாகத்தின் தலைவர்களுக்கு இந்த உண்மையைப் புரிந்துகொள்வது மிகவும் முக்கியமானது: இது AI இன் பிரம்மாண்டமான திறனைப் பயன்படுத்திக் கொள்ள அனுமதிக்கும் அதே வேளையில், அதை ஒரு மனிதனாகப் பாவிக்கும் போலித்தனத்தில் (anthropomorphism) சிக்காமல் நம்மைப் பாதுகாக்கிறது.
3. ஒரு LLM உண்மையில் எவ்வாறு உருவாக்கப்படுகிறது? (கூகுள் தேடலின் உவமை)
இதனைப் புரிந்துகொள்ள, கூகுள் தேடுபொறி எவ்வாறு செயல்படுகிறது என்பதைக் கருத்தில் கொள்ளுங்கள்.
கூகுள் தேடல் உலகளாவிய இணையத்தில் உள்ள அனைத்து வலைத்தளங்களையும் படித்து, அதில் உள்ள சொற்களை ஒரு பெரிய குறியீடாக (index) மாற்றுகிறது. நீங்கள் எதையாவது தேடும்போது, அது அந்த குறியீட்டைப் பார்த்து மிகவும் பொருத்தமான இணைப்பை வழங்குகிறது.
பெரிய மொழி மாதிரிகள் இதே போன்ற தத்துவத்திலேயே இயங்குகின்றன — ஆனால் நூறாயிரக்கணக்கான மடங்கு அதிக சிக்கலான கணிதத் தளத்தில் இயங்குகின்றன:
- மாதிரி இணையத்தில் உள்ள ஏறத்தாழ அனைத்துத் தரவுகளையும், டிஜிட்டல் மயமாக்கப்பட்ட புத்தகங்கள், ஆய்வுத்தாள்கள், அகராதிகள், சட்டப் புத்தகங்கள் மற்றும் உலகளாவிய உரையாடல்களையும் படிக்கிறது.
- அது அந்த உரை முழுவதையும் டோக்கன்கள் (tokens) எனப்படும் சிறிய துண்டுகளாக உடைக்கிறது.
- முன்பு குறிப்பிட்டபடி, கணினிக்கு ஆங்கில எழுத்துக்களோ அல்லது தமிழ் எழுத்துக்களோ புரியாது. எனவே அது ஒவ்வொரு டோக்கனையும் எண் மதிப்புகளாக (numerical values) மாற்றி, மொழியின் பிரம்மாண்டமான கணித மாதிரியை — ஒரு மொழியின் சொற்கள் எவ்வாறு ஒன்றாக இணைய்கின்றன என்பதை — உருவாக்குகிறது.
4. க.பொ.த (உயர் தர) இணைந்த கணிதமும் டிரான்ஸ்ஃபார்மர் மூளையும் (Transformer Brain)
பலர் கேட்கும் ஒரு கேள்வி: "இந்த மாதிரிகளின் மூளை உண்மையில் எவ்வாறு செயல்படுகிறது?"
இங்கே மூளை என்பது பல-அடுக்கு டிரான்ஸ்ஃபார்மர் கட்டமைப்பு (multi-layer Transformer architecture) ஆகும்.
க.பொ.த (உயர் தர) இணைந்த கணிதத்தைப் (Combined Mathematics) படிக்கும் ஒரு இலங்கை மாணவரிடம், அவர்கள் படிக்கும் அணிகளும் (matrices) வெக்டர்களும் (vectors) நிஜ உலகில் எங்கே பயன்படுகின்றன என்று கேட்டால், பலரால் சொல்ல முடியாது. ஆனால் இன்று உலகையே ஆட்டிப்படைக்கும் செயற்கை நுண்ணறிவு சரியாக அந்த கணிதத் தத்துவங்களின் அடிப்படையிலேயே இயங்குகிறது!
படம் 3.4: ஒரு பெரிய மொழி மாதிரியின் (LLM) அடிப்படை கட்டமைப்பு — பாரிய தரவுத்தொகுதி, டோக்கனாக்கம் மற்றும் எம்பேடிங், டிரான்ஸ்ஃபார்மர் மூளை, பயிற்சி செயல்முறை (முன்-பயிற்சி & RLHF) மற்றும் யூகிப்பு வெளியீடு (Inference).
படம் 3.4 இன் ஐந்து படிகளின் ஆழமான பொறியியல் பகுப்பாய்வு:
- படி 1: பாரிய தரவுத்தொகுதி - மூலப்பொருள் (Massive Dataset): * டிஜிட்டல் மயமாக்கப்பட்ட புத்தகங்கள், கலைக்களஞ்சியங்கள், உரை ஆவணங்கள், திறந்த இணையம் மற்றும் நிரலாக்கக் குறியீடுகள். * இந்த பிரம்மாண்டமான தரவுத் தொகுதி சுத்திகரிக்கப்பட்டு (போலித் தரவுகள் மற்றும் நச்சு உள்ளடக்கங்கள் நீக்கப்பட்டு), மாதிரிக்கு வழங்கப்படுகிறது.
- படி 2: தரவு உள்ளீடு, டோக்கனாக்கம் & எம்பேடிங் (Data Input, Tokenization & Embedding): * டோக்கனாக்கி (Tokenizer): வாக்கியங்களையும் பந்திகளையும் சிறிய எழுத்துத் தொகுதிகளாக — டோக்கன்களாக — உடைக்கிறது. * வெக்டர் எம்பேடிங் (Vector embedding): ஒவ்வொரு டோக்கனுக்கும் ஆயிரக்கணக்கான பரிமாணங்களைக் கொண்ட கணித வெளியில் ஆயத்தொலைவுகளைக் (coordinates) ஒதுக்குகிறது. ஒரே மாதிரியான பொருளைக் கொண்ட சொற்கள் — "பிரதேச செயலாளர்" மற்றும் "மாவட்ட செயலாளர்" — அந்த வெளியில் அருகருகே அமைகின்றன.
- படி 3: டிரான்ஸ்ஃபார்மர் கட்டமைப்பு - "மூளை" (Transformer Architecture): * சுய-கவன இயங்குமுறை (Self-attention mechanism): ஒரு வாக்கியத்தில் உள்ள ஒவ்வொரு சொல்லுக்கும் மற்ற சொற்களுக்கும் இடையிலான சூழல் தொடர்பைக் கணக்கிடுகிறது. (உதாரணத்திற்கு: "அவர் அனுமதிப் பத்திரத்தில் கையொப்பமிட்டு அதைச் செயலாளரிடம் கொடுத்தார்" என்பதில், "அதை" என்பது எதனைக் குறிக்கிறது என்பதைக் கண்டறிதல்.) * குறியாக்கி & குறியிறக்கி அடுக்குகள் (Encoder & Decoder layers): உள்ளீட்டைப் புரிந்துகொண்டு, வரிசையில் அடுத்தடுத்த சொற்களை உருவாக்குகின்றன. * கூட்டல் & நெறிமுறை அடுக்குகள் (Add & norm layers): நூற்றுக்கணக்கான நரம்பியல் அடுக்குகள் வழியே தகவல் பாயும்போது கணித சமிக்ஞைகள் மங்கிப்போவதைத் (vanishing gradients) தடுத்து, நிலைத்தன்மையைப் பாதுகாக்கின்றன. * முன்னோக்கு நெட்வொர்க்குகள் (Feed-forward networks - FFN): செயலாக்கப்பட்ட வடிவங்களை நினைவகத்தில் சேமித்து, சிக்கலான அமைப்புகளைப் பிடித்து வைக்கின்றன.
- படி 4: பயிற்சி & கற்றல் செயல்முறை (Training & Learning Process): * முன்-பயிற்சி (Pre-training - மேற்பார்வையற்ற கற்றல்): "அடுத்து என்ன வரும்" என்பதைக் கணிக்கும் போது டிரில்லியன் கணக்கான சொற்களைப் படிக்கிறது. இங்கே மாதிரி மொழியின் முழுமையான இலக்கணம் மற்றும் தர்க்கத்தை உறிஞ்சுகிறது. * மனித பின்னூட்டத்துடன் நுண்-சரிசெய்தல் (RLHF): மனித வல்லுநர்கள் மாதிரியின் பதில்களை மதிப்பிட்டு, அதை உகந்ததாகவும், பாதுகாப்பானதாகவும், மரியாதையானதாகவும் மற்றும் உண்மையாகவும் மாற்றி — அரசுப் பணித் தரநிலைகள் உட்பட மனித விருப்பங்களுக்கு ஏற்ப சீரமைக்கிறார்கள்.
- படி 5: யூகிப்பு & உரை உருவாக்கம் (Inference & Text Generation): * பயனரின் தூண்டல் (prompt) கொடுக்கப்பட்டதும், மாதிரி உடனடியாக நிகழ்தகவு குறியிறக்கம் மற்றும் மாதிரி உத்திகளைப் பயன்படுத்தி (temperature, top-p) மிகவும் பொருத்தமான வெளியீட்டை உருவாக்குகிறது.
5. முன்-பயிற்சி (Pre-training) மற்றும் மனித பின்னூட்ட வழியிலான வலுவூட்டல் கற்றல் (RLHF)
ஒரு மாதிரி ஒரே இரவில் புத்திசாலியாக மாறிவிடாது. அது ஒரு பிரம்மாண்டமான, படிமுறைப் பயிற்சி செயல்முறை மூலமே உருவாக்கப்படுகிறது:
- முன்-பயிற்சி (Pre-training): * மாதிரிக்கு பில்லியன் கணக்கான வாக்கியங்கள் கொடுக்கப்பட்டு, அதில் ஒரு சொல் மறைக்கப்பட்டு, விடுபட்ட அல்லது அடுத்த சொல்லைக் கணிக்க வைக்கப்படுகிறது. * அது தவறாகக் கணிக்கும் போது, அது கணிதவியல் ரீதியாகத் தண்டிக்கப்பட்டு (backpropagation) அதன் எடைகள் சரிசெய்யப்படுகின்றன. அது சரியாகக் கணிக்கும் போது, அந்த வடிவம் வலுப்படுத்தப்படுகிறது. * இந்த வழியில் டிரில்லியன் கணக்கான முறை பயிற்சி அளிக்கப்படும் போது, மனித மொழியில் பொதிந்துள்ள இலக்கணம், தர்க்கம் மற்றும் அறிவை மாதிரி வியக்கத்தக்க வகையில் பெற்றுக்கொள்கிறது.
- மனித பின்னூட்ட வழியிலான வலுவூட்டல் கற்றல் (Reinforcement Learning from Human Feedback - RLHF): * மனித மதிப்பீட்டாளர்கள் மாதிரியின் பதில்களை மதிப்பிட்டு, அதை மேலும் மரியாதையானதாகவும், பயனுள்ளதாகவும் மற்றும் துல்லியமானதாகவும் மாற்ற வழிகாட்டுகிறார்கள்.
6. உண்மைக்கான இயந்திரம் அல்ல, சாத்தியக்கூறுக்கான இயந்திரமே (A Plausibility Engine, Not a Truth Engine)
ஒரு அரச அதிகாரியாக, உங்கள் மனதில் நிரந்தரமாகப் பதிய வைக்க வேண்டிய முதன்மையான பொறியியல் உண்மை இதுவே:
Warning
ஒரு LLM என்பது உண்மையைக் கண்டறியும் சரிபார்ப்பு இயந்திரம் அல்ல. அது அடுத்ததாக வரக்கூடிய மிகவும் சாத்தியமான சொல்லைக் கணிக்கும் ஒரு நிகழ்தகவு இயந்திரமாகும் (probability engine).
எது உண்மை, எது பொய் என்ற உள் உணர்வு மாதிரிக்குக் கிடையாது. நீங்கள் அதனிடம் ஒரு கேள்வியைக் கேட்கும்போது, அது உண்மைச் சேமிப்பகத்திலிருந்து தகவல்களைச் சரிபார்ப்பதில்லை; மாறாக, கணித நிகழ்தகவின் அடிப்படையில் மட்டுமே உங்கள் கேள்விக்குப் பதிலாக அமையக்கூடிய மிகவும் சாத்தியமான, மிகவும் சரளமான சொற்களின் வரிசையை உருவாக்குகிறது.
இதனால்தான், ஒரு மாதிரிக்கு ஒரு உண்மை தெரியாதபோது கூட, அது எவ்விதத் தயக்கமுமின்றி, மிகவும் நேர்த்தியான உத்தியோகபூர்வ நடையில் முற்றிலும் புனையப்பட்ட பொய்களைக் (hallucination) கட்டவிழ்த்து விடுகிறது. எனவேதான், ஒரு அதிகாரி மாதிரியின் வடிவத்தைக் கண்டு மயங்காமல், அதன் உண்மையை எப்போதும் சரிபார்க்க வேண்டும்.
7. மொழிச் சாய்வும் புவிசார் அரசியலும்: மாதிரிகள் ஏன் வேறுபடுகின்றன?
எங்களது அமர்வுகளில், அதிகாரிகள் நியாயமான ஒரு குறையை எழுப்புகிறார்கள்: "ஐயா, நாங்கள் ChatGPT இடம் சிங்களத்திலோ அல்லது தமிழிலோ ஏதேனும் கேட்டால், சில நேரங்களில் குழப்பமான பதில்கள் வருகின்றன. ஆனால் ஆங்கிலத்தில் கேட்டால் பதில் மிக அற்புதமாக இருக்கிறது. ஏன்?"
இதற்குக் காரணம் இந்த மாதிரிகளுக்குப் பயிற்சியளிக்கப்பட்ட தரவுகளில் உள்ள பிரம்மாண்டமான மொழியியல் மற்றும் கலாச்சாரச் சாய்வாகும் (bias):
- மேற்கத்திய ஆங்கில ஆதிக்கம் (Western Knowledge Bias): * ChatGPT மற்றும் Claude போன்ற அமெரிக்க மாதிரிகள் பெரும்பாலும் மேற்கத்திய உலகத்தைச் சேர்ந்த ஆங்கில இலக்கியங்கள், சட்டங்கள் மற்றும் தரவுகளிலேயே பயிற்சி அளிக்கப்பட்டுள்ளன. கீழ் திசைக் கலாச்சாரம், இலங்கையின் சுற்றறிக்கைகள் அல்லது நமது கிராமப்புற வாழ்க்கை முறை பற்றிய மிகச் சிறிய அளவிலான தரவுகளே அவற்றிடம் உள்ளன.
- Google Gemini இன் சிங்கள மற்றும் தமிழ் சாதகத்தன்மை: * பிற அமெரிக்க மாதிரிகளுடன் ஒப்பிடும்போது, Google Gemini இலங்கை மொழிகளில் கணிசமான முன்னிலையைக் கொண்டுள்ளது. இருபது ஆண்டுகளுக்கும் மேலாக, கூகுள் இலங்கையின் சிங்கள மற்றும் தமிழ் வலைத்தளங்கள், செய்தி அறிக்கைகள் மற்றும் தேடல் சொற்களைக் குறியீடீடு (indexing) செய்து வருகிறது. எனவே Gemini இன் இலக்கணமும் சொல் பயன்பாடும் ஒப்பீட்டளவில் துல்லியமாக உள்ளன.
- சீனாவின் DeepSeek இன் ரகசியம்: * சீனாவின் DeepSeek உடன் தமிழில் அல்லது சிங்களத்தில் பணியாற்றிப் பாருங்கள், அது ஆச்சரியமளிக்கும் வகையில் சரளமாக இருப்பதை உணர்வீர்கள். காரணம்: சீன மொழி என்பது ஆங்கிலத்தைப் போல எளிய எழுத்துக்களைக் கொண்டதல்ல, அது மிகவும் சிக்கலான சித்திர எழுத்துக்கள் (ideographic characters) மற்றும் தொனி வடிவங்களைக் கொண்ட அமைப்பாகும். சீன மொழியிலும் பிற ஆங்கிலம் அல்லாத பன்மொழித் தரவுகளிலும் ஆழமாகப் பயிற்சி பெற்ற DeepSeek, நமது உள்நாட்டு மொழிகளின் சிக்கலான வாக்கிய அமைப்புகளுக்கு எளிதில் தகவமைத்துக் கொள்ளும் இயல்பான திறனைக் கொண்டுள்ளது.
- தமிழிற்கும் சிங்களத்திற்கும் இடையிலான வேறுபாடு: * தமிழில் பணியாற்றும் இலங்கை அதிகாரிகளுக்கு AI கருவிகள் ஒப்பீட்டளவில் எளிதானவை. தமிழ்நாடு மற்றும் உலகம் முழுவதும் உள்ள பல கோடி தமிழ் பேசும் மக்கள் இணையத்தில் பிரம்மாண்டமான தமிழ் இலக்கியங்களையும் டிஜிட்டல் தரவுகளையும் உருவாக்கியுள்ளனர். * ஆனால் சிங்கள மொழி நமது நாட்டில் உள்ள சுமார் இரண்டு கோடி மக்களால் மட்டுமே பேசப்படுகிறது. இணையத்தில் நாம் பங்களித்த டிஜிட்டல் சிங்கள உள்ளடக்கங்கள் மிகவும் வரம்பிற்குட்பட்டவை. எனவே, சிங்களத்தில் AI ஐப் பயன்படுத்தும்போது நாம் மிகவும் விழிப்புடன் இருக்க வேண்டும். தமிழ் மொழியிலும் அதிகாரபூர்வப் பயன்பாட்டின் போது துல்லியத்தைச் சரிபார்ப்பது அவசியமாகும்.
8. பல்தொகுதி ஒருங்கமைப்பும் உலகளாவிய வெக்டர் வெளியும் (Multimodal AI Systems)
இன்று இந்த மாதிரிகள் உரையுடன் (text) மட்டும் நின்றுவிடுவதில்லை. நவீன முன்னணி மாதிரிகள் முழுமையான பல்தொகுதி அமைப்புகளாக (multimodal systems) இயங்குகின்றன.
படம் 3.5: பல்தொகுதி உற்பத்தித் திறன் AI அமைப்பின் கட்டமைப்பு — பல்தொகுதி தரவு உள்ளீடு (உரை, புகைப்படங்கள், வீடியோக்கள், ஒலி, நிரலாக்கக் குறியீடு), ஒருங்கிணைக்கப்பட்ட பன்மான வெக்டர் வெளி (Unified multidimensional vector space), பல-முனை டிரான்ஸ்ஃபார்மர் மற்றும் பல்தொகுதி வெளியீடு.
படம் 3.5 இன் பல்தொகுதி அமைப்பின் பகுப்பாய்வு:
- பாரிய பல்தொகுதி தரவுத்தொகுதி (Massive Multimodal Dataset): * உரை ஆவணங்கள், புகைப்படங்கள், வீடியோக்கள், ஒலிப்பதிவுகள் மற்றும் கணினி நிரலாக்கக் குறியீடுகள்.
- பல்தொகுதி உட்கொள்ளல் & டோக்கனாக்கம் (Multimodal Ingestion & Tokenization): * பழைய அமைப்புகளைப் போலல்லாமல், இங்கே ஒரு படம் முதலில் உரையாக மாற்றப்படுவதில்லை (உரை-இடைநிலைத் தடை எதுவும் இல்லை). * புகைப்படங்கள் மற்றும் வீடியோ சட்டகங்கள் நேரடியாக சிறிய பிக்சல் தொகுதிகளாக (16×16) காட்சி டோக்கன்களாக உடைக்கப்படுகின்றன; ஒலி அலைகள் அதிர்வெண் ஸ்பெக்ட்ரோகிராம்கள் மூலம் ஒலி டோக்கன்களாக மாறுகின்றன.
- ஒருங்கிணைக்கப்பட்ட பன்மான வெக்டர் வெளி (Unified Multimodal Vector Space): * இதுவே இந்த அமைப்பின் மிகச்சிறந்த பொறியியல் சாதனையாகும்! * ஓர் இலங்கை தேசிய அடையாள அட்டையின் புகைப்படம் (காட்சித் துண்டு), "ஜாதிக ஹெந்துனும்பத" அல்லது "தேசிய அடையாள அட்டை" என்று பேசப்பட்ட ஒலி அலை, மற்றும் "National Identity Card" என்ற ஆங்கில உரை ஆகிய அனைத்தும் இந்த பன்மான கணித வெளியில் ஒரே ஆயத்தொலைவுப் பகுதிக்குள் அமைகின்றன. எனவே இயந்திரத்தால் எவ்வித தடைகளுமின்றி வெவ்வேறு வடிவங்களுக்கு இடையே ஒப்பீடு செய்ய முடிகிறது.
- பல-முனை குறுக்கு-கவனக் கட்டமைப்பு (Multi-Headed Cross-Attention Architecture): * குறுக்கு-கவனம் வெவ்வேறு வடிவங்களுக்கு இடையே இயங்குகிறது: ஒரு ஸ்கேன் செய்யப்பட்ட உறுதிப்பத்திரத்தில் உள்ள கையொப்பத்தை ஆராயும்போது, மாதிரியானது உரையில் எழுதப்பட்ட நில உரிமையாளரின் பெயரை ஒரே நேரத்தில் ஒப்பிட முடியும்.
- பல்தொகுதி முன்-பயிற்சி & RLHF: * அடுத்த தரவு வகையைக் கணிப்பதன் மூலம் கலப்பு வீடியோ, ஒலி மற்றும் உரை ஆகியவற்றில் பயிற்சி அளித்தல். * போலி ஊடகங்களுக்கு எதிரான பாதுகாப்பு அரண்கள் மற்றும் வடிகட்டிகள் (போலி வீடியோக்களுக்கு - deepfakes எதிரான பல்தொகுதி பாதுகாப்பு சீரமைப்பு).
- உலகளாவிய உருவாக்கம் & வெளியீடு (Universal Generation & Output): * பயனர் எந்த வடிவத்திலும் ஒரு கேள்வியை முன்வைக்கலாம் (எடுத்துக்காட்டாக, ஒரு முறைப்பாட்டின் ஒலிப்பதிவு மற்றும் பேரழிவு சேதத்தின் புகைப்படம்). * இந்த அமைப்பு, முறையின் தேவைக்கேற்ப ஒரு அதிகாரப்பூர்வ அறிக்கை, சேதம் குறிக்கப்பட்ட வரைபடம் அல்லது இயங்கும் நிரலாக்கக் குறியீடு ஆகியவற்றை உருவாக்குகிறது.
அரசு அதிகாரிக்கான நடைமுறை மதிப்பு:
- பழைய கையால் எழுதப்பட்ட காணி உறுதிப்பத்திரம் அல்லது கடிதத்தைப் புகைப்படமெடுத்து, அதன் உள்ளடக்கங்களை நொடிப்பொழுதில் வாசித்தல் (Vision OCR).
- பொதுமக்களுக்கான நாளில், ஒரு குடிமகனின் வாய்மொழி முறையீட்டைப் பதிவுசெய்து, உடனடி அதிகாரப்பூர்வ விசாரணை குறிப்பை உருவாக்குதல்.
- ஒரு சிக்கலான அபிவிருத்தித் திட்டத்தின் வரைபடம் அல்லது விளக்கப்படத்தை உள்ளீடு செய்து, அதில் உள்ள முரண்பாடுகளை அடையாளம் காணுதல்.
அடுத்த அத்தியாயத்தில், இந்த இயற்கை மொழிப் புரட்சியானது மானுடவியல் துறைகளை (humanities) எவ்வாறு மீண்டும் மையக் கட்டத்திற்கு கொண்டு வருகிறது என்பதையும், சாதாரண குடிமகன் எதிர்கொள்ளும் டிஜிட்டல் இடைவெளியை AI எவ்வாறு குறைக்கிறது என்பதையும் விவாதிப்போம்.