பிற மொழிகளில்: English · සිංහල

CM-02: பெரு மொழி மாதிரிகள் (LLMs), நரம்பியல் வலைப்பின்னல்கள் மற்றும் அறிவாற்றல் உயிர்முன்னுதாரணம் (Cognitive Biomimicry)

முக்கியக் கருப்பொருள்: ஒரு பெரு மொழி மாதிரி (LLM) என்பது உண்மை சேமித்து வைக்கப்பட்டுள்ள ஒரு கலைக்களஞ்சியம் அல்ல. மாறாக, அது மனித மொழியின் வடிவங்களைக் கணித வெக்டர்களாகவும் அணிகளாகவும் (vectors and matrices) கைப்பற்றி, அடுத்தபடியாக வரக்கூடிய மிகச் சாத்தியமான வார்த்தையைக் கணித்துக் கூறும் ஒரு சக்திவாய்ந்த நிகழ்தகவு இயங்குதளமாகும் (probabilistic engine).


1. கருத்துரு படிநிலை கட்டமைப்பு: AI, ஆக்கபூர்வ AI, LLM மற்றும் GPT

பொதுவான உரையாடல்களில் பெரும்பாலானோர் AI, ஆக்கபூர்வ AI (Generative AI), LLM மற்றும் ChatGPT ஆகிய சொற்களை ஒன்றை ஒன்று மாற்றீடாகப் பயன்படுத்துகின்றனர். ஆனால் பொறியியல் ரீதியாகப் பார்த்தால், அவற்றுக்கிடையே தெளிவானதொரு படிநிலைத் தொடர்பு உள்ளது:

LLM மற்றும் GPT படிநிலை கட்டமைப்பு படம் 3.1: AI முதல் GPT வரையிலான கருத்துரு படிநிலை கட்டமைப்பு — செயற்கை நுண்ணறிவு (AI) → ஆக்கபூர்வ AI (Generative AI) → பெரு மொழி மாதிரிகள் (LLMs) → உருவாக்க முந்தைய பயிற்சியளிக்கப்பட்ட டிரான்ஸ்ஃபார்மர்கள் (GPT).

  • செயற்கை நுண்ணறிவு (Artificial Intelligence - AI): மனித நுண்ணறிவைக் கணினிகள் மாதிரியாக்கம் செய்யும் ஒட்டுமொத்தப் பரந்த துறை — இதுவே அனைத்துக்கும் மேலான ஒரு குடையாகும்.
  • ஆக்கபூர்வ AI (Generative AI): நிலவும் தரவுகளை வகைப்படுத்துவதோடு நின்றுவிடாமல், புதிய உள்ளடக்கங்களை (உரை, படங்கள், கணினி நிரல்கள், ஒலிப்பதிவுகள்) உருவாக்கும் AI இன் ஒரு துணைப்பிரிவு.
  • பெரு மொழி மாதிரிகள் (Large Language Models - LLMs): ஒரு முழுமையான மொழியையே உட்கொண்டு — அதாவது உலகளவில் டிஜிட்டல் மயமாக்கப்பட்ட அனைத்து இலக்கியங்களையும் எழுத்துக்களையும் படித்து — மனித மொழியின் அமைப்புகளையும் வடிவங்களையும் கணித ரீதியாகக் கண்டறிந்த பிரமாண்டமான மாதிரிகள்.
  • GPT (Generative Pre-trained Transformer): பெரு மொழி மாதிரிகளை உருவாக்கப் பயன்படும் மிக வெற்றிகரமான மற்றும் புரட்சிகரமான நரம்பியல் வலைப்பின்னல் கட்டமைப்பு (neural network architecture). இந்த டிரான்ஸ்ஃபார்மர் புரட்சியானது 2017 ஆம் ஆண்டில் கூகுள் ஆராய்ச்சியாளர்களால் வெளியிடப்பட்ட வரலாற்றுச் சிறப்புமிக்க Vaswani et al. (2017) — "Attention Is All You Need" என்ற ஆய்வுக் கட்டுரையுடன் தொடங்கியது. இன்று, OpenAI-இன் ChatGPT, Google Gemini, Anthropic Claude, மற்றும் DeepSeek ஆகிய அனைத்துமே இந்த டிரான்ஸ்ஃபார்மர் கோட்பாட்டின் அடிப்படையிலேயே இயங்குகின்றன. (இதன் முழுமையான தொழில்நுட்பப் பரிணாம வளர்ச்சி பற்றிய விபரம் இடசர அகாடமியின் ஆக்கபூர்வ AI இன் பரிணாமப் பயணம்: 2017 முதல் 2035 வரை என்ற கட்டுரையில் விரிவாகக் குறிப்பிடப்பட்டுள்ளது.)

2. இயற்கையின் வரைபடம், ஜப்பானின் தோட்டா ரயில் மற்றும் நரம்பியல் வலைப்பின்னல்கள் (உயிர்முன்னுதாரணத்திலிருந்து நரம்பியல் வலைப்பின்னல்களுக்கு)

இங்கு நாம் ஒரு முக்கியமான பொறியியல் கேள்வியைக் கேட்க வேண்டும்: மொழியைப் புரிந்துகொள்வதற்கும் உருவாக்குவதற்கும் கணினி விஞ்ஞானிகள் ஏன் "நரம்பியல் வலைப்பின்னல்களை" (neural networks) தேர்ந்தெடுத்தார்கள்?

இதற்கான விடை, பொறியியல் துறையின் மிகவும் அமைதியான ஆனால் புரட்சிகரமான ஒரு கருத்தாக்கத்தில் உள்ளது: உயிர்முன்னுதாரணம் (Biomimicry). உயிர்முன்னுதாரணம் என்பது, மில்லியன் கணக்கான ஆண்டுகால பரிணாம வளர்ச்சியில் இயற்கை செம்மைப்படுத்திய மாதிரிகள், வடிவங்கள் மற்றும் வழிமுறைகளைக் கடனாகப் பெற்று மனிதகுலத்தின் கடினமான தொழில்நுட்பச் சவால்களுக்குத் தீர்வு காண்பதாகும்.

ஜப்பானின் ஷிங்கான்சென் தோட்டா ரயிலும் மீன்கொத்தியின் பாடமும்

உயிர்முன்னுதாரணத்திற்கு வரலாற்று ரீதியாகச் சிறந்தவொரு நடைமுறைச் சான்று 1990களில் ஜப்பானில் நடந்த நிகழ்வாகும்.

ஜப்பானின் அதிவேக ஷிங்கான்சென் (Shinkansen) தோட்டா ரயில்கள் மணிக்கு 300 கிலோமீட்டர் வேகத்தைத் தாண்டியபோது, அவை கடுமையான காற்றியக்க மற்றும் சுற்றுச்சூழல் நெருக்கடியை எதிர்நோக்கின. ஒரு ரயில் அதிவேகமாக ஒரு குறுகிய சுரங்கப்பாதைக்குள் நுழையும் போது, அது சுரங்கப்பாதைக்குள் இருக்கும் காற்றை ஒரு பிஸ்டனைப் போல அழுத்தியது. அந்த அழுத்தப்பட்ட காற்று அலை சுரங்கப்பாதையின் மறுமுனையிலிருந்து பேரிரைச்சலுடன் — இடிமுழக்கம் போன்ற வெடிப்புச் சத்தத்துடன் — வெளியேறியது. இது "சுரங்கப்பாதை வெடிப்புச் சத்தம்" (sonic tunnel boom) எனப்பட்டது. இந்த இரைச்சல் ஒரு கிலோமீட்டர் தொலைவில் உள்ள கிராமத்து வீடுகளின் ஜன்னல்களை அதிரவைத்ததுடன், அப்பகுதி மக்களைப் பெரும் இன்னலுக்கு உள்ளாக்கியது. சட்டரீதியான ஒலி வரம்புகள் மீறப்பட்டதால், பொறியாளர்கள் ரயில்களின் வேகத்தைக் குறைக்க நிர்ப்பந்திக்கப்பட்டனர்.

இதற்கான தீர்வு ஏஜி நகட்சு (Eiji Nakatsu) என்ற பொறியாளரிடமிருந்து வந்தது. அவர் JR-West ரயில்வே நிறுவனத்தின் தலைமைத் தொழில்நுட்பப் பொறியாளராகவும், ஒரு தீவிரப் பறவை பார்வையாளராகவும் இருந்தார்.

இயற்கையைக் கவனித்த நகட்சு ஒரு அசாதாரணமான கேள்வியை எழுப்பினார்: "குறைந்த அடர்த்தி கொண்ட காற்றிலிருந்து அதிக அடர்த்தி கொண்ட தண்ணீருக்குள் எந்தவொரு நீர் தெளிப்பும் இன்றி, அலையின்றி, சத்தமின்றி அதிவேகத்தில் பாயும் உயிரினம் எது?"

அதற்கான விடை: மீன்கொத்தி (Kingfisher).

ஒரு மீன்கொத்தி வானத்திலிருந்து மீனை நோக்கிப் பாயும்போது, அதன் நீண்ட, கூம்பு வடிவ, சீரான அலகு நீரின் எதிர்ப்பை இருபுறமும் மென்மையாகப் பிளந்து செல்ல அனுமதிக்கிறது. இதன் விளைவு: எவ்வித நீர தெளிப்போ, எதிர்ப்பின் அதிர்ச்சியோ இருப்பதில்லை. அத்துடன், ஆந்தையின் சிறகுகளில் உள்ள நுட்பமான பற்கள் போன்ற அமைப்பு எவ்வாறு காற்றியக்க இரைச்சலை உறிஞ்சுகிறது என்பதையும் நகட்சு அவதானித்தார்.

1997 இல் அறிமுகப்படுத்தப்பட்ட ஷிங்கான்சென் 500 தொடரின் (Shinkansen 500 Series) 15 மீட்டர் நீளமுள்ள மூக்குப் பகுதி, மீன்கொத்தியின் அலகின் துல்லியமான காற்றியக்கவியல் வடிவத்தைக் கணக்கிட்டு வடிவமைக்கப்பட்டது. இதன் முடிவுகள் வியக்கத்தக்கவையாக இருந்தன:

  1. சுரங்கப்பாதை வெடிப்புச் சத்தம் முற்றிலும் நீக்கப்பட்டது — ரயிலால் சட்டரீதியான சுற்றுச்சூழல் ஒலி வரம்புகளுக்குள் இயங்க முடிந்தது.
  2. காற்றியக்கத் தடை (Aerodynamic drag) 30% குறைந்தது.
  3. மின்சார நுகர்வு 15% குறைந்தது.
  4. வேகம் 10% அதிகரித்தது, மணிக்கு 300 கி.மீ வேகத்தில் தொடர்ச்சியாக இயங்கும் திறன் நிலைநாட்டப்பட்டது.

ஜப்பானின் ஷிங்கான்சென் தோட்டா ரயிலும் மீன்கொத்தியின் உயிர்முன்னுதாரணமும் படம் 3.2: நடைமுறையில் உயிர்முன்னுதாரணம் — பாயும் மீன்கொத்தியின் கூம்பு வடிவ அலகு மாதிரியைக் கொண்டு மறுவடிவமைப்பு செய்யப்பட்ட ஜப்பானின் ஷிங்கான்சென் 500 தொடர் தோட்டா ரயிலின் காற்றியக்க மூக்குப்பகுதி. இது சுரங்கப்பாதை வெடிப்புச் சத்தத்தை முற்றிலும் நீக்கியதுடன், காற்றியக்கத் தடையை 30% குறைத்தது.


இயந்திரவியல் உயிர்முன்னுதாரணத்திலிருந்து அறிவாற்றல் உயிர்முன்னுதாரணத்திற்கு: நரம்பியல் வலைப்பின்னல்கள்

ஜப்பானிய பொறியாளர்கள் ஒரு ரயிலின் காற்றியக்கப் பிரச்சினையைத் தீர்க்க ஒரு பறவையின் வடிவத்தைக் கடனாகப் பெற்றது போலவே, கணினி விஞ்ஞானிகளும் AI வடிவமைப்பாளர்களும் மனித மொழியையும் அறிவாற்றலையும் புரிந்துகொள்ள மனித மூளையின் உயிரியல் நரம்பியல் வலைப்பின்னலைக் கடனாகப் பெற்றனர். இதுவே அறிவாற்றல் உயிர்முன்னுதாரணம் (Cognitive Biomimicry) எனப்படுகிறது.

மனித மூளையில் தோராயமாக 86 முதல் 100 பில்லியன் உயிரியல் நரம்பணுக்கள் (neurons) உள்ளன, அவை நூற்றுக்கணக்கான டிரில்லியன் நரம்பு இணைப்புகளால் (synapses) இணைக்கப்பட்டுள்ளன. ஒரு சிறு குழந்தை வார்த்தைகளைக் கற்கும்போது, எந்த விதிகளின் புத்தகமும் படிக்கப்படுவதில்லை; மாறாக மின்-வேதியியல் சமிக்ஞைகள் மூளையின் வழியே பயணிக்கின்றன, ஒன்றாக இயங்கும் நரம்பணுக்களுக்கு இடையிலான இணைப்புகள் வலுவடைகின்றன ("ஒன்றாக இயங்கும் நரம்பணுக்கள், ஒன்றாகவே பிணைக்கப்படுகின்றன" - neurons that fire together, wire together).

பாரம்பரிய மென்பொருட்களின் நிபந்தனை தர்க்கங்கள் (if-else logic) போன்ற கடுமையான விதிகளை எழுதுவதன் மூலம் ஒரு இயந்திரத்திற்கு மொழியைக் கற்பிக்க முடியாது என்பதை கணினிப் பொறியாளர்கள் உணர்ந்தனர். மொழி என்பது மிகவும் நெகிழ்வான, சூழலுக்கு ஏற்ப மாறும் அமைப்பாகும். எனவே, மூளையின் நரம்பணுக்களும் நரம்பு இணைப்புகளும் இயங்கும் முறையைக் கணிதச் சமன்பாடுகளாக அவர்கள் மறுஉருவாக்கம் செய்தனர். அதுவே செயற்கை நரம்பியல் வலைப்பின்னல் (Artificial Neural Network - ANN) ஆகும். இன்று நாம் பேசும் GPT மற்றும் LLMகள் என்பவை பில்லியன்கணக்கான — தற்போது டிரில்லியன்கணக்கான — அளருருக்களைக் (parameters) கொண்டு கணினிகளில் கட்டியெழுப்பப்பட்ட பிரமாண்டமான செயற்கை நரம்பியல் வலைப்பின்னல் அமைப்புகளேயாகும்.

உயிரியல் நரம்பு இணைப்பிலிருந்து செயற்கை நரம்பியல் வலைப்பின்னலுக்கு படம் 3.3: அறிவாற்றல் உயிர்முன்னுதாரணம் — மனித மூளையின் உயிரியல் நரம்பு இணைப்பு மற்றும் மின் சமிக்ஞை பரிமாற்றம் (Biological Synapse & Action Potential) ஆகியவற்றை, செயற்கை நரம்பியல் வலைப்பின்னலின் (ANN) கணிதரீதியாக அமைக்கப்பட்ட உள்ளீட்டு அடுக்கு, மறைக்கப்பட்ட அடுக்குகள் (1–3), வெளியீட்டு அடுக்கு மற்றும் நரம்பு இணைப்பு எடைகளுடன் நேரடி ஒப்பீடு செய்தல்.

உயிரியல் மூளைக்கும் செயற்கை நரம்பியல் வலைப்பின்னலுக்கும் (LLM) இடையிலான 1:1 பொறியியல் ஒப்பீடு:

# உயிரியல் மூளை செயற்கை நரம்பியல் வலைப்பின்னல் / LLM பொறியியல் தொழிற்பாடு
01 உயிரியல் நரம்பணு (Biological Neuron) செயற்கை கணு / அடுக்கு (Artificial Node / Layer) சமிக்ஞை உள்ளீடுகளை ஒன்றுதிரட்டி, ஒரு தொழிற்பாட்டுச் சார்பு (activation function) மூலம் அடுத்த கணுக்களுக்குக் கடத்துகிறது.
02 நரம்பு இணைப்பு (Synapse - இணைப்பு) எடை / அளபுரு (Weight / Parameter) இரண்டு கணுக்களுக்கு இடையிலான தகவல் ஓட்டத்தின் வலிமையை தீர்மானிக்கும் எண் மதிப்பு (நவீன LLMகள் இவற்றில் நூற்றுக்கணக்கான பில்லியன்களைக் கொண்டுள்ளன).
03 நரம்பு இணைப்பு நெகிழ்வுத்தன்மை (Synaptic Plasticity) பின்பரப்பல் & சாய்வு இறக்கம் (Backpropagation & Gradient Descent) மாதிரி தவறு செய்யும்போது, அந்தத் தவறை மிகக் குறைந்த அளவாக மாற்ற வலைப்பின்னலின் எடைகள் கணிதரீதியாக புதுப்பிக்கப்படுகின்றன — மாதிரி கற்றுக்கொள்ளும் விதம் இதுவே.
04 குழந்தைப்பருவ அனுபவமும் கற்றலும் டிரில்லியன்கணக்கான டோக்கன்களிலான முன்-பயிற்சி (Pre-training) டிரில்லியன்கணக்கான வார்த்தைகளையும் வடிவங்களையும் படிப்பதன் மூலம், வலைப்பின்னல் மொழி மற்றும் உலகின் நிகழ்தகவு வடிவங்களைத் தனக்குள்ளே சேமித்துக்கொள்கிறது.
05 அறிவாற்றலும் பதிலளிப்பும் அனுமானம் / அடுத்த டோக்கன் உருவாக்கம் (Inference / Next-Token Generation) ஒரு புதிய தூண்டல் (prompt) வரும்போது, பயிற்சி பெற்ற வலைப்பின்னல் கணக்கிட்டு, அடுத்த வார்த்தைகளின் மிகவும் பொருத்தமான வரிசையைத் கணப்பொழுதில் உருவாக்குகிறது.

பரிணாம உகப்பாக்கமும் முக்கியமான எல்லைக்கோடும்

இங்கு இரண்டு ஆழமான தொழில்நுட்பப் பாடங்கள் உள்ளன:

  1. இயற்கையின் பொறியியல் உகப்பாக்கம் (Evolutionary Optimization): மனிதகுலம் சக்கரத்தையோ அல்லது வலைப்பின்னல் கட்டமைப்பையோ புதிதாகக் கண்டுபிடிக்க வேண்டியிருக்கவில்லை. நூற்றுக்கணக்கான மில்லியன் ஆண்டுகால இயற்கைத்தேர்வு மூலம், இயற்கை நமது மூளையை ஒரு இணையற்ற உயிரியல் கணினியாக உருவாக்கியுள்ளது: வெறும் 20 வாட்ஸ் மின்சாரத்தில் அதிகபட்ச வடிவங்களைக் கைப்பற்றும், அறியப்பட்ட பிரபஞ்சத்திலேயே மிகவும் ஆற்றல் திறன்மிக்க இயந்திரங்களில் ஒன்றாக அது திகழ்கிறது. AI விஞ்ஞானிகள் நரம்பியல் வலைப்பின்னல்களைத் தேர்ந்தெடுத்ததற்குக் காரணமே அந்தச் செம்மைப்படுத்தப்பட்ட செயல்திறனே ஆகும்.

  2. முக்கியமான பொறியியல் எல்லை: இருப்பினும், பொறியியல் தெளிவு கொண்ட ஒரு தலைவராக, நீங்கள் உண்மையான எல்லையைத் தெளிவாகப் பார்க்க வேண்டும்:

    தோட்டா ரயிலின் மூக்குப்பகுதியை மீன்கொத்தியின் அலகு போல வடிவாக்குவது, அந்த இரும்பு ரயிலைச் சிறகடித்துப் பறந்து முட்டையிடும் ஒரு வாழும் மீன்கொத்தியாக மாற்றிவிடாது. அது தண்டவாளத்தில் ஓடும் ஒரு இயந்திர ரயிலாகவே இருக்கும்.

அதே வழியில், மூளையின் நரம்பியல் அமைப்பின் வரைபடத்தைக் கொண்டு கணிதரீதியாகப் பெரு மொழி மாதிரியொன்றைக் உருவாக்குவது, அந்த கணினி மாதிரிக்கு உயிரியல் உணர்வையோ, சுய அறிவையோ, எண்ணத்தையோ அல்லது புரிதலையோ வழங்கிவிடாது. அது செய்வது இன்னமும் ஒரு புள்ளியியல் கணக்கீடே ஆகும் — ஒரு நரம்பியல் வலைப்பின்னலின் கணித எடைகள் மூலம் (P(w_t | w_<t)), அடுத்த வார்த்தை என்னவாக இருக்கும் என்பதை மதிப்பிடுவது மட்டுமே.

இந்த நிதர்சனத்தைப் புரிந்துகொள்வது எந்தவொரு தலைவருக்கும் அல்லது தொழில்வல்லுநருக்கும் தீர்மானகரமானது: இது AI இன் மகத்தான செயல்திறனை அறுவடை செய்ய உதவும் அதே வேளையில், அதை ஒரு மனிதனாகக் கருதும் மாயையிலிருந்து (anthropomorphism) நம்மைப் பாதுகாக்கிறது.


3. ஒரு LLM உண்மையில் எவ்வாறு கட்டியெழுப்பப்படுகிறது? (கூகுள் தேடலின் உவமை)

இதனைப் புரிந்துகொள்ள, கூகுள் தேடுபொறி எவ்வாறு இயங்குகிறது என்பதைக் கருத்தில் கொள்ளுங்கள்.

கூகுள் தேடல் இணையத்திலுள்ள அனைத்து வலைத்தளங்களையும் படித்து, அந்த வார்த்தைகளை ஒரு பெரிய பொருளடக்க அட்டவணையாக — ஒரு சுட்டெண்ணாக (index) — மாற்றுகிறது. நீங்கள் ஒரு சொல்லைத் தேடும்போது, அது தனது சுட்டெண்ணைப் பார்த்து மிகவும் பொருத்தமான இணைப்பை உங்களிடம் தருகிறது.

பெரு மொழி மாதிரிகளும் இதே போன்றதொரு கோட்பாட்டில்தான் இயங்குகின்றன — ஆனால் லட்சக்கணக்கான மடங்கு அதிக சிக்கலான கணிதத் தளத்தில் இயங்குகின்றன:

  1. இந்த மாதிரி முழு இணையத்தையும், டிஜிட்டல் மயமாக்கப்பட்ட ஒவ்வொரு புத்தகம், ஆய்வறிக்கை, அகராதி, சட்ட அறிக்கை மற்றும் உரையாடல்கள் அனைத்தையும் படிக்கிறது.
  2. அது அந்த உரை முழுவதையும் சிறிய துண்டுகளாக உடைக்கிறது — இவை டோக்கன்கள் (tokens) எனப்படுகின்றன.
  3. ஏற்கனவே குறிப்பிட்டது போல, கணினிக்கு ஆங்கிலக் எழுத்துக்களோ அல்லது தமிழ் எழுத்துக்களோ புரியாது. எனவே அது ஒவ்வொரு டோக்கனையும் எண் மதிப்புகளாக (numerical values) மாற்றி, மொழியின் பிரமாண்டமான கணித மாதிரியொன்றை — மொழியின் வார்த்தைகள் எவ்வாறு ஒன்றாக இணைய்கின்றன என்பதன் வரைபடத்தை — உருவாக்குகிறது.

4. க.பொ.த (உயர் தர) இணைந்த கணிதமும் (Combined Mathematics) டிரான்ஸ்ஃபார்மர் மூளையும்

பலர் கேட்கும் ஒரு கேள்வி: "இந்த மாதிரிகளின் மூளை உண்மையில் எவ்வாறு இயங்குகிறது?"

இங்கு மூளை என்பது பல-அடுக்கு டிரான்ஸ்ஃபார்மர் கட்டமைப்பு (multi-layer Transformer architecture) ஆகும்.

க.பொ.த உயர்தரத்தில் (A/L) இணைந்த கணிதம் (Combined Mathematics) படிக்கும் ஒரு இலங்கை மாணவரிடம் கேட்டால், தான் படிக்கும் அணிகளும் (matrices) வெக்டர்களும் (vectors) நிஜ உலகில் எங்கு பயன்படுகின்றன என்று அவருக்குத் தெரியாமல் இருக்கலாம். ஆனால் இன்று உலகையே உலுக்கிக் கொண்டிருக்கும் செயற்கை நுண்ணறிவு துல்லியமாக அந்த கணிதக் கோட்பாடுகளில்தான் இயங்குகிறது!

தரவு உள்ளீடு மற்றும் டோக்கனாக்கம் படம் 3.4: பெரு மொழி மாதிரியொன்றின் அடிப்படை கட்டமைப்பு — பிரமாண்டமான தரவுத்தொகுதி, டோக்கனாக்கமும் பொறித்தலும், டிரான்ஸ்ஃபார்மர் மூளை, பயிற்சி செயல்முறை (Pre-training & RLHF), மற்றும் அனுமான வெளியீடு (Inference Output).

படம் 3.4 இன் ஐந்து நிலைகளின் ஆழமான பொறியியல் பகுப்பாய்வு:

  1. நிலை 1: பிரமாண்டமான தரவுத்தொகுதி (மூலப்பொருள்): * டிஜிட்டல் மயமாக்கப்பட்ட புத்தகங்கள், கலைக்களஞ்சியங்கள், உரை ஆவணங்கள், திறந்த இணையம் மற்றும் கணினி நிரல் களஞ்சியங்கள். * இந்த மகத்தான தரவுத்தொகுதி சுத்திகரிக்கப்பட்டு (போலி மற்றும் நச்சு உள்ளடக்கங்கள் நீக்கப்பட்டு), மாதிரிக்கு வழங்கப்படுகிறது.
  2. நிலை 2: தரவு உள்ளீடு, டோக்கனாக்கம் மற்றும் வெக்டர் பொறித்தல் (Tokenization & Embedding): * டோக்கனாக்கம் (Tokenization): வாக்கியங்களும் பத்திகளும் சிறிய எழுத்துத் துண்டுகளாக — டோக்கன்களாக — உடைக்கப்படுகின்றன. * வெக்டர் பொறித்தல் (Vector Embedding): ஒவ்வொரு டோக்கனும் ஆயிரக்கணக்கான பரிமாணங்களைக் கொண்ட ஒரு கணித வெளியில் அமைவிடக் ஆயத்தொலைவுகளைப் (coordinates) பெறுகிறது. ஒரே பொருள் தரும் வார்த்தைகள் (உதாரணமாக "பிரதேச செயலாளர்" மற்றும் "மாவட்ட செயலாளர்") இந்த வெளியில் அருகருகே அமைகின்றன.
  3. நிலை 3: டிரான்ஸ்ஃபார்மர் கட்டமைப்பு ("மூளை"): * சுய-கவன மெகாநிசம் (Self-Attention Mechanism): ஒரு வாக்கியத்தில் உள்ள ஒவ்வொரு வார்த்தைக்கும் மற்ற ஒவ்வொரு வார்த்தையுடனும் உள்ள சூழல் சார்ந்த தொடர்பைக் கணக்கிடுதல். (எ.கா., "அவர் அனுமதியை கையொப்பமிட்டு அதை செயலாளரிடம் கொடுத்தார்" என்பதில், "அதை" என்பது எதனைக் குறிக்கிறது என்பதைக் கண்டறிதல்.) * என்கோடார் & டீகோடார் அடுக்குகள் (Encoder & Decoder Layers): உள்ளீட்டை உணர்ந்து, வரிசையாக அடுத்த வார்த்தைகளை உருவாக்குதல். * சேர்ப்பு & இயல்பாக்க அடுக்குகள் (Add & Norm Layers): நூற்றுக்கணக்கான நரம்பியல் அடுக்குகள் வழியாகத் தகவல் பாயும்போது நிலைத்தன்மையைப் பேணுதல், கணிதச் சமக்ஞை பலவீனமடைவதைத் தடுத்தல். * முன்னோக்கு வலைப்பின்னல்கள் (Feed-Forward Networks - FFN): செயலாக்கப்பட்ட தரவுகளை நினைவகத்தில் சேமித்து, சிக்கலான வடிவங்களைக் கைப்பற்றுதல்.
  4. நிலை 4: பயிற்சி மற்றும் கற்றல் செயல்முறை: * முன்-பயிற்சி (Pre-training - மேற்பார்வையற்ற கற்றல்): டிரில்லியன்கணக்கான வார்த்தைகளைப் படித்து "அடுத்து என்ன வரும்" என்பதை கணித்தல். இங்கு மாதிரி மொழியின் முழுமையான இலக்கணத்தையும் தர்க்கத்தையும் உறிஞ்சிக்கொள்கிறது. * மனிதக் பின்னூட்டத்துடனான நுண்-சரிசெய்தல் (RLHF): மனித வல்லுநர்கள் மாதிரியின் பதில்களைத் தரம் பிரித்து, பொருத்தமான, பாதுகாப்பான, மரியாதையான மற்றும் உண்மையான பதில்களை வழங்குமாறு அதை வடிவமைக்கின்றனர் — மனித விருப்பத்துடன் சீரமைத்தல்.
  5. நிலை 5: அனுமானம் மற்றும் உரை உருவாக்கம் (Inference & Text Generation): * பயனரின் தூண்டல் வழங்கப்பட்டதும், மாதிரி நிகழ்தகவு முறைகளைப் பயன்படுத்தி (Temperature, Top-p) மிகவும் பொருத்தமான வெளியீட்டைத் கணப்பொழுதில் உருவாக்குகிறது.

5. முன்-பயிற்சி மற்றும் மனிதக் பின்னூட்டத்துடனான வலுவூட்டல் கற்றல் (RLHF)

ஒரு மாதிரி உடனடி நுண்ணறிவைப் பெற்றுவிடாது. அது படிமுறைப் பயிற்சியின் மூலமே கட்டியெழுப்பப்படுகிறது:

  1. முன்-பயிற்சி (Pre-training): * மாதிரிக்கு பில்லியன்கணக்கான வாக்கியங்கள் சில வார்த்தைகள் மறைக்கப்பட்டு வழங்கப்படுகின்றன, மேலும் "அடுத்து என்ன வரும்" என்று யூகிக்க வைக்கப்படுகிறது. * அது தவறாக யூகிக்கப்படும் போது, கணித ரீதியாக அபராதம் விதிக்கப்பட்டு (backpropagation) அதன் எடைகள் சரிசெய்யப்படுகின்றன. சரியாக இருக்கும் போது, அந்த வடிவம் வலுப்படுத்தப்படுகிறது. * டிரில்லியன்கணக்கான தடவைகள் இவ்வாறு பயிற்சியளிக்கப்படுவதன் மூலம், மாதிரி மனித இலக்கணம், தர்க்கம் மற்றும் அறிவின் மீது மகத்தான ஆளுமையைப் பெறுகிறது.
  2. மனிதக் பின்னூட்டத்துடனான வலுவூட்டல் கற்றல் (Reinforcement Learning from Human Feedback - RLHF): * மனித மதிப்பீட்டாளர்கள் மாதிரியின் பதில்களைத் தரம் பிரித்து, அதை மேலும் மரியாதையான, பயனுள்ள மற்றும் துல்லியமான பதில்களை நோக்கி வழிநடத்துகிறார்கள்.

6. உண்மை இயந்திரம் அல்ல, சாத்தியக்கூறு இயந்திரமே

நீங்கள் ஒரு மாணவராக, ஆசிரியராக, பெற்றோராக அல்லது ஒரு தொழில்வல்லுநராக இருந்தாலும், உங்கள் மனதில் பதியவைக்க வேண்டிய முதன்மையான பொறியியல் உண்மை இதுவே:

Warning

ஒரு LLM என்பது உண்மையைக் கண்டறியும் சோதனை இயந்திரம் அல்ல. மாறாக, அடுத்து வரக்கூடிய மிகச் சாத்தியமான வார்த்தையைக் கணித்துக் கூறும் ஒரு நிகழ்தகவு இயங்குதளமாகும் (probability engine).

எது உண்மை, எது பொய் என்ற உள் உணர்வு மாதிரிக்குக் கிடையாது. நீங்கள் ஒரு கேள்வியைக் கேட்கும்போது, அது சரிபார்க்கப்பட்ட உண்மையின் களஞ்சியத்திலிருந்து உண்மைகளைச் சரிபார்ப்பதில்லை. அது உங்கள் கேள்வியைத் தொடர்ந்து வரக்கூடிய மிக நம்பகமான மற்றும் சரளமான வார்த்தைகளின் வரிசையைக் கணித நிகழ்தகவின் அடிப்படையில் உருவாக்குகிறது.

அதனால்தான், ஒரு மாதிரிக்கு ஏதேனும் ஒன்று தெரியாவிட்டாலும் கூட, அது எந்தவொரு தயக்கமுமின்றி — மிக அழகிய உத்தியோகபூர்வ நடையில் — முற்றிலும் புனையப்பட்ட ஒரு பொய்யை (மனப்பல் காட்சி / hallucination) முன்வைக்க முடியும். மாதிரியின் வடிவத்தைக் கண்டு ஏமாந்துவிடாதீர்கள்; அதன் உண்மையைச் சரிபாருங்கள்.


7. மொழிச் சார்புநிலையும் புவிசார் அரசியலும்: மாதிரிகள் ஏன் வேறுபடுகின்றன?

பயிற்சி அமர்வுகளில் ஒரு நியாயமான ஆதங்கம் தொடர்ச்சியாக எழுகிறது: "ஐயா, நாங்கள் சிங்களத்தில் கேட்கும்போது ChatGPT சில நேரங்களில் அர்த்தமற்ற பதில்களைத் தருகிறது. ஆனால் ஆங்கிலத்தில் கேட்டால் பதில்கள் அற்புதம். ஏன்?"

இதற்குக் காரணம், இந்த மாதிரிகளுக்குப் பயிற்சியளிக்கப்பட்ட தரவுகளில் ஆழமாகப் பதிந்துள்ள மகத்தான மொழி மற்றும் கலாச்சாரச் சார்புநிலையாகும்:

  1. மேல்நாட்டு அறிவுச் சார்புநிலை (Western Knowledge Bias): * ChatGPT மற்றும் Claude போன்ற அமெரிக்க மாதிரிகள் முதன்மையாக மேல்நாடுகளின் ஆங்கில இலக்கியங்கள், மேல்நாட்டுச் சட்டங்கள் மற்றும் மேல்நாட்டுத் தரவுகளிலேயே பயிற்சியளிக்கப்பட்டுள்ளன. கீழ்நாட்டு கலாச்சாரங்கள், இலங்கை நிர்வாக சுற்றறிக்கைகள் அல்லது நமது கிராமப்புற வாழ்க்கை முறைகள் பற்றிய தரவுகள் அவற்றில் மிகக் குறைந்த அளவே உள்ளன.
  2. கூகுள் ஜெமினியின் சிங்கள/தமிழ் சாதகத்தன்மை (Google Gemini's Advantage): * மற்ற அமெரிக்க மாதிரிகளுடன் ஒப்பிடும்போது, Google Gemini சிங்களம் மற்றும் தமிழ் மொழிகளில் குறிப்பிடத்தக்க சாதகமான நிலையைக் கொண்டுள்ளது. கூகுள் நிறுவனம் இருபது ஆண்டுகளுக்கும் மேலாக இலங்கையின் சிங்கள மற்றும் தமிழ் வலைத்தளங்கள், செய்திகள் மற்றும் தேடல் வினாக்களைத் தனது அமைப்புகளில் (கூகுள் தேடல் சுட்டெண்) சேமித்துள்ளது. எனவே ஜெமினி இலக்கணத்திலும் வார்த்தைப் பயன்பாட்டிலும் ஒப்பீட்டளவில் அதிக துல்லியத்தைக் காட்டுகிறது.
  3. சீனாவின் டீப்சீக்கின் இரகசியம் (China's DeepSeek): * சீனாவின் DeepSeek உடன் சிங்களத்தில் அல்லது தமிழில் பணியாற்றிப் பாருங்கள், அது வியக்கத்தக்க வகையில் நன்கு புரிந்துகொள்வதைக் காண்பீர்கள். சீனம் ஆங்கிலத்தைப் போன்ற எளிய எழுத்துக்களைக் கொண்ட மொழியல்ல; அது சிக்கலான சித்திர எழுத்துக்களையும் குரல் தொனி அமைப்புகளையும் கொண்ட மொழியாகும். சீன மொழியிலும் பிற ஆங்கிலம் அல்லாத பன்மொழித் தரவுகளிலும் ஆழமாகப் பயிற்சியளிக்கப்பட்டதால், டீப்சீக் நமது மொழிகளின் சிக்கலான வாக்கிய அமைப்புகளுக்கு இயல்பாகவே ஈடுகொடுக்கும் திறனைக் கொண்டுள்ளது.
  4. தமிழ் மற்றும் சிங்கள மொழிகளுக்கு இடையிலான வேறுபாடு: * இலங்கையின் தமிழ் பேசுபவர்கள் AI கருவிகளைப் பயன்படுத்தும்போது ஒப்பீட்டளவில் எளிதான அனுபவத்தைப் பெறுகிறார்கள். ஏனெனில் இந்தியத் தமிழ்நாடு உட்பட உலகம் முழுவதிலும் உள்ள கோடிக்கணக்கான தமிழ் பேசுபவர்கள் இணையத்தில் மகத்தான தமிழ் இலக்கியங்களையும் டிஜிட்டல் தரவுகளையும் பங்களித்துள்ளனர். * ஆனால் சிங்கள மொழி நமது நாட்டில் உள்ள சுமார் இரண்டு கோடி மக்களால் மட்டுமே பேசப்படுகிறது. நாம் இணையத்தில் பங்களித்துள்ள டிஜிட்டல் சிங்கள உள்ளடக்கங்கள் மிகவும் வரம்பிற்குட்பட்டவை. அதனால்தான் சிங்களத்தில் AI ஐப் பயன்படுத்தும்போது சிறப்பு விழிப்புணர்வு தேவையாகிறது.

8. பல்தொகுதி ஒருங்கிணைப்பும் உலகளாவிய வெக்டர் வெளியும் (Multimodal AI Systems)

இன்று இந்த மாதிரிகள் உரையுடன் மட்டும் நின்றுவிடுவதில்லை. நவீன எல்லைக்கோடு மாதிரிகள் (frontier models) முழுமையான பல்தொகுதி அமைப்புகளாக (multimodal systems) இயங்குகின்றன.

பல்தொகுதி ஒருங்கிணைப்பு படம் 3.5: பல்தொகுதி ஆக்கபூர்வ AI அமைப்பின் கட்டமைப்பு — பல்தொகுதி தரவு உட்செலுத்தல் (உரை, புகைப்படங்கள், காணொளிகள், ஒலிப்பதிவுகள், நிரல்கள்), ஒருங்கிணைந்த பன்மான வெக்டர் வெளி (Multimodal Vector Space), பல-முனை டிரான்ஸ்ஃபார்மர், மற்றும் பல்தொகுதி வெளியீடு.

படம் 3.5 இன் பல்தொகுதி அமைப்பின் பகுப்பாய்வு:

  1. பிரமாண்டமான பல்தொகுதி தரவுத்தொகுதி (Massive Multimodal Dataset): * உரை ஆவணங்கள், புகைப்படங்கள், காணொளிகள், ஒலிப்பதிவுகள் மற்றும் கணினி நிரல்கள்.
  2. பல்தொகுதி உட்செலுத்தல் & டோக்கனாக்கம் (Multimodal Ingestion & Tokenization): * பழைய முறைகளைப் போலன்றி, இங்கு ஒரு படம் முதலில் வார்த்தைகளாக மாற்றப்படுவதில்லை. * புகைப்படங்களும் காணொளிச் சட்டகங்களும் (frames) சிறிய பிக்சல் துண்டுகளாக (16×16) உடைக்கப்பட்டு காட்சித் டோக்கன்களாக மாறுகின்றன; ஒலி அலைகள் அலைவெண் நிறமாலைகள் மூலம் நேரடி ஒலித் டோக்கன்களாக மாறுகின்றன.
  3. ஒருங்கிணைந்த பன்மான வெக்டர் வெளி (Unified Multimodal Vector Space): * இது ஒட்டுமொத்த அமைப்பின் தலையாய பொறியியல் சாதனையாகும். * இலங்கை தேசிய அடையாள அட்டையின் புகைப்படம் (காட்சித் துண்டு), "தேசிய அடையாள அட்டை" என்று பேசப்பட்ட குரல் பதிவு (ஒலி அலை), மற்றும் "தேசிய அடையாள அட்டை" என்று எழுதப்பட்ட உரை ஆகிய அனைத்துமே இந்த பன்மான கணித வெளியில் ஒரே ஆயத்தொலைவுப் பகுதிக்கு வந்து சேர்கின்றன. இதனால் இயந்திரத்தால் எந்தத் தடையுமின்றி அமைப்புகளுக்கிடையே ஒப்பீடு செய்ய முடிகிறது.
  4. பல-முனை குறுக்கு-கவனக் கட்டமைப்பு (Multi-Headed Cross-Attention Architecture): * குறுக்கு-கவனக் கோட்பாடு பல்வேறு வடிவங்களுக்கு இடையே இயங்குகிறது. உதாரணமாக, ஒரு ஸ்கேன் செய்யப்பட்ட உறுதிப்பத்திரத்தில் உள்ள கையொப்பத்தைப் பரிசோதிக்கும் அதே வேளையில், உரையில் எழுதப்பட்டுள்ள நில உரிமையாளரின் பெயருடன் மாதிரியால் அதை ஒரே நேரத்தில் ஒப்பீட்டுப் பார்க்க முடியும்.
  5. பல்தொகுதி முன்-பயிற்சியும் RLHF உம்: * காணொளி, ஒலி மற்றும் உரை ஆகியவற்றில் அடுத்த தரவு வகையைக் கணிப்பதன் மூலம் பயிற்சி அளித்தல். * போலியான ஊடகங்களுக்கு எதிரான பாதுகாப்பு வழிகாட்டுதல்கள் மற்றும் பாதுகாப்பு வடிப்பான்கள் (multimodal safety alignment, deepfake prevention).
  6. உலகளாவிய உருவாக்கம் & வெளியீடு (Universal Generation & Output): * பயனர் எந்த வடிவத்திலும் வினவலை எழுப்பலாம் (எ.கா., ஒரு முறைப்பாட்டின் ஒலிப்பதிவு மற்றும் பேரழிவுச் சேதத்தின் புகைப்படம்). * இந்த அமைப்பு, உத்தியோகபூர்வ அறிக்கை, சேதம் குறிக்கப்பட்ட வரைபடம் அல்லது இயங்கும் கணினி நிரல் என அப்பணிக்கு எது தேவையோ அதை உருவாக்குகிறது.

இது உங்களுக்கு வழங்கும் நடைமுறை மதிப்பு (சில உதாரணங்கள்):

  • பழைய கையெழுத்து நிலப் பத்திரம் அல்லது கடிதத்தைப் புகைப்படமெடுத்து அதன் உள்ளடக்கங்களை ஒரு நொடியில் படிக்க வைத்தல் (Vision OCR).
  • ஒரு மாணவரின் கையெழுத்து விடைத்தாளைப் படம்பிடித்து, முறைமைப் புள்ளிகள் (Method Marks - M) மற்றும் துல்லியப் புள்ளிகள் (Accuracy Marks - A) ஆகியவற்றைத் தனித்தனியாகப் பகுப்பாய்வு செய்தல் (Mark Papers / படம்பிடித்து மதிப்பிடுங்கள் - Snap & Score).
  • மக்கள் தினத்தில் ஒரு குடிமகனின் வாய்மொழி முறைப்பாட்டைப் பதிவுசெய்து உடனடி உத்தியோகபூர்வ விசாரணை குறிப்பை உருவாக்குதல்.
  • ஒரு சிக்கலான அபிவிருத்தித் திட்டத்தின் வரைபடம் அல்லது வரைபடத்தைப் பகுப்பாய்வு செய்து அதிலுள்ள முரண்பாடுகளை வெளிக்கொணர்தல்.

அடுத்த தொகுதியில், இந்த இயற்கை மொழிப் புரட்சியானது மனிதநேயத் துறைகளை (humanities) மீண்டும் எவ்வாறு மையக் மேடைக்குக் கொண்டுவருகிறது என்பதையும் — சாதாரண குடிமகன் எதிர்நோக்கும் டிஜிட்டல் இடைவெளியை AI எவ்வாறு குறைக்கிறது என்பதையும் விவாதிப்போம்.