முக்கிய விஷயங்கள்
- Sarvam AI-யின் புது Vision 2.1 Model, Tamil, Hindi, Telugu மாதிரி Indian Language Documents-ல structure மற்றும் script - இரண்டையும் ஒன்னா சேர்த்து படிக்கும்.
- Invoice, Insurance Claim, KYC Form மாதிரி Documents-ல பழைய OCR Tools Table Structure-ஐ இழந்துடும் - இந்த Model அதை Fix பண்ணும் நோக்கத்தில வந்தது.
- Google Vision, AWS Textract மாதிரி Global Tools English-க்கு Super, ஆனா Indian script Mixed Layout-ல அவ்ளோ Consistent இல்ல.
- இது நாம Download பண்ணிக்கிற Consumer App இல்ல - Developer/Enterprise Tool. ஆனா Effect நம்ம Bank, Insurance Apps-ல தெரியும்.
என்ன நடந்தது?
நீங்க ஒரு பழைய ரேஷன் கார்டு-ஐயோ, இல்ல ஒரு Tamil Nadu Land Record-ஐயோ Phone-ல Scan பண்ணி எந்தாவது Free OCR App-ல போட்டு பாத்திருக்கீங்களா? Text சரியா வந்தா Table Format முழுக்க கலந்து போயிடும். Table சரியா இருந்தா Tamil Letters எல்லாம் Symbol மாறி இருக்கும்.
இது ஒரு Random Problem இல்ல. இந்தியாவுல இருக்கிற எந்த Finance Team-ஆ இருந்தாலும் இதை Daily-யே Face பண்றாங்க. ஒரு Invoice-ல English Header இருக்கும், கீழ ஒரு Tamil அல்லது Hindi Vendor Name இருக்கும், அதுக்கு கீழ Numbers நிறைய இருக்கிற Table இருக்கும். இந்த மூணையும் சரியா படிக்கிற OCR Tool இதுவரைக்கும் சரியா இல்ல.
Bengaluru-ல இருக்கிற Sarvam AI, இந்தியாவுக்கே Focus பண்ணி Language Model Build செய்யுற Company, இப்போ Sarvam Vision 2.1-ஐ Release பண்ணிருக்காங்க. இது ஒரு Flashy Consumer Launch இல்ல. இந்த வீக்கெண்ட் நீங்க Download பண்ண போற Phone App இது இல்ல. இது Developers, Businesses-க்காக Build செய்யப்பட்ட Model. ஆனா இதன் Effect நம்மள எல்லாரையும் Touch பண்ணும்.
இது எப்படி வேலை செய்யும்?
முதல்ல OCR என்றா என்ன-ன்னு பாப்போம். OCR அதாவது Optical Character Recognition - ஒரு Scanned Image-ல இருக்கிற Letters-ஐ Computer படிக்கிற Technology. இது தெரிஞ்ச Word-தான், ஆனா இதுக்கு பின்னாடி இருக்கிற Problem சின்ன Problem இல்ல.
Google Document AI, AWS Textract மாதிரி Global Tools முழுக்க English, Latin Script Documents மேல Train பண்ணி இருக்காங்க - US, Europe-ல இருக்கிற Invoice, Receipt, Form எல்லாம். அதனால அவாளுக்கு Structure தெரிஞ்சுக்கும். எந்த இடத்துல Table Start ஆகுது, எந்த Cell-ல Price இருக்கு, எது Date Column - இதெல்லாம் அவாளுக்கு Clear. இதுக்கு Structural Document Parsing-ன்னு பேரு.
Indian Language OCR Tools-வா Different History. அவாள Tamil, Devanagari, Telugu, Bengali Script படிக்கவே Build செய்யப்பட்டது. Script படிக்கிறதுல அவாள நல்லா இருக்காங்க, ஆனா Layout மேல Train ஆகலை. Complex Table, Mixed Language Row கொடுத்தா அவாளும் Confuse ஆயிடுவாங்க.
Sarvam Vision 2.1 இந்த Two Problem-ஐயும் ஒரே Model-ல Fix பண்ண Try பண்றது. அதாவது, Structure மற்றும் Script - இரண்டையும் ஒன்னா Understand பண்ண இந்த Model-ஐ Train பண்ணியிருக்காங்க, Indian Documents-ஐயே வெச்சுக்கிட்டு.
உதாரணமா சொன்னா, ஒரு Insurance Claim Form எடுத்துக்குங்க. Top-ல English-ல "Claim Amount" என்று Print செய்திருக்கும். அதே Row-ல கீழ Tamil-ல வாடிக்கையாளர் பேரு இருக்கும். அதுக்கு பக்கத்துல ஒரு Number Column இருக்கும். பழைய Tools இந்த மூணையும் சரியா பிரிச்சு Match பண்ணாம, எல்லாத்தையும் ஒரே Line-ல குழப்பி வச்சுடும். Sarvam Vision 2.1 இந்த Row, Column Relationship-ஐ Keep பண்ணிக்கிட்டே, Tamil Text-ஐயும் சரியா Read பண்ண வேண்டியிருக்கு - இதுதான் இந்த Model-ன் Main Target.
இந்தியாவுல / நம்ம Phone-ல என்ன மாறும்?
நேர்மையா சொன்னா, நீங்க Tomorrow உங்க Phone-ல இது தெரியப்போற மாறுதல் இல்ல. இது ஒரு Developer, Enterprise Tool. ஆனா இதுக்கு பின்னாடி இருக்கிற Teams யாரு-ன்னு பாத்தீங்கன்னா, இதன் Reach உங்க Daily Life-ஐ Touch பண்ணும்.
Finance Companies, Insurance Companies, Logistics Firms, Government Offices - இவாள எல்லாம் Daily-யே நிறைய Paper Documents-ஐ Digital-ஆ மாத்தணும். ஒரு Insurance Company-க்கு Tamil Nadu-ல ஒரு Claim வந்தா, அந்த Form-ல Regional Language-ல கையெழுத்து, Mixed English Table இருக்கும். இப்போ வரைக்கும் இதை Manual-ஆ Type பண்ணி Enter பண்ணணும். இந்த Model வந்தா, இந்த Process Automatic-ஆ Fast ஆகும்.
இதனால என்ன மாறும் தெரியுமா? நீங்க ஒரு Insurance Claim போட்டா, அது Process ஆக எடுக்கிற Time குறையும். Bank-ல KYC Form Submit பண்ணா, Verification Fast ஆகும். Government Scheme-க்கு Regional Language Form Fill பண்ணினாலும், அதை Digitize பண்ணுற Speed அதிகரிக்கும். UPI, GPay மாதிரி Apps Direct-ஆ இதை Use பண்ணாம இருக்கலாம், ஆனா இந்த Backend Infrastructure Improve ஆனா, அதன் Benefit நம்மள எல்லாரையும் தான் வந்து சேரும்.
Logistics Side-ல பாத்தா, IRCTC Refund Form, Courier Document மாதிரி எதுல Regional Language Text இருக்கோ, அதையும் இந்த Model Easy-ஆ Handle பண்ண முடியும். இது ஒரு Big Deal, ஏன்னா இந்தியாவுல Documents 90%-க்கும் மேல Pure English-ல இல்ல. English + Regional Language Mix தான் நம்ம Reality.
நீங்க இப்போ என்ன பண்ணுங்க?
நீங்க ஒரு Developer அல்லது Business Owner-ஆ இருந்தா, Sarvam AI-யின் Vision 2.1 API-ஐ Try பண்ணி பாக்கலாம். Especially நீங்க Invoice Processing, Insurance Claim Automation, அல்லது Document Digitization Pipeline Build பண்றீங்கன்னா, இது உங்க Workflow-ல Time மற்றும் Error-ஐ குறைக்கும்.
சாதாரண User-ஆ இருந்தா, இப்போதைக்கு நீங்க எதும் Install பண்ண வேண்டியதில்ல. ஆனா ஒரு விஷயம் கவனிக்கலாம் - நீங்க அடுத்த ஒரு வருஷத்துல Insurance Claim, Bank KYC, Government Form Submit பண்ணும்போது, Processing Speed-ல ஒரு Improvement தெரிஞ்சா, இந்த மாதிரி Backend Model Upgrade-தான் Reason-ஆ இருக்கும்.
இந்தியாவுல AI Companies இப்போ ரெண்டு வகையா பிரிஞ்சிருக்காங்க - ஒரு பக்கம் Consumer-Facing Chatbot, App Build பண்றவாங்க, இன்னொரு பக்கம் இந்த மாதிரி Boring-ஆ தெரியற ஆனா Critical-ஆ இருக்கிற Infrastructure Problems-ஐ Solve பண்றவாங்க. Sarvam Vision 2.1 இரண்டாவது Category-ல வருது, ஆனா இதுதான் Actually நம்ம Everyday Life-ல Paper Work-ஐ Reduce பண்ணும்.
Step by Step-ஆ பாத்தா இது எப்படி Work ஆகும்?
இதை ஒரு Simple Flow-ல பாப்போம். முதல்ல Business Team ஒரு Scanned Document-ஐ Vision 2.1 API-க்கு Upload பண்ணுவாங்க - அது ஒரு Invoice-ஆ இருக்கலாம், Insurance Form-ஆ இருக்கலாம். அப்புறம் Model அந்த Image-ஐ Layout-வைஸ்-ஆ பிரிக்கும், அதாவது எது Header, எது Table, எது Signature Area-ன்னு Zone-ஆ Mark பண்ணும். அடுத்தது, ஒவ்வொரு Zone-க்கு Inside Script-ஐ Read பண்ணி, Tamil, Hindi, English Mix இருந்தாலும் தனித்தனியா Identify பண்ணும். கடைசியா, இந்த Output ஒரு Structured Format-ல, அதாவது Row, Column Clear-ஆ இருக்கிற JSON மாதிரி வெளிய வரும் - இதை Bank Software நேரடியா எடுத்துக்கிட்டு Process பண்ணிடும்.
Tamil Nadu Context-ல ஒரு Real Example எடுத்துக்குவோம். Coimbatore-ல ஒரு Textile Business, Supplier Invoice ஒவ்வொரு வாரமும் Tamil Vendor Name-உடன், English Amount Column-உடன் வரும். இதுவரைக்கும் அவாளோட Accounts Team இதை கை-ல Type பண்ணி Tally-ல Enter பண்ணுவாங்க. இதே மாதிரி, Madurai-ல ஒரு Insurance Agent Office-ல, Rural Customer-கள் Tamil-ல கையெழுத்து போட்ட Claim Form வரும். இந்த Two Scenario-வும் தான் Sarvam Vision 2.1 Solve பண்ண வந்த Real Problem. Chennai-ல இருக்கிற ஒரு Fintech Startup கூட, இதே Pain Point-ஐ Face பண்ணிருக்கும், ஏன்னா KYC Document-ல Regional Language Signature, English Number Mix தான் Default.
இதை பத்தி பேசும்போது ஒரு Common Mistake நிறைய பேரு பண்றாங்க - OCR-ஐ Translation-ஆ தப்பா நினைச்சுக்குறது. Vision 2.1 Tamil Text-ஐ படிக்கும், ஆனா அதை English-ஆ Translate பண்ணாது, அது Separate Job. இன்னொரு Mistake, இது Handwriting-ஐ 100% Perfect-ஆ படிக்கும்-ன்னு Expect பண்றது. Printed Text-ல இது Super-ஆ Work ஆகும், ஆனா கையெழுத்து Varying Style இருந்தா Accuracy கொஞ்சம் குறையும். மூணாவது Mistake, இது ஒரு Consumer App-ன்னு நினைச்சு, Play Store-ல Search பண்றது - இது Developer API, Direct Install பண்ண முடியாது.
Google, AWS Tools-உடன் Compare பண்ணா எப்படி இருக்கும்? அடுத்து என்ன நடக்கும்?
Google Document AI, AWS Textract-க்கும், Sarvam Vision 2.1-க்கும் Main Difference என்ன-ன்னு பாப்போம். Google, AWS Tools English, Latin Script Document-ல Structure Parsing-ல Already Strong-ஆ இருக்காங்க - US Invoice, European Form எடுத்துக்கிட்டா அவாள Accuracy அதிகம். ஆனா அதே Tool-ல ஒரு Tamil Mixed Table கொடுத்தா, Column Alignment குழம்பிடும் அல்லது Script Recognition Error வரும். Sarvam Vision 2.1 Indian Documents-ஐயே Core-ஆ வெச்சு Train ஆனதால, இந்த Specific Gap-ல அது Better Result தர வாய்ப்பு இருக்கு. ஆனா Global Scale-ல, Multiple Country Language Support Point-ல Google, AWS இன்னும் முன்னாடி இருக்காங்க.
இந்தியாவுல இந்த Space-ல Competition இப்போ Start ஆயிருக்கு. Google, Microsoft மாதிரி Big Companies-ம் India-Specific Layer Build பண்ணும் Direction-ல Move ஆகலாம், ஏன்னா இந்த Market Opportunity பெரிசு. Sarvam AI மாதிரி Local Startups, Niche Problem-ஐ Precise-ஆ Target பண்றதால, Enterprise Clients-ஐ Fast-ஆ Convert பண்ண வாய்ப்பு அதிகம். அடுத்த ஒரு வருஷத்துல, இதே மாதிரி Indian Language-Focused OCR, Document AI Models இன்னும் வரலாம்-ன்னு Expect பண்ணலாம், ஏன்னா ஒரு Company Success ஆனா, இன்னொரு Company அதே Space-ல Enter பண்றது Normal Pattern.
இறுதியா, Business Owners இந்த Decision எடுக்கும்போது ஒரு விஷயம் கவனிக்கணும் - Model Accuracy Claim-ஐ மட்டும் பாக்காம, அவாளோட Specific Document Type-ல Pilot Test பண்ணி பாக்கணும். ஒரு Insurance Form-ல நல்லா Work ஆன Model, அதே Company-ன் Legal Document-ல அப்படியே Work ஆகாம போகலாம். அதனால Enterprise Teams, இந்த மாதிரி Switch பண்றதுக்கு முன்னாடி, தங்களோட Real Document Sample-வைஸ்-ஆ Testing பண்ணி, Error Rate குறைந்தா தான் Full Scale-ல Adopt பண்ணணும்.




கருத்துகள் (0)
Be the first to comment!