‹ முகப்புக்கு திரும்ப

Sarvam Vision 2.1: Tamil, Hindi Documents படிக்கிற புது OCR Model

Tamil, Hindi மாதிரி Indian language Documents-ஐ structure மற்றும் script இரண்டையும் சேர்ந்து படிக்கிற புது OCR Model வந்துருச்சு. Sarvam AI கொண்டுவந்த இந்த Vision 2.1 Model, Finance மற்றும் Insurance Teams-க்கு பெரிய உதவியா இருக்கும்.

Keerthika 7 min read
Google-ல் Follow
India Tech Sarvam Vision 2.1: Tamil, Hindi Documents படிக்கிற புது OCR Model 7 நிமிடம் மீதம் Google-ல் Follow

தமிழ்டெக் AI சுருக்கம்

  • Tamil, Hindi, Telugu Documents-ஐ Structure + Script இரண்டும் சேர்த்து படிக்கிற Model
  • Finance, Insurance, Government Document Processing-க்கு Direct Benefit
  • Consumer App இல்ல, Developer/Enterprise Tool - ஆனா Effect நம்ம எல்லாரையும் Touch பண்ணும்

AI உதவியுடன் தயாரான சுருக்கம் — தமிழ்டெக் எடிட்டர்ஸ் சரிபார்த்தது.

0:00
0:00
🔒 Listen வசதி subscribers-க்கு மட்டும். Subscribe செய்யுங்கள்

முக்கிய விஷயங்கள்

  • Sarvam AI-யின் புது Vision 2.1 Model, Tamil, Hindi, Telugu மாதிரி Indian Language Documents-ல structure மற்றும் script - இரண்டையும் ஒன்னா சேர்த்து படிக்கும்.
  • Invoice, Insurance Claim, KYC Form மாதிரி Documents-ல பழைய OCR Tools Table Structure-ஐ இழந்துடும் - இந்த Model அதை Fix பண்ணும் நோக்கத்தில வந்தது.
  • Google Vision, AWS Textract மாதிரி Global Tools English-க்கு Super, ஆனா Indian script Mixed Layout-ல அவ்ளோ Consistent இல்ல.
  • இது நாம Download பண்ணிக்கிற Consumer App இல்ல - Developer/Enterprise Tool. ஆனா Effect நம்ம Bank, Insurance Apps-ல தெரியும்.

என்ன நடந்தது?

நீங்க ஒரு பழைய ரேஷன் கார்டு-ஐயோ, இல்ல ஒரு Tamil Nadu Land Record-ஐயோ Phone-ல Scan பண்ணி எந்தாவது Free OCR App-ல போட்டு பாத்திருக்கீங்களா? Text சரியா வந்தா Table Format முழுக்க கலந்து போயிடும். Table சரியா இருந்தா Tamil Letters எல்லாம் Symbol மாறி இருக்கும்.

இது ஒரு Random Problem இல்ல. இந்தியாவுல இருக்கிற எந்த Finance Team-ஆ இருந்தாலும் இதை Daily-யே Face பண்றாங்க. ஒரு Invoice-ல English Header இருக்கும், கீழ ஒரு Tamil அல்லது Hindi Vendor Name இருக்கும், அதுக்கு கீழ Numbers நிறைய இருக்கிற Table இருக்கும். இந்த மூணையும் சரியா படிக்கிற OCR Tool இதுவரைக்கும் சரியா இல்ல.

Bengaluru-ல இருக்கிற Sarvam AI, இந்தியாவுக்கே Focus பண்ணி Language Model Build செய்யுற Company, இப்போ Sarvam Vision 2.1-ஐ Release பண்ணிருக்காங்க. இது ஒரு Flashy Consumer Launch இல்ல. இந்த வீக்கெண்ட் நீங்க Download பண்ண போற Phone App இது இல்ல. இது Developers, Businesses-க்காக Build செய்யப்பட்ட Model. ஆனா இதன் Effect நம்மள எல்லாரையும் Touch பண்ணும்.

இது எப்படி வேலை செய்யும்?

முதல்ல OCR என்றா என்ன-ன்னு பாப்போம். OCR அதாவது Optical Character Recognition - ஒரு Scanned Image-ல இருக்கிற Letters-ஐ Computer படிக்கிற Technology. இது தெரிஞ்ச Word-தான், ஆனா இதுக்கு பின்னாடி இருக்கிற Problem சின்ன Problem இல்ல.

Google Document AI, AWS Textract மாதிரி Global Tools முழுக்க English, Latin Script Documents மேல Train பண்ணி இருக்காங்க - US, Europe-ல இருக்கிற Invoice, Receipt, Form எல்லாம். அதனால அவாளுக்கு Structure தெரிஞ்சுக்கும். எந்த இடத்துல Table Start ஆகுது, எந்த Cell-ல Price இருக்கு, எது Date Column - இதெல்லாம் அவாளுக்கு Clear. இதுக்கு Structural Document Parsing-ன்னு பேரு.

Indian Language OCR Tools-வா Different History. அவாள Tamil, Devanagari, Telugu, Bengali Script படிக்கவே Build செய்யப்பட்டது. Script படிக்கிறதுல அவாள நல்லா இருக்காங்க, ஆனா Layout மேல Train ஆகலை. Complex Table, Mixed Language Row கொடுத்தா அவாளும் Confuse ஆயிடுவாங்க.

Sarvam Vision 2.1 இந்த Two Problem-ஐயும் ஒரே Model-ல Fix பண்ண Try பண்றது. அதாவது, Structure மற்றும் Script - இரண்டையும் ஒன்னா Understand பண்ண இந்த Model-ஐ Train பண்ணியிருக்காங்க, Indian Documents-ஐயே வெச்சுக்கிட்டு.

உதாரணமா சொன்னா, ஒரு Insurance Claim Form எடுத்துக்குங்க. Top-ல English-ல "Claim Amount" என்று Print செய்திருக்கும். அதே Row-ல கீழ Tamil-ல வாடிக்கையாளர் பேரு இருக்கும். அதுக்கு பக்கத்துல ஒரு Number Column இருக்கும். பழைய Tools இந்த மூணையும் சரியா பிரிச்சு Match பண்ணாம, எல்லாத்தையும் ஒரே Line-ல குழப்பி வச்சுடும். Sarvam Vision 2.1 இந்த Row, Column Relationship-ஐ Keep பண்ணிக்கிட்டே, Tamil Text-ஐயும் சரியா Read பண்ண வேண்டியிருக்கு - இதுதான் இந்த Model-ன் Main Target.

இந்தியாவுல / நம்ம Phone-ல என்ன மாறும்?

நேர்மையா சொன்னா, நீங்க Tomorrow உங்க Phone-ல இது தெரியப்போற மாறுதல் இல்ல. இது ஒரு Developer, Enterprise Tool. ஆனா இதுக்கு பின்னாடி இருக்கிற Teams யாரு-ன்னு பாத்தீங்கன்னா, இதன் Reach உங்க Daily Life-ஐ Touch பண்ணும்.

Finance Companies, Insurance Companies, Logistics Firms, Government Offices - இவாள எல்லாம் Daily-யே நிறைய Paper Documents-ஐ Digital-ஆ மாத்தணும். ஒரு Insurance Company-க்கு Tamil Nadu-ல ஒரு Claim வந்தா, அந்த Form-ல Regional Language-ல கையெழுத்து, Mixed English Table இருக்கும். இப்போ வரைக்கும் இதை Manual-ஆ Type பண்ணி Enter பண்ணணும். இந்த Model வந்தா, இந்த Process Automatic-ஆ Fast ஆகும்.

இதனால என்ன மாறும் தெரியுமா? நீங்க ஒரு Insurance Claim போட்டா, அது Process ஆக எடுக்கிற Time குறையும். Bank-ல KYC Form Submit பண்ணா, Verification Fast ஆகும். Government Scheme-க்கு Regional Language Form Fill பண்ணினாலும், அதை Digitize பண்ணுற Speed அதிகரிக்கும். UPI, GPay மாதிரி Apps Direct-ஆ இதை Use பண்ணாம இருக்கலாம், ஆனா இந்த Backend Infrastructure Improve ஆனா, அதன் Benefit நம்மள எல்லாரையும் தான் வந்து சேரும்.

Logistics Side-ல பாத்தா, IRCTC Refund Form, Courier Document மாதிரி எதுல Regional Language Text இருக்கோ, அதையும் இந்த Model Easy-ஆ Handle பண்ண முடியும். இது ஒரு Big Deal, ஏன்னா இந்தியாவுல Documents 90%-க்கும் மேல Pure English-ல இல்ல. English + Regional Language Mix தான் நம்ம Reality.

நீங்க இப்போ என்ன பண்ணுங்க?

நீங்க ஒரு Developer அல்லது Business Owner-ஆ இருந்தா, Sarvam AI-யின் Vision 2.1 API-ஐ Try பண்ணி பாக்கலாம். Especially நீங்க Invoice Processing, Insurance Claim Automation, அல்லது Document Digitization Pipeline Build பண்றீங்கன்னா, இது உங்க Workflow-ல Time மற்றும் Error-ஐ குறைக்கும்.

சாதாரண User-ஆ இருந்தா, இப்போதைக்கு நீங்க எதும் Install பண்ண வேண்டியதில்ல. ஆனா ஒரு விஷயம் கவனிக்கலாம் - நீங்க அடுத்த ஒரு வருஷத்துல Insurance Claim, Bank KYC, Government Form Submit பண்ணும்போது, Processing Speed-ல ஒரு Improvement தெரிஞ்சா, இந்த மாதிரி Backend Model Upgrade-தான் Reason-ஆ இருக்கும்.

இந்தியாவுல AI Companies இப்போ ரெண்டு வகையா பிரிஞ்சிருக்காங்க - ஒரு பக்கம் Consumer-Facing Chatbot, App Build பண்றவாங்க, இன்னொரு பக்கம் இந்த மாதிரி Boring-ஆ தெரியற ஆனா Critical-ஆ இருக்கிற Infrastructure Problems-ஐ Solve பண்றவாங்க. Sarvam Vision 2.1 இரண்டாவது Category-ல வருது, ஆனா இதுதான் Actually நம்ம Everyday Life-ல Paper Work-ஐ Reduce பண்ணும்.

Step by Step-ஆ பாத்தா இது எப்படி Work ஆகும்?

இதை ஒரு Simple Flow-ல பாப்போம். முதல்ல Business Team ஒரு Scanned Document-ஐ Vision 2.1 API-க்கு Upload பண்ணுவாங்க - அது ஒரு Invoice-ஆ இருக்கலாம், Insurance Form-ஆ இருக்கலாம். அப்புறம் Model அந்த Image-ஐ Layout-வைஸ்-ஆ பிரிக்கும், அதாவது எது Header, எது Table, எது Signature Area-ன்னு Zone-ஆ Mark பண்ணும். அடுத்தது, ஒவ்வொரு Zone-க்கு Inside Script-ஐ Read பண்ணி, Tamil, Hindi, English Mix இருந்தாலும் தனித்தனியா Identify பண்ணும். கடைசியா, இந்த Output ஒரு Structured Format-ல, அதாவது Row, Column Clear-ஆ இருக்கிற JSON மாதிரி வெளிய வரும் - இதை Bank Software நேரடியா எடுத்துக்கிட்டு Process பண்ணிடும்.

Tamil Nadu Context-ல ஒரு Real Example எடுத்துக்குவோம். Coimbatore-ல ஒரு Textile Business, Supplier Invoice ஒவ்வொரு வாரமும் Tamil Vendor Name-உடன், English Amount Column-உடன் வரும். இதுவரைக்கும் அவாளோட Accounts Team இதை கை-ல Type பண்ணி Tally-ல Enter பண்ணுவாங்க. இதே மாதிரி, Madurai-ல ஒரு Insurance Agent Office-ல, Rural Customer-கள் Tamil-ல கையெழுத்து போட்ட Claim Form வரும். இந்த Two Scenario-வும் தான் Sarvam Vision 2.1 Solve பண்ண வந்த Real Problem. Chennai-ல இருக்கிற ஒரு Fintech Startup கூட, இதே Pain Point-ஐ Face பண்ணிருக்கும், ஏன்னா KYC Document-ல Regional Language Signature, English Number Mix தான் Default.

இதை பத்தி பேசும்போது ஒரு Common Mistake நிறைய பேரு பண்றாங்க - OCR-ஐ Translation-ஆ தப்பா நினைச்சுக்குறது. Vision 2.1 Tamil Text-ஐ படிக்கும், ஆனா அதை English-ஆ Translate பண்ணாது, அது Separate Job. இன்னொரு Mistake, இது Handwriting-ஐ 100% Perfect-ஆ படிக்கும்-ன்னு Expect பண்றது. Printed Text-ல இது Super-ஆ Work ஆகும், ஆனா கையெழுத்து Varying Style இருந்தா Accuracy கொஞ்சம் குறையும். மூணாவது Mistake, இது ஒரு Consumer App-ன்னு நினைச்சு, Play Store-ல Search பண்றது - இது Developer API, Direct Install பண்ண முடியாது.

Google, AWS Tools-உடன் Compare பண்ணா எப்படி இருக்கும்? அடுத்து என்ன நடக்கும்?

Google Document AI, AWS Textract-க்கும், Sarvam Vision 2.1-க்கும் Main Difference என்ன-ன்னு பாப்போம். Google, AWS Tools English, Latin Script Document-ல Structure Parsing-ல Already Strong-ஆ இருக்காங்க - US Invoice, European Form எடுத்துக்கிட்டா அவாள Accuracy அதிகம். ஆனா அதே Tool-ல ஒரு Tamil Mixed Table கொடுத்தா, Column Alignment குழம்பிடும் அல்லது Script Recognition Error வரும். Sarvam Vision 2.1 Indian Documents-ஐயே Core-ஆ வெச்சு Train ஆனதால, இந்த Specific Gap-ல அது Better Result தர வாய்ப்பு இருக்கு. ஆனா Global Scale-ல, Multiple Country Language Support Point-ல Google, AWS இன்னும் முன்னாடி இருக்காங்க.

இந்தியாவுல இந்த Space-ல Competition இப்போ Start ஆயிருக்கு. Google, Microsoft மாதிரி Big Companies-ம் India-Specific Layer Build பண்ணும் Direction-ல Move ஆகலாம், ஏன்னா இந்த Market Opportunity பெரிசு. Sarvam AI மாதிரி Local Startups, Niche Problem-ஐ Precise-ஆ Target பண்றதால, Enterprise Clients-ஐ Fast-ஆ Convert பண்ண வாய்ப்பு அதிகம். அடுத்த ஒரு வருஷத்துல, இதே மாதிரி Indian Language-Focused OCR, Document AI Models இன்னும் வரலாம்-ன்னு Expect பண்ணலாம், ஏன்னா ஒரு Company Success ஆனா, இன்னொரு Company அதே Space-ல Enter பண்றது Normal Pattern.

இறுதியா, Business Owners இந்த Decision எடுக்கும்போது ஒரு விஷயம் கவனிக்கணும் - Model Accuracy Claim-ஐ மட்டும் பாக்காம, அவாளோட Specific Document Type-ல Pilot Test பண்ணி பாக்கணும். ஒரு Insurance Form-ல நல்லா Work ஆன Model, அதே Company-ன் Legal Document-ல அப்படியே Work ஆகாம போகலாம். அதனால Enterprise Teams, இந்த மாதிரி Switch பண்றதுக்கு முன்னாடி, தங்களோட Real Document Sample-வைஸ்-ஆ Testing பண்ணி, Error Rate குறைந்தா தான் Full Scale-ல Adopt பண்ணணும்.

அடிக்கடி கேட்கப்படும் கேள்விகள்

Sarvam Vision 2.1 எதுக்கு பயன்படும்?

Invoice, Insurance Claim, KYC Form மாதிரி Tamil, Hindi, Telugu Text மற்றும் Table Structure இரண்டும் இருக்கிற Indian Documents-ஐ Accurate-ஆ படிச்சு Digitize பண்ண இந்த Model Use ஆகும்.

இது நாம Phone-ல Download பண்ணிக்கிற App-ஆ?

இல்ல. இது Developers மற்றும் Businesses-க்கான Tool. சாதாரண User நேரடியா இதை Download பண்ண வேண்டியதில்ல, ஆனா இதன் Benefit Bank, Insurance Apps Backend-ல தெரியும்.

Google Vision, AWS Textract இருக்கும்போது இது எதுக்கு Different?

Google Vision, AWS Textract English Documents-ல Super-ஆ இருக்கும், ஆனா Tamil, Hindi மாதிரி Script Mixed Layout-ல Consistent-ஆ இல்ல. Sarvam Vision 2.1 Specifically இந்த Indian Mixed-Language Documents-க்காக Build செய்யப்பட்டது.

இதால சாதாரண Tamil மக்களுக்கு என்ன Benefit?

Insurance Claim Process Fast ஆகும், Bank KYC Verification குறைந்த Time எடுக்கும், Government Regional Language Forms Digitize ஆகிற Speed அதிகரிக்கும் - இதெல்லாம் Indirect-ஆ நம்ம Daily Life-ஐ Easy பண்ணும்.

இது Tamil Script-ஐ 100% சரியா படிக்குமா?

எந்த OCR Model-ஆ இருந்தாலும் 100% Perfect-ன்னு சொல்ல முடியாது, ஆனா Sarvam Vision 2.1 Indian Documents மேல Specifically Train செய்யப்பட்டதால, Tamil, Hindi Mixed Layout-ல பழைய Tools-ஐ விட Better Accuracy காட்ட வாய்ப்பு அதிகம்.

நாளைய டெக் செய்திகள் உங்க WhatsApp-க்கே

தினமும் ஒரு சின்ன update, இலவசம். TamilTech channel-ஐ follow பண்ணுங்க.

What do you think?

people reacted

Keerthika

தமிழ்டெக் எடிட்டோரியல் டீம் · 3,350 கட்டுரைகள்

Keerthika is an editor at TamilTech, the Tamil and English technology publication founded by Praveen Kumar S. She covers AI, smartphones, gadgets, EVs, startups and cybersecurity i...

மேலும் Keerthika

WhatsApp-ல் TamilTech-ஐக் கேளுங்க

டெக் சந்தேகமா? தமிழிலோ ஆங்கிலத்திலோ கேளுங்க — எங்க WhatsApp அசிஸ்டன்ட் TamilTech கட்டுரைகளில் இருந்து சில நொடிகளில் பதில் சொல்லும்.

தொடர்புடைய செய்திகள்

கருத்துகள் (0)

| Supports **bold**, *italic*, `code`

Be the first to comment!

அடுத்த செய்தி Belagavi, Hubballi-க்கு Global Tech Centres — Bengaluru தாண்டி Karnataka புது Plan
Tamiltech

Tamiltech

Install app for faster access

Earn XP 🏆
WhatsApp
Notifications