‹ முகப்புக்கு திரும்ப

இந்திய AI மாடல்களில் Voice Agent கட்டமைப்பு – கற்றுக்கொண்ட பாடங்கள்

இந்திய foundation models-ஐ வைத்து Hindi-English code-switching புரியும் voice-first assistant உருவாக்கினோம். UPI payments voice மூலம் 3 seconds-ல முடிஞ்சு, offline-லும் 1.2 GB model-ஆ வேலை செய்யுது.

Keerthika 4 min read
Google-ல் Follow
அப்டேட் 2 வாரங்கள் முன்
AI Apps இந்திய AI மாடல்களில் Voice Agent கட்டமைப்பு – கற்றுக்கொண்ட பாடங்கள் 4 நிமிடம் மீதம் Google-ல் Follow
இந்திய AI மாடல்களில் Voice Agent கட்டமைப்பு – கற்றுக்கொண்ட பாடங்கள்

தமிழ்டெக் AI சுருக்கம்

இந்திய foundation models மேல build பண்ணின voice-first assistant experiment-ல Hindi-English code-switching-ஐ நல்லா handle பண்ணி 10k utterances-ல 92% intent accuracy அடைந்தாங்க. Voice மூலம் UPI payments சராசரி 3 seconds-ல முடிஞ்சு, Jio 5G-ல end-to-end latency 200 ms-க்கு கீழ வந்து, model-ஐ 1.2 GB-க்கு optimise பண்ணி மலிவு smartphones-லயும் offline ஓடும் அளவுக்கு கொண்டு வந்திருக்காங்க. Quantisation-க்கு அப்புறம் inference cost ஒரு call-க்கு INR 0.04 மட்டும் ஆகி Flipkart-scale traffic-ஐ support பண்ணுது; tier-2/3 field trial-ல 88% success rate கிடைச்சு semi-urban digital inclusion-க்கு நல்ல boost கொடுக்கும். Shopping, banking, government services use cases-ல task time roughly 30% குறைஞ்சு, kirana owners-க்கும் order flow எளிதாச்சு; rare words மற்றும் older devices-ல சில trade-offs இருந்தாலும் correction layers போட்டு compensate பண்ணிருக்காங்க. அடுத்ததா Tamil-Telugu expand, federated learning, NPCI UPI integration, benchmark suite publish பண்ண plan இருக்குனு சொல்லி, locally trained models mass-market voice agents-க்கு ஏத்த performance கொடுக்க முடியும்னு இந்த experiment நிரூபிச்சுட்டு இருக்கு.

  • Voice‑agent‑இல் Hindi‑English code‑switching‑ஐ எப்படி käsiteltiin?
  • UPI payment‑ voice‑trigger‑இல் average latency எத்தனை?
  • Model‑size‑ஐ 1.2 GB‑ curb‑செய்த Sri Lanka‑‑‑ techniques என்ன?
  • Inference cost‑per‑call ‑ எ paise‑scale‑?

AI உதவியுடன் தயாரான சுருக்கம் — தமிழ்டெக் எடிட்டர்ஸ் சரிபார்த்தது.

0:00
0:00
🔒 Listen வசதி subscribers-க்கு மட்டும். Subscribe செய்யுங்கள்

முக்கிய விஷயங்கள்

  • Hindi-English code-switching tests-ல் 10 k utterances-ல 92% intent accuracy அடைந்தோம்.
  • Voice மூலம் UPI payments enable பண்ணினோம், ஒரு transaction-க்கு சராசரி 3 seconds ஆகுது.
  • Jio-வின் 5G network-ல end-to-end latency-ஐ 200 ms-க்கு குறைச்சோம்.
  • Offline use-க்கு model size-ஐ 1.2 GB-க்கு optimise பண்ணினோம், sub-INR 8,000 smartphones-லயும் ஓடும்.
  • Quantisation-க்கு அப்புறம் inference cost ஒரு call-க்கு INR 0.04-ஆ வெட்டினோம், Flipkart-scale traffic-ஐ support பண்ணுது.

செய்தி என்ன?

கடந்த ஆறு மாசமா நம்ம team ஒரு voice-first assistant உருவாக்க experiment பண்ணிட்டு இருந்தோம். அது mixed Hindi-English speech-ஐ புரிஞ்சுக்கணும், UPI payment-ஐ trigger பண்ணணும், அப்புறம் natural tone-ல reply கொடுக்கணும். நாங்க recently release ஆன இரண்டு Indian foundation models-ஐ தேர்ந்தெடுத்தோம். ஒன்னு multilingual language understanding-ல ரொம்ப strong-ஆ இருக்கு, இன்னொன்னு realistic speech synthesis-க்கு நல்லா optimise பண்ணியிருக்கு. நோக்கம் என்னன்னா locally trained models பெரிய multilingual alternatives-ஐ match பண்ணுதா இல்ல exceed பண்ணுதான்னு பார்க்கணும். அதே சமயம் mass-market devices-க்கு lightweight-ஆ இருக்கணும்னு பார்த்தோம். இந்த experiment மூலமா இந்தியாவுக்கே ஏத்த voice tech எப்படி உருவாக்கலாம்னு தெளிவா தெரிஞ்சுது.

இந்த முயற்சில எங்களுக்கு முக்கியமா இருந்தது code-switching. இந்தியால பேசுறவங்க பெருசா Hindi-English கலந்து பேசுவாங்க. அதனால generic English-only assistant-ஐ விட இந்த approach நல்லா work ஆகுன்னு நம்பினோம். Foundation models இந்திய labs-ல இருந்து வந்ததனால accent diversity-யும் நல்லா handle பண்ணும்னு எதிர்பார்த்தோம். ஆறு மாசத்துல நிறைய iteration பண்ணி இப்போ இந்த results கிடைச்சிருக்கு.

Methodology எப்படி இருந்துச்சு

முதல்ல 12 hours spontaneous Hindi-English dialogue gather பண்ணோம். Public forums, call-center logs, scripted role-plays எல்லாத்துல இருந்து எடுத்தோம். Data-ல Delhi, Mumbai, Bengaluru, Kolkata accents கவரப்பட்டிருச்சு. Common banking phrases-உம் shopping phrases-உம் நிறைய இருந்துச்சு. Cleaning பண்ணிட்டு முதல் model-ஐ intent classification மற்றும் entity extraction-க்கு fine-tune பண்ணோம். இரண்டாவது model-ஐ text-to-speech-க்கு adapt பண்ணோம். Natural prosody மற்றும் Indian English-க்கு ஏத்த pausing மேல focus வச்சோம்.

Robustness உறுதி பண்ண stratified cross-validation accent groups முழுக்க பண்ணோம். ஒவ்வொரு region-க்கும் precision மற்றும் recall monitor பண்ணினோம். அதோட ஒரு small held-out set rare lexical items-ஓட உருவாக்கி training distribution-க்கு வெளியே generalisation test பண்ணோம். இந்த setup மூலமா model எவ்வளவு நல்லா generalise ஆகுதுன்னு தெளிவா தெரிஞ்சுது. Accents மாறுபட்டாலும் intent புரிஞ்சுக்கறதுல consistency இருந்துச்சு. Data cleaning stage-ல noise remove பண்ணி meaningful utterances மட்டும் வச்சோம். Role-plays மூலமா real-life banking மற்றும் shopping scenarios cover பண்ண முடிஞ்சது.

Technical Deep Dive

Integration steps நேரா இருந்துச்சு. ASR front-end open-source Conformer மேல build பண்ணி transcripts-ஐ understanding model-க்கு feed பண்ணோம். அது structured intent return பண்ணும். Intent அடிப்படையில knowledge base-ல இருந்து information fetch பண்ணுவோம் இல்ல UPI SDK-ஐ invoke பண்ணி payment initiate பண்ணுவோம். TTS model response-ஐ audio-வா மாத்தி user-க்கு stream பண்ணும். Memory footprint கவனமா பார்த்து 8-bit quantisation மற்றும் pruning apply பண்ணி combined model-ஐ roughly 1.2 GB-க்கு shrink பண்ணோம்.

Latency measurements பல devices-ல எடுத்தோம். Flagship Snapdragon 8-gen phone, mid-range MediaTek Helio G95, entry-level Unisoc T610. Jio-வின் 5G network-ல end-to-end time flagship-ல 200 ms-க்கு கீழ இருந்துச்சு. Mid-range device-ல சுமார் 260 ms, entry-level-ல சுமார் 340 ms காட்டியது. இந்த numbers offline fallback threshold set பண்ண உதவியது. Quantisation பண்ணதனால size குறைஞ்சது மட்டும் இல்ல cost-உம் குறைஞ்சது. Inference cost ஒரு call-க்கு INR 0.04-ஆ வந்துச்சு. இது Flipkart-scale traffic-ஐ support பண்ண போதுமானதா இருக்கு.

ASR Conformer transcripts நல்ல accuracy கொடுத்தது. Understanding model intent-ஐ structured format-ல கொடுக்கறதுல தெளிவா இருந்துச்சு. UPI SDK integration seamless-ஆ நடந்துச்சு. TTS streaming real-time feel கொடுத்தது. Device range முழுக்க test பண்ணதனால real-world performance தெரிஞ்சது. Flagship-ல latency குறைஞ்சதனால premium users-க்கு smooth experience கிடைக்கும். Mid மற்றும் entry devices-லயும் acceptable range-ல இருந்தது. Offline mode-ல model load ஆகுறது quick-ஆ இருந்துச்சு.

India impact எப்படி இருக்கு

Language diversity இந்தியால voice tech-க்கு பெரிய barrier-ஆ இருக்கு. Code-switching-ஐ explicitly target பண்ணதனால internal tests-ல user satisfaction-ல noticeable lift தெரிஞ்சது. Participants generic English-only assistant-ஐ விட “understood” ஆன feel அதிகமா report பண்ணாங்க. Voice மூலம் UPI transaction complete பண்ணறது first-time digital payers-க்கு entry barrier குறைக்கும். Semi-urban areas-ல small screens-ல typing cumbersome-ஆ இருக்கு. Offline capability Jio-வின் 5G-enabled phones-ல network fluctuate ஆனாலும் வேலை செய்யும். Major metros-க்கு வெளியே இது frequent reality.

Small field trial 200 users-ஓட tier-2 மற்றும் tier-3 towns-ல நடத்தினோம். இரண்டு weeks-ல voice-initiated payments-க்கு average success rate 88% இருந்துச்சு. Most failures poor microphone quality-ஓட linked, language understanding issue இல்ல. Feedback-ல natural mix of Hindi மற்றும் English-ல பேசற convenience highlight ஆச்சு. Mid-sentence-ல language switch பண்ண வேண்டாம்னு சொன்னாங்க. இந்த impact semi-urban digital inclusion-க்கு நல்ல boost கொடுக்கும். Banking மற்றும் shopping-ல voice flow adoption அதிகரிக்க வாய்ப்பு இருக்கு.

Use cases என்னென்ன

மூணு scenarios pilot பண்ணோம். முதல்ல voice-enabled shopping assistant Flipkart-like catalogue-ல. Users “Add two shirts under INR 1500 to cart”னு சொல்லி payment confirm பண்ணலாம். இரண்டாவது banking helper. Users spoken commands மூலம் balances check பண்ணி money transfer பண்ணலாம். மூணாவது government-service guide. PAN card applications மற்றும் vaccination slots பத்தி mixed Hindi-English-ல queries answer பண்ணும். ஒவ்வொரு case-லயும் average task completion time traditional touch-flow interface-ஐ விட roughly 30% drop ஆச்சு.

Additional informal tests local kirana store owners-ஓட நடத்தினோம். அவங்க agent-ஐ வைத்து wholesale orders place பண்ணாங்க. Voice flow steps-ஐ ஆறில இருந்து மூணுக்கு குறைச்சது. Store owners ஒரு order-க்கு சுமார் two minutes save ஆகுன்னு report பண்ணாங்க. Shopping-ல cart add மற்றும் payment confirm ஒரே flow-ல முடிஞ்சது. Banking-ல balance check quick-ஆ இருந்துச்சு. Government queries-ல mixed language support நல்லா வேலை செஞ்சது. Kirana owners-க்கு daily orders எளிதாச்சு. இந்த use cases real adoption potential காட்டுது.

Honest take

Indian models மேல build பண்றது promising-ஆ இருக்கு ஆனா trade-offs இல்லாம இல்ல. Understanding model நம்ம test set-ல accurate-ஆ இருந்தாலும் rare regional words மற்றும் heavy code-switching patterns-ல struggle பண்ணுது. Training data-ல less frequently appear ஆன patterns-ல difficulty இருக்கு. TTS voice natural-ஆ இருந்தாலும் excitement இல்ல urgency express பண்ணும்போது occasionally monotone-ஆ ஒலிக்குது. Latency gains device-வின் chipset மேல heavily depend ஆகுது. Older SoCs-ல response time-ல noticeable increase தெரியும். Hardware optimisation parallel challenge-ஆ இருக்கு.

Model maintain பண்ண fresh conversational data steady stream வேணும். Slang மற்றும் payment habits evolve ஆக drift curb பண்ணணும். Quantisation size மற்றும் cost குறைச்சாலும் intent accuracy-ல small drop கொண்டு வந்துச்சு – roughly 1.5 percentage points. அதற்கு lightweight post-processing rule-based correction layer high-confidence intents-க்கு add பண்ணி compensate பண்ணோம். இந்த honest assessment future improvements-க்கு வழி காட்டுது. Rare words handle பண்ண data augmentation தேவை. Prosody improve பண்ண TTS fine-tuning தொடரணும். Older devices-க்கு separate optimisation path பார்க்கணும்.

Future roadmap

முன்னாடி பார்த்தா language coverage-ஐ Tamil மற்றும் Telugu code-switching-க்கு expand பண்ண plan இருக்கு. Upcoming multilingual foundation models Indian research labs-ல இருந்து leverage பண்ணுவோம். On-device federated learning techniques explore பண்ணி accent coverage continuously improve பண்ணுவோம். User privacy compromise ஆகாம இது நடக்கும். இன்னொரு focus area regional language NPCI-approved UPI interfaces-ஓட agent-ஐ integrate பண்றது. Voice-based financial services scope broaden ஆகும்.

கடைசியா detailed benchmark suite publish பண்ண aim வச்சிருக்கோம். Other developers voice agents-ஐ Indian linguistic diversity, latency, cost metrics மேல evaluate பண்ண இந்த suite use பண்ணலாம். Home-grown AI solutions-க்கு transparent ecosystem foster ஆகும். Tamil Telugu expand பண்ணதனால south India coverage அதிகரிக்கும். Federated learning privacy-friendly improvement கொடுக்கும். NPCI integration financial inclusion மேலும் விரிவாக்கும். Benchmark suite community-க்கு standard metrics கொடுக்கும். இந்த roadmap மூலமா voice agent ecosystem இந்தியால வலுப்படும்.

Overall இந்த experiment locally trained models mass-market-க்கு ஏத்த performance கொடுக்க முடியும்னு நிரூபிச்சுது. Code-switching handle பண்ணறதுல 92% accuracy பெரிய milestone. UPI voice flow 3 seconds average-ஆ இருக்கு. Latency 200 ms Jio 5G-ல flagship-ல achieve ஆச்சு. 1.2 GB size offline use enable பண்ணுது. Cost INR 0.04 Flipkart-scale-க்கு போதுமானது. Field trial 88% success real-world viability காட்டுது. Use cases-ல 30% time drop மற்றும் kirana-ல two minutes save practical benefit. Trade-offs இருந்தாலும் correction layers மற்றும் future plans மூலமா address பண்ணலாம். இந்த பாடங்கள் next generation Indian voice agents-க்கு foundation ஆகும்.

நாளைய டெக் செய்திகள் உங்க WhatsApp-க்கே

தினமும் ஒரு சின்ன update, இலவசம். TamilTech channel-ஐ follow பண்ணுங்க.

What do you think?

people reacted

Keerthika

தமிழ்டெக் எடிட்டோரியல் டீம் · 3,344 கட்டுரைகள்

Keerthika is an editor at TamilTech, the Tamil and English technology publication founded by Praveen Kumar S. She covers AI, smartphones, gadgets, EVs, startups and cybersecurity i...

மேலும் Keerthika

WhatsApp-ல் TamilTech-ஐக் கேளுங்க

டெக் சந்தேகமா? தமிழிலோ ஆங்கிலத்திலோ கேளுங்க — எங்க WhatsApp அசிஸ்டன்ட் TamilTech கட்டுரைகளில் இருந்து சில நொடிகளில் பதில் சொல்லும்.

தொடர்புடைய செய்திகள்

கருத்துகள் (0)

| Supports **bold**, *italic*, `code`

Be the first to comment!

அடுத்த செய்தி Google-இன் கல்வி AI: NEET, JEE, GRE-க்கு இலவச கருவிகள், கல்லூரி மாணவர்களுக்கு இலவச சந்தா
Tamiltech

Tamiltech

Install app for faster access

Earn XP 🏆
WhatsApp
Notifications