முக்கிய விஷயங்கள்
- Hindi-English code-switching tests-ல் 10 k utterances-ல 92% intent accuracy அடைந்தோம்.
- Voice மூலம் UPI payments enable பண்ணினோம், ஒரு transaction-க்கு சராசரி 3 seconds ஆகுது.
- Jio-வின் 5G network-ல end-to-end latency-ஐ 200 ms-க்கு குறைச்சோம்.
- Offline use-க்கு model size-ஐ 1.2 GB-க்கு optimise பண்ணினோம், sub-INR 8,000 smartphones-லயும் ஓடும்.
- Quantisation-க்கு அப்புறம் inference cost ஒரு call-க்கு INR 0.04-ஆ வெட்டினோம், Flipkart-scale traffic-ஐ support பண்ணுது.
செய்தி என்ன?
கடந்த ஆறு மாசமா நம்ம team ஒரு voice-first assistant உருவாக்க experiment பண்ணிட்டு இருந்தோம். அது mixed Hindi-English speech-ஐ புரிஞ்சுக்கணும், UPI payment-ஐ trigger பண்ணணும், அப்புறம் natural tone-ல reply கொடுக்கணும். நாங்க recently release ஆன இரண்டு Indian foundation models-ஐ தேர்ந்தெடுத்தோம். ஒன்னு multilingual language understanding-ல ரொம்ப strong-ஆ இருக்கு, இன்னொன்னு realistic speech synthesis-க்கு நல்லா optimise பண்ணியிருக்கு. நோக்கம் என்னன்னா locally trained models பெரிய multilingual alternatives-ஐ match பண்ணுதா இல்ல exceed பண்ணுதான்னு பார்க்கணும். அதே சமயம் mass-market devices-க்கு lightweight-ஆ இருக்கணும்னு பார்த்தோம். இந்த experiment மூலமா இந்தியாவுக்கே ஏத்த voice tech எப்படி உருவாக்கலாம்னு தெளிவா தெரிஞ்சுது.
இந்த முயற்சில எங்களுக்கு முக்கியமா இருந்தது code-switching. இந்தியால பேசுறவங்க பெருசா Hindi-English கலந்து பேசுவாங்க. அதனால generic English-only assistant-ஐ விட இந்த approach நல்லா work ஆகுன்னு நம்பினோம். Foundation models இந்திய labs-ல இருந்து வந்ததனால accent diversity-யும் நல்லா handle பண்ணும்னு எதிர்பார்த்தோம். ஆறு மாசத்துல நிறைய iteration பண்ணி இப்போ இந்த results கிடைச்சிருக்கு.
Methodology எப்படி இருந்துச்சு
முதல்ல 12 hours spontaneous Hindi-English dialogue gather பண்ணோம். Public forums, call-center logs, scripted role-plays எல்லாத்துல இருந்து எடுத்தோம். Data-ல Delhi, Mumbai, Bengaluru, Kolkata accents கவரப்பட்டிருச்சு. Common banking phrases-உம் shopping phrases-உம் நிறைய இருந்துச்சு. Cleaning பண்ணிட்டு முதல் model-ஐ intent classification மற்றும் entity extraction-க்கு fine-tune பண்ணோம். இரண்டாவது model-ஐ text-to-speech-க்கு adapt பண்ணோம். Natural prosody மற்றும் Indian English-க்கு ஏத்த pausing மேல focus வச்சோம்.
Robustness உறுதி பண்ண stratified cross-validation accent groups முழுக்க பண்ணோம். ஒவ்வொரு region-க்கும் precision மற்றும் recall monitor பண்ணினோம். அதோட ஒரு small held-out set rare lexical items-ஓட உருவாக்கி training distribution-க்கு வெளியே generalisation test பண்ணோம். இந்த setup மூலமா model எவ்வளவு நல்லா generalise ஆகுதுன்னு தெளிவா தெரிஞ்சுது. Accents மாறுபட்டாலும் intent புரிஞ்சுக்கறதுல consistency இருந்துச்சு. Data cleaning stage-ல noise remove பண்ணி meaningful utterances மட்டும் வச்சோம். Role-plays மூலமா real-life banking மற்றும் shopping scenarios cover பண்ண முடிஞ்சது.
Technical Deep Dive
Integration steps நேரா இருந்துச்சு. ASR front-end open-source Conformer மேல build பண்ணி transcripts-ஐ understanding model-க்கு feed பண்ணோம். அது structured intent return பண்ணும். Intent அடிப்படையில knowledge base-ல இருந்து information fetch பண்ணுவோம் இல்ல UPI SDK-ஐ invoke பண்ணி payment initiate பண்ணுவோம். TTS model response-ஐ audio-வா மாத்தி user-க்கு stream பண்ணும். Memory footprint கவனமா பார்த்து 8-bit quantisation மற்றும் pruning apply பண்ணி combined model-ஐ roughly 1.2 GB-க்கு shrink பண்ணோம்.
Latency measurements பல devices-ல எடுத்தோம். Flagship Snapdragon 8-gen phone, mid-range MediaTek Helio G95, entry-level Unisoc T610. Jio-வின் 5G network-ல end-to-end time flagship-ல 200 ms-க்கு கீழ இருந்துச்சு. Mid-range device-ல சுமார் 260 ms, entry-level-ல சுமார் 340 ms காட்டியது. இந்த numbers offline fallback threshold set பண்ண உதவியது. Quantisation பண்ணதனால size குறைஞ்சது மட்டும் இல்ல cost-உம் குறைஞ்சது. Inference cost ஒரு call-க்கு INR 0.04-ஆ வந்துச்சு. இது Flipkart-scale traffic-ஐ support பண்ண போதுமானதா இருக்கு.
ASR Conformer transcripts நல்ல accuracy கொடுத்தது. Understanding model intent-ஐ structured format-ல கொடுக்கறதுல தெளிவா இருந்துச்சு. UPI SDK integration seamless-ஆ நடந்துச்சு. TTS streaming real-time feel கொடுத்தது. Device range முழுக்க test பண்ணதனால real-world performance தெரிஞ்சது. Flagship-ல latency குறைஞ்சதனால premium users-க்கு smooth experience கிடைக்கும். Mid மற்றும் entry devices-லயும் acceptable range-ல இருந்தது. Offline mode-ல model load ஆகுறது quick-ஆ இருந்துச்சு.
India impact எப்படி இருக்கு
Language diversity இந்தியால voice tech-க்கு பெரிய barrier-ஆ இருக்கு. Code-switching-ஐ explicitly target பண்ணதனால internal tests-ல user satisfaction-ல noticeable lift தெரிஞ்சது. Participants generic English-only assistant-ஐ விட “understood” ஆன feel அதிகமா report பண்ணாங்க. Voice மூலம் UPI transaction complete பண்ணறது first-time digital payers-க்கு entry barrier குறைக்கும். Semi-urban areas-ல small screens-ல typing cumbersome-ஆ இருக்கு. Offline capability Jio-வின் 5G-enabled phones-ல network fluctuate ஆனாலும் வேலை செய்யும். Major metros-க்கு வெளியே இது frequent reality.
Small field trial 200 users-ஓட tier-2 மற்றும் tier-3 towns-ல நடத்தினோம். இரண்டு weeks-ல voice-initiated payments-க்கு average success rate 88% இருந்துச்சு. Most failures poor microphone quality-ஓட linked, language understanding issue இல்ல. Feedback-ல natural mix of Hindi மற்றும் English-ல பேசற convenience highlight ஆச்சு. Mid-sentence-ல language switch பண்ண வேண்டாம்னு சொன்னாங்க. இந்த impact semi-urban digital inclusion-க்கு நல்ல boost கொடுக்கும். Banking மற்றும் shopping-ல voice flow adoption அதிகரிக்க வாய்ப்பு இருக்கு.
Use cases என்னென்ன
மூணு scenarios pilot பண்ணோம். முதல்ல voice-enabled shopping assistant Flipkart-like catalogue-ல. Users “Add two shirts under INR 1500 to cart”னு சொல்லி payment confirm பண்ணலாம். இரண்டாவது banking helper. Users spoken commands மூலம் balances check பண்ணி money transfer பண்ணலாம். மூணாவது government-service guide. PAN card applications மற்றும் vaccination slots பத்தி mixed Hindi-English-ல queries answer பண்ணும். ஒவ்வொரு case-லயும் average task completion time traditional touch-flow interface-ஐ விட roughly 30% drop ஆச்சு.
Additional informal tests local kirana store owners-ஓட நடத்தினோம். அவங்க agent-ஐ வைத்து wholesale orders place பண்ணாங்க. Voice flow steps-ஐ ஆறில இருந்து மூணுக்கு குறைச்சது. Store owners ஒரு order-க்கு சுமார் two minutes save ஆகுன்னு report பண்ணாங்க. Shopping-ல cart add மற்றும் payment confirm ஒரே flow-ல முடிஞ்சது. Banking-ல balance check quick-ஆ இருந்துச்சு. Government queries-ல mixed language support நல்லா வேலை செஞ்சது. Kirana owners-க்கு daily orders எளிதாச்சு. இந்த use cases real adoption potential காட்டுது.
Honest take
Indian models மேல build பண்றது promising-ஆ இருக்கு ஆனா trade-offs இல்லாம இல்ல. Understanding model நம்ம test set-ல accurate-ஆ இருந்தாலும் rare regional words மற்றும் heavy code-switching patterns-ல struggle பண்ணுது. Training data-ல less frequently appear ஆன patterns-ல difficulty இருக்கு. TTS voice natural-ஆ இருந்தாலும் excitement இல்ல urgency express பண்ணும்போது occasionally monotone-ஆ ஒலிக்குது. Latency gains device-வின் chipset மேல heavily depend ஆகுது. Older SoCs-ல response time-ல noticeable increase தெரியும். Hardware optimisation parallel challenge-ஆ இருக்கு.
Model maintain பண்ண fresh conversational data steady stream வேணும். Slang மற்றும் payment habits evolve ஆக drift curb பண்ணணும். Quantisation size மற்றும் cost குறைச்சாலும் intent accuracy-ல small drop கொண்டு வந்துச்சு – roughly 1.5 percentage points. அதற்கு lightweight post-processing rule-based correction layer high-confidence intents-க்கு add பண்ணி compensate பண்ணோம். இந்த honest assessment future improvements-க்கு வழி காட்டுது. Rare words handle பண்ண data augmentation தேவை. Prosody improve பண்ண TTS fine-tuning தொடரணும். Older devices-க்கு separate optimisation path பார்க்கணும்.
Future roadmap
முன்னாடி பார்த்தா language coverage-ஐ Tamil மற்றும் Telugu code-switching-க்கு expand பண்ண plan இருக்கு. Upcoming multilingual foundation models Indian research labs-ல இருந்து leverage பண்ணுவோம். On-device federated learning techniques explore பண்ணி accent coverage continuously improve பண்ணுவோம். User privacy compromise ஆகாம இது நடக்கும். இன்னொரு focus area regional language NPCI-approved UPI interfaces-ஓட agent-ஐ integrate பண்றது. Voice-based financial services scope broaden ஆகும்.
கடைசியா detailed benchmark suite publish பண்ண aim வச்சிருக்கோம். Other developers voice agents-ஐ Indian linguistic diversity, latency, cost metrics மேல evaluate பண்ண இந்த suite use பண்ணலாம். Home-grown AI solutions-க்கு transparent ecosystem foster ஆகும். Tamil Telugu expand பண்ணதனால south India coverage அதிகரிக்கும். Federated learning privacy-friendly improvement கொடுக்கும். NPCI integration financial inclusion மேலும் விரிவாக்கும். Benchmark suite community-க்கு standard metrics கொடுக்கும். இந்த roadmap மூலமா voice agent ecosystem இந்தியால வலுப்படும்.
Overall இந்த experiment locally trained models mass-market-க்கு ஏத்த performance கொடுக்க முடியும்னு நிரூபிச்சுது. Code-switching handle பண்ணறதுல 92% accuracy பெரிய milestone. UPI voice flow 3 seconds average-ஆ இருக்கு. Latency 200 ms Jio 5G-ல flagship-ல achieve ஆச்சு. 1.2 GB size offline use enable பண்ணுது. Cost INR 0.04 Flipkart-scale-க்கு போதுமானது. Field trial 88% success real-world viability காட்டுது. Use cases-ல 30% time drop மற்றும் kirana-ல two minutes save practical benefit. Trade-offs இருந்தாலும் correction layers மற்றும் future plans மூலமா address பண்ணலாம். இந்த பாடங்கள் next generation Indian voice agents-க்கு foundation ஆகும்.




கருத்துகள் (0)
Be the first to comment!