Engineering · August 2026

हमने Search, Tagging, और Recommendations को Cloud से बाहर क्यों शिफ्ट किया

Search, dedup, tag cleanup, और recommendations एक ही छोटा on-device index शेयर करते हैं। जानिए यह कैसे काम करता है, और यह सिर्फ़ एक privacy talking point क्यों नहीं है।

ज़्यादातर "AI-powered" browser extensions सब कुछ server पर भेज देते हैं — यहाँ तक कि उन चीज़ों को भी जिनका AI से कोई लेना-देना नहीं है। Search, tag cleanup, "find similar items": ये दशकों पुरानी, well-understood टेक्निक्स हैं। इन्हें किसी language model की ज़रूरत नहीं है, और network round-trip की तो बिल्कुल नहीं। हमने AI Summary Helper के हर feature को एक-एक करके परखा और पूछा: क्या इसे वाकई cloud की ज़रूरत है, या हम बस इसलिए cloud यूज़ कर रहे हैं क्योंकि यह आसान architecture है?

उनमें से ज़्यादातर को इसकी ज़रूरत नहीं थी।

असल में क्या-क्या on-device शिफ्ट हुआ

Search. पहले यह extension केवल article title और tags से मैच करता था — तेज़ तो था, लेकिन article body में क्या है, यह नहीं देख पाता था। हर keystroke पर brute-force full text scan करने या हर query को server पर भेजने के बजाय, हमने user के सेव किए गए archive से एक छोटा TF-IDF index तैयार किया। सस्ते fields — जैसे title और tags — पहले और तुरंत चेक होते हैं, बिल्कुल पहले की तरह। लंबी queries को इस index के ज़रिए मैच किया जाता है, जो हर session में सिर्फ़ एक बार बनता है और incrementally update होता है, न कि हर keystroke पर दोबारा scan होता है।

Duplicate detection. Save पूरा होने से पहले एक tiered check चलता है: सबसे पहले exact normalized URL match (सस्ता, O(1)), फिर उस फ़िल्टर को पास करने वाले कुछ चुनिंदा candidates पर title similarity, और सिर्फ़ तभी — बचे हुए कुछ candidates के लिए — एक पूरा TF-IDF cosine-similarity comparison। ज़्यादातर saves कभी महंगे tier तक पहुँचते ही नहीं हैं, क्योंकि सस्ते tiers उन्हें पहले ही resolve कर देते हैं।

Tag normalization. समय के साथ tags में drift आ जाता है — जैसे "ML", "Machine Learning", "machine-learning" इंसान के लिए एक जैसे हैं, लेकिन filter के लिए बिल्कुल अलग। एक छोटी alias table साफ़ मामलों को पकड़ लेती है; और बाकी के लिए पूरी tag vocabulary पर fuzzy edit-distance merge काम करता है, जो user द्वारा सबसे ज़्यादा इस्तेमाल की गई spelling को canonical form मान लेता है, बजाय इसके कि उन पर कोई "सही" spelling थोपी जाए।

Readability और tone. Flesch–Kincaid grade level सिर्फ़ sentence और syllable counts का सीधा arithmetic है — किसी model की ज़रूरत नहीं। Sentiment के लिए एक bundled AFINN wordlist है, जिसमें पिछले दो tokens पर एक छोटा negation check होता है। इनमें से किसी को भी browser से बाहर जाने की ज़रूरत नहीं थी।

"Similar articles" और Digest. ये दोनों बिल्कुल उन्हीं TF-IDF vectors को reuse करते हैं जो search पहले ही बना चुका होता है। तीन अलग-अलग features के लिए तीन अलग similarity systems बनाना आसान होता। लेकिन एक ही index बनाकर search, recommendations, और digest curation को उसी से पढ़ने देना पूरे system को हल्का रखता है — यानी index को एक बार बेहतर करने से तीनों features एक साथ बेहतर हो जाते हैं।

हमने जानबूझकर क्या cloud में रहने दिया

असल summarization step — वह हिस्सा जिसमें वाकई एक language model की ज़रूरत होती है — अभी भी network call पर निर्भर करता है। अगर आपको cloud-tier model जैसी output quality चाहिए, तो मौजूदा on-device model sizes के साथ इससे बचा नहीं जा सकता। Users इस step के लिए अपनी खुद की API key इस्तेमाल कर सकते हैं (OpenAI, Gemini, Mistral, DeepSeek), या extension को local Ollama instance से कनेक्ट करके इस step में भी network calls और API costs पूरी तरह बचा सकते हैं। बस यही एक जगह है जहाँ "on-device" default नहीं है — यह opt-in है, क्योंकि यहाँ tradeoff साफ़ है: local model hosted model से धीमा और कम quality वाला होता है, और हम इस बात को छुपाना नहीं चाहते थे।

यह सिर्फ़ एक privacy talking point से बढ़कर क्यों है

Privacy का पहलू पूरी तरह वाजिब है — broad host permissions वाला extension अगर उन चीज़ों के लिए भी page content server पर भेजे जिनकी ज़रूरत ही नहीं है, तो यह भरोसे का सवाल बन जाता है, सिर्फ़ दिखावा नहीं। लेकिन इसे करने की सबसे बुनियादी वजह यह है कि आमतौर पर यही सही engineering decision होता है। TF-IDF search को 200ms network latency की ज़रूरत नहीं है। Tag deduplication के लिए फालतू API bill भरने की ज़रूरत नहीं है। हर चीज़ को default रूप से cloud पर भेजने के बजाय सही काम के लिए सही tool चुनना इसे तेज़ बनाता है, चलाने में बेहद किफ़ायती रखता है, और offline भी बिना रुकावट काम करने देता है — privacy का फ़ायदा तो इसके साथ अपने आप बिल्कुल मुफ़्त मिल जाता है।

AI Summary Helper एक फ़्री Chrome extension है।

Chrome में जोड़ें