
Gemini 3.6 Flash, 3.5 Flash-Lite και Flash Cyber: το νέο model routing της Google
Το Gemini 3.6 Flash είναι πλέον γενικά διαθέσιμο και φέρνει μαζί του δύο ακόμη σαφώς τοποθετημένα μοντέλα: το Gemini 3.5 Flash-Lite για εργασίες μεγάλου όγκου και το Gemini 3.5 Flash Cyber για αμυντική κυβερνοασφάλεια. Η ανακοίνωση δεν είναι απλώς άλλη μία προσθήκη σε έναν κατάλογο LLM. Για τις ομάδες που χτίζουν AI εφαρμογές, η Google περιγράφει στην πράξη μια οικογένεια μοντέλων που μπορεί να δρομολογεί διαφορετικό workload στο κατάλληλο επίπεδο κόστους, ταχύτητας και ρίσκου.
Τα 3.6 Flash και 3.5 Flash-Lite είναι διαθέσιμα μέσω Gemini API, Google AI Studio και Android Studio, καθώς και σε enterprise επιφάνειες της Google. Το 3.6 Flash διατίθεται επίσης σταδιακά στο GitHub Copilot για coding και μεγαλύτερης διάρκειας agentic εργασίες. Αντίθετα, το Flash Cyber δεν είναι ένα ακόμη δημόσιο API model: η Google DeepMind σχεδιάζει να το διαθέσει σύντομα αποκλειστικά σε κυβερνήσεις και trusted partners, μέσω περιορισμένου pilot του CodeMender.
Gemini 3.6 Flash: λιγότερα loops, όχι μόνο φθηνότερα tokens
Το 3.6 Flash στοχεύει production agents, coding, multimodal reasoning και multi-step tool use. Σύμφωνα με την Google, χρησιμοποιεί 17% λιγότερα output tokens από το 3.5 Flash στο Artificial Analysis Index και ολοκληρώνει σύνθετες ροές με λιγότερα reasoning steps, conversational turns και tool calls. Στο DeepSWE η αναφερόμενη επίδοση ανεβαίνει από 37% σε 49%, ενώ στο OSWorld-Verified η Google καταγράφει 83,0% έναντι 78,4% για το 3.5 Flash.
Η τιμή API είναι 1,50 δολάρια ανά εκατομμύριο input tokens και 7,50 δολάρια ανά εκατομμύριο output tokens. Το input παραμένει στην ίδια τιμή με το 3.5 Flash, αλλά το output πέφτει από τα 9 δολάρια. Το σημαντικότερο, όμως, είναι ότι μικρότερη παραγωγή tokens και λιγότεροι επαναληπτικοί κύκλοι εργαλείων μπορούν να μειώσουν και το μη εμφανές κόστος: latency, αποτυχημένες ενέργειες, περιττές αλλαγές σε αρχεία και χρόνο verification.
Το μοντέλο διαθέτει native Computer Use για agentic αυτοματοποίηση γραφικού περιβάλλοντος. Η επίσημη τεκμηρίωση αναφέρει επίσης context window ενός εκατομμυρίου tokens, έως 64K output tokens και προεπιλεγμένο medium thinking level. Στο GitHub Copilot το rollout είναι σταδιακό και καλύπτει, μεταξύ άλλων, VS Code, Visual Studio, Copilot CLI, cloud agent, JetBrains, Xcode και Eclipse. Οι διαχειριστές Business και Enterprise πρέπει να ενεργοποιήσουν τη σχετική preview policy.
3.5 Flash-Lite: το high-throughput tier
Το Gemini 3.5 Flash-Lite έχει διαφορετικό ρόλο. Είναι το γρήγορο και οικονομικό επίπεδο για agentic search, document processing, structured extraction και εργασίες που εκτελούνται πολλές φορές παράλληλα. Η Google παραθέτει ταχύτητα περίπου 350 output tokens ανά δευτερόλεπτο, με μέτρηση της Artificial Analysis, και τιμή 0,30 δολάρια ανά εκατομμύριο input tokens και 2,50 δολάρια ανά εκατομμύριο output tokens.
Υποστηρίζει configurable thinking levels. Με minimal ή low thinking μια εφαρμογή μπορεί να δώσει προτεραιότητα σε latency και κόστος, ενώ τα υψηλότερα επίπεδα μπορούν να χρησιμοποιηθούν για πιο σύνθετα subagent workloads. Δεν είναι απλώς μια υποβαθμισμένη έκδοση: στα benchmarks που δημοσιεύει η Google, το Flash-Lite ξεπερνά το παλιότερο Gemini 3 Flash σε SWE-Bench Pro, με 54,2% έναντι 49,6%, και σε OSWorld-Verified, με 74,0% έναντι 65,1%. Όπως και το 3.6 Flash, υποστηρίζει native Computer Use.
3.5 Flash Cyber: εξειδίκευση με αυστηρή πρόσβαση
Το Gemini 3.5 Flash Cyber βασίζεται στο 3.5 Flash και έχει γίνει fine-tune για εντοπισμό, επαλήθευση και διόρθωση ευπαθειών. Μέσα στο CodeMender, πολλαπλοί Flash Cyber agents εξερευνούν διαφορετικά code paths και συνθέτουν μία τελική αναφορά. Αυτή η αρχιτεκτονική επιτρέπει περισσότερες παράλληλες προσπάθειες από μία μοναδική, ακριβή κλήση σε μεγάλο μοντέλο.
Η Google DeepMind αναφέρει ότι το μοντέλο χρησιμοποιείται ήδη σε εσωτερικές βάσεις κώδικα όπως Chrome, Android, Cloud, Ads και YouTube. Στο V8 βρήκε 55 μοναδικά επιβεβαιωμένα ζητήματα, έναντι 47 για το mainline 3.5 Flash και 36 για το Claude Opus 4.6, σύμφωνα πάντα με τις αξιολογήσεις της εταιρείας. Επειδή αυτές οι δυνατότητες είναι σαφώς dual-use, η περιορισμένη πρόσβαση είναι μέρος του ίδιου του product design και όχι μια προσωρινή λεπτομέρεια marketing.
Ένα πρακτικό model-routing σχήμα για developers
Για μια production AI εφαρμογή, το πιο χρήσιμο συμπέρασμα είναι να σταματήσει η επιλογή μοντέλου να γίνεται μία φορά για ολόκληρο το σύστημα. Ένα απλό routing layer μπορεί να διαχωρίζει τις εργασίες με βάση πολυπλοκότητα, όγκο, εργαλεία, επιτρεπόμενο latency και απαιτούμενο verification.
- 3.5 Flash-Lite: indexing, summarization, file classification, context compression, structured extraction και παράλληλη εξερεύνηση.
- 3.6 Flash: coding workers, Computer Use, multi-step tooling, document analysis και tasks που χρειάζονται καλύτερο instruction following.
- Ισχυρότερο frontier model: αρχιτεκτονική, δύσκολα bugs, κρίσιμες αποφάσεις και τελικό verification όταν το κόστος αποτυχίας είναι υψηλό.
Αυτό το σχήμα ταιριάζει ιδιαίτερα σε εφαρμογές τύπου Google Agentspace και enterprise AI agents, όπου η αναζήτηση, η συμπίεση context, η εκτέλεση εργαλείων και η τελική έγκριση δεν έχουν τις ίδιες απαιτήσεις. Ταιριάζει επίσης σε AI εργαλεία που γράφουν κώδικα από prompts, επειδή το planning, η υλοποίηση, τα tests και το review μπορούν να ανατεθούν σε διαφορετικά tiers.
Το metric που αξίζει: κόστος ανά verified task
Η σύγκριση μόνο με τιμή ανά token μπορεί να οδηγήσει σε λάθος επιλογές. Για έναν agent, το πραγματικό κόστος περιλαμβάνει το prompt, τα reasoning και output tokens, τις κλήσεις εργαλείων, το latency, τις αποτυχημένες επαναλήψεις και το verification από μοντέλο ή άνθρωπο. Ένα ακριβότερο μοντέλο ανά token μπορεί να βγει φθηνότερο αν ολοκληρώνει την εργασία με λιγότερα loops και λιγότερες διορθώσεις.
Στην πράξη, οι ομάδες πρέπει να μετρούν ανά κατηγορία task: ποσοστό επιτυχίας, συνολικά tokens, αριθμό tool calls, χρόνο μέχρι την ολοκλήρωση και ποσοστό αποτελεσμάτων που περνούν τα tests χωρίς επανάληψη. Το 17% λιγότερων output tokens είναι ενδιαφέρον, αλλά αποκτά επιχειρησιακή αξία μόνο όταν συνδέεται με περισσότερα verified αποτελέσματα ανά ευρώ και ανά λεπτό.
Η νέα οικογένεια Flash κάνει το model routing πιο καθαρό: οικονομική παράλληλη επεξεργασία στο Lite, ουσιαστική agentic εργασία στο 3.6 Flash και αυστηρά ελεγχόμενη εξειδίκευση για cyber defense. Το επόμενο βήμα για τους developers δεν είναι απλώς να αλλάξουν ένα model ID, αλλά να σχεδιάσουν observability και evaluation γύρω από κάθε route.
















