離線語音控制:不聯網、不註冊、不上雲
我們有一部分燈具可以在完全沒有網路連線的情況下聽懂口令——識別是在距離 LED 幾釐米的一顆晶片上完成的。 它和"叫智慧音箱開燈"是兩種不同的產品,而且差別是雙向的。
兩種語音,差別不在"聰不聰明"
雲端語音是大多數人說的語音控制。你對著音箱或手機說話,音訊被送到伺服器, 伺服器判斷你的意思,再把指令發回給燈。詞彙是開放的,燈是別人生態裡的一個裝置, 整條鏈路需要一個賬號和一條能用的網際網路連線。
離線語音把一個小型語音識別引擎放進燈具本身。有一個喚醒詞和一組固定指令, 兩者都在生產時燒錄進去。沒有賬號、不需要與助手配對、沒有音訊離開這個房間。 它不是雲端方案的縮水版,而是另一種設計,擅長的事情也不一樣。
離線真正更強的三件事
- 它立刻回應。識別就發生在燈所在的位置,沒有到伺服器的往返。 從說完那句話到燈發生變化的間隔,短到會被感知為"即時"——雲端語音通常做不到。
- 網路斷了它照常工作。路由器重啟、寬頻掉線、某個人的手機上賬號退出了—— 這些都傳不到燈這裡。停電恢復的那一刻是你最想用一句話把燈開啟的時候, 而那恰恰是雲端助手最不可能響應的時候。
- 沒有任何東西離開房間。不存在一路上傳的麥克風音訊流,因為它無處可去。 對臥室、兒童房,或者單純不希望家裡有一臺始終聯網在聽的裝置的人來說, 這一條就是全部理由,不需要別的。
它放棄了什麼
- 指令集是固定的。你沒法自創一句話。有一張清單,清單在生產時就定了, 用這個產品意味著去記它,而不是反過來。多數指令集在十幾到二十幾條——開、關、調亮、調暗、顏色、幾個場景。
- 它只知道自己。"全部關掉"需要有個東西知道"全部"指的是什麼。 一顆裝在某盞燈裡的離線晶片根本不知道別的燈存在。全屋邏輯是助手或閘道器的活, 這是離線語音在結構上做不到的事。
- 喚醒詞不歸你改。它通常可以在定產品時定製——那是製造環節的選項,外銷機型很常見—— 但買燈的人改不了。
一盞燈可以帶離線語音負責快速的本地指令,同時仍然能被 App 或閘道器接管處理其他事情。 有這個選項時通常就是正確答案:不用網路,一句"開燈"立刻響應;而"日落時進入某個場景"這類邏輯, 放在真正能承載它的地方。
誤喚醒比詞彙量重要得多
比較離線語音模組時,大家讀的規格是指令條數,而真正決定你喜不喜歡這個產品的規格是誤喚醒率。 一個會在看電視新聞時自己醒來的模組,比一個只聽得懂十句而不是二十句的模組難相處得多。
描述這件事的是兩個數字,正經的供應商兩個都有:誤接受率——沒人叫它的時候它響應的頻率; 以及誤拒絕率——你正經下了指令它卻裝作沒聽見的頻率。這兩個數字互相拉扯。 把模組調得更不容易被誤觸發,也就同時調得更不容易被有意觸發。有用的問題是: 在有背景噪聲的條件下這兩個數字是多少——安靜房間裡的資料永遠好看。
模組裝在哪兒,和裡面是哪顆晶片同樣重要。麥克風藏在燈罩後面,聽到的是一個悶掉的房間; 朝著天花板,聽到的就是天花板。裝在高處、房間又都是硬表面時,反射聲到得太晚,會把一句話糊掉。 這些在資料手冊上都看不到——所以一個在桌上識別很好的燈具,裝上去之後可能讓人失望, 也所以值得按它真正會待的高度先測一個。
語種是模型,不是設定項
離線識別是按語種分的,這一點跟雲端不同。每個語種是一個單獨的模型編譯進晶片, 所以一個既懂英語又懂普通話的產品是帶了兩個模型,再加第三個是製造決策而不是選單項。 買家會注意到的一個怪現象背後就是這條約束:同一款燈具賣到兩個市場,指令集可能不一樣, 因為那兩套指令集是分別做的。
另一個維度是模型大小。更大的模型在口音和噪聲下識別更穩,佔用的矽片面積也更多; 更小的模型便宜,也更不寬容。對只賣一個市場、口音單一的產品,小模型往往是正確的工程選擇; 對會遇到沒人測試過的口音的外銷產品,通常不是——而一個同時提供兩種規格、 並且能說清你詢價的那顆用的是哪一種的供應商,其實是在告訴你:這產品其餘部分的規格也定得同樣仔細。
怎麼選
- 如果燈需要在停電恢復時、在沒有可靠網路的房間裡、或者在完全沒有云端裝置的環境下工作 ——離線,這個決定已經做完了。
- 如果價值在於跨裝置的邏輯、定時,或者與其他品牌的聯動 ——雲端或閘道器。離線語音做不到,詞彙量再大也改變不了。
- 如果你希望三四句日常用語得到即時響應,其餘的慢一點無所謂 ——兩者都要,前提是燈具支援。多數人最滿意的是這個組合。
- 無論選哪種,都要在真實房間裡、按實際安裝高度、開著電視測一遍。 市面上每一個語音產品,在安靜的展廳裡表現都很好。
我們哪些燈具帶離線語音、帶的那些該配哪個 App,見 我需要哪款 App。