

Key style requirements: - Start with a concrete image/imagination - No clichés like 首先其次最后, no colons, no em dashes, no double quotes - Banned words: 说白了、意味着什么、本质上、换句话说、不可否认、震撼、赋能、助力、打造 - No direct emotional expression, no textbook openings - Core imagery throughout the article - Length 4000-8000 characters - Mix classical skeleton into modern Chinese - Use 想象一个场景 as title (which is already in source) - Personal perspective with 我想起了, 我总觉得 - Round structure - end returns to beginning image - Restrained lyricism - Sensory overlap (synesthesia) - No subtitles, flowing like prose

Let me think about the core imagery. The title is "想象一个场景" - and the source material starts with this scene of walking home and talking to the phone. I should anchor the whole piece around this image of a person walking on a road, talking to AI.

The article should cover: 1. The opening scene (walking, asking about flights and coffee) 2. The shift to GPT-Live and what it actually is (front desk + back office) 3. The old contradiction of voice AI (fast vs smart) 4. GPT-Live's solution (delegation architecture) 5. The product rough edges (no video, no B2B, pricing, 嗯嗯 problem) 6. The competitive landscape (domestic: Doubao, MiniMax, 面壁, Xiaomi; international: Google, ElevenLabs) 7. The future of voice as the default interface 8. Return to the opening scene

Let me think about a core imagery that threads through. The "前台/后台" (front desk/back office) is already a great image. Maybe I can extend it - a hotel front desk, a hospital reception, an old switchboard operator, a translator at a UN summit...

Or maybe "the gap between you and the answer" - 沉默的三秒 as something physical.
Let me think more. The source material's key line is "它把自己变成了一个'前台'。真正干活的,是后面的 GPT-5.5。"
I could weave this with imagery of: - 一个酒店的前台 (a hotel front desk) - 旧时代的接线员 (old telephone operators) - 乐队指挥 vs 乐手 (conductor vs musicians) - 同声传译箱 (simultaneous interpretation booth)
I think the 同声传译 booth is good because it ties to "同声传译要失业了" from the source. Let me use the image of a simultaneous interpreter's booth throughout.
Or maybe I'll layer it with another image - the front desk of an old hotel, where there's someone always listening, always answering, but the real work happens in the back rooms.
Actually, let me think about this more poetically. The whole piece is about the latency, the 沉默三秒, the gap between human speech and machine response. The imagery could be about that gap:
- 一个人走进大堂,前台的人递来一把钥匙,但钥匙要在后面那间屋子里才能铸出来
- 你说一句话,它要穿过几面墙,才能拿到答案
- 像同声传译的小箱子,玻璃后面有人,玻璃前面是你
Let me draft this now. I'll aim for 5000-6000 characters which is a substantial piece.
Structure: - Open with the scene from source: walking, talking to phone - The latency/three seconds of silence - but this is what changes - Move into GPT-Live as the front desk - The old problem: fast or smart - The booth metaphor - simultaneous interpreter - The 4.96 score jump - The developer's one-hour walk story - The rough edges (no video, no B2B, 嗯嗯) - The wider landscape (domestic and international players) - Voice as the next default interface - Return to the scene: walking, asking about flights and coffee
Style notes: - Use 想起了, 我总觉得 - Use 啊, 吧 sometimes - Short/long sentence alternation - Imagistic descriptions - Classical undertones - No exclamation marks probably - No double quotes (use 「」 or just leave them out)
Let me write this out:
Draft:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏的余温和烤红薯的甜。你走在人行道上,刚从写字楼出来,肩膀还挂着屏幕的光。
你随口说,「帮我查一下今晚的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。」
手机掏出来之前,Siri和小爱通常会沉默三秒。那三秒不长,却够让人烦躁。它在想什么呢?它什么都没有在想。它只是在转圈,调用一个又一个接口,把网页摘要拼起来。然后念给你听,像一台带感情朗读功能的复印机。
或者更糟,它摊开双手,说,我暂时还做不到。
这是过去几年语音AI的一个日常切面。快和聪明,仿佛是一道选择题的两个选项,永远站在彼此的对面。
直到一件新的事情发生。
上周,OpenAI正式发布了GPT-Live。社区里传得最热闹的是两句话,一是像真人一样说话,二是同声传译要失业了。但说实话,这些只是表层。它真正的变化在于——
它把自己变成了一个前台。真正干活的,是后台那个叫GPT-5.5的家伙。
要理解这个变化为什么重要,得先聊聊语音AI这些年卡住的地方。
...等等,我没有冒号。
Let me rewrite without colons and em dashes. Also, I shouldn't use markdown headings probably (the instructions say no subtitles like an essay flowing).
Let me re-draft more carefully:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏余温和烤红薯的甜。你走在人行道上,刚从写字楼出来,肩膀还挂着屏幕上残留的冷光。
你随口说,帮查一下今晚航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。
手机还没掏出来,Siri和小爱大概率会沉默三秒。
那三秒其实不长。但它有种魔力,能把人一瞬间从对话里甩出来。你说出去的话掉进一个深井里,等井底有什么动静传上来,已经忘了刚才在期待什么。它在转圈,调用接口,念一段网页摘要。像一台会朗读的复印机,语气恭敬,内容空心。再不然,就是摊开双手说,我暂时还做不到。
这是过去几年语音AI的日常切面。快和聪明,像一道选择题的两个选项,永远站在彼此的对面。
直到一件新的事情被摆上桌面。
OpenAI发布了GPT-Live。社区里最先传开的两句话是,像真人一样说话,同声传译要失业。说实话,这些都是表层。它真正改变的地方在于,
它把自己变成了一个前台。真正干活的,是后台那个叫GPT-5.5的家伙。
要理解这件事为什么重要,得聊聊语音AI这些年卡住的死结。
...
OK let me continue writing more carefully. I need to weave the imagery throughout. Let me think about a core image - I'll use the simultaneous interpretation booth (同声传译), since it connects directly to the source and is such a vivid image: glass booth, earphones, someone inside translating in real time.
Actually, let me also use the "hotel front desk" - a place that's always awake, always polite, but the real work happens somewhere you can't see.
Let me think about the central tension - the gap, the silence, the 3 seconds. That's the core experience being changed. So maybe the imagery is about crossing gaps.
Let me draft a full piece:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏的余温和远处烤红薯的甜。你走在人行道上,刚从写字楼里出来,肩膀上还挂着屏幕上残留的冷光。
你随口说了一句,「帮我查一下今晚的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。」
手机还没掏出来。Siri和小爱大概率会沉默三秒,然后开始念一段网页摘要。再不然,就是摊开手,抱歉,我暂时还做不到。
那三秒其实不长,但它有种把人从对话里甩出去的魔力。你说出去的话掉进一个深井里,等井底有动静传上来,连自己刚才期待什么都快忘了。它在转圈,调用一个又一个接口,把摘要拼起来念给你听。像一台会朗读的复印机,语气恭敬,内容空心。
或者更干脆点,抱歉,做不到。
这是过去几年语音AI的一个日常切面。快和聪明,像一道选择题的两个选项,永远站在彼此对面。它们被焊死在同一个模型的两头,想要哪头就得舍弃另一头。所以我们见到的语音助手,要么像Siri一样反应快,但蠢得很稳定;要么像老版ChatGPT Voice,有点聪明,但常沉默到让人在客厅里尴尬地咳嗽。
直到OpenAI正式发布了GPT-Live。
社区里传得最响的两句话是,像真人一样说话,同声传译要失业。说实话,这些都是水面上的浪花。
这模型真正的变化是,它把自己降格成了一个前台。真正干活的,是后台的GPT-5.5。
...
Let me think about the next section - the architecture explanation. I want to keep this literary. Maybe use the image of a translator's booth - the front of the booth you see, the back room where the real work happens.
继续。从同传箱讲起。
老式同声传译的玻璃小箱子我们都见过。译员坐在里面,耳朵里塞着耳机,嘴贴近话筒。外面的人看见的是一个安静的、有条不紊地说话的人。但你看不见的那半边,才是他真正用力气的地方。耳机里塞满了密集的信息流,他的大脑几乎在同时进行着三件事,听,理解,译。
GPT-Live做的事情有一种结构上的相似。它是一间透明的同传箱,或者说一个非常能干的前台大堂。它做的事有,
反应快。延迟低。你说话它在听,你停顿它知道该接,你打断它不会硬着头皮念完。这是前台的本分,把人和后面那间屋子的距离感抹掉。
后台,是GPT-5.5。当对话中冒出搜索、推理、数学、复杂任务,GPT-Live就把它打包甩进后台。GPT-5.5在后面跑完,把结果传回来,GPT-Live再用人话念给你听。
更细的分级是,Instant或mini模式,后台跑的是GPT-5.5 Instant;Medium或High模式,后台跑的是GPT-5.5 Thinking。
OpenAI管这叫委派,delegate。一个我听到时觉得有点孤独的词。它让我想起小时候百货大楼里那些永远站得笔直的导购员。她们解决不了的,就转身,对着后面仓库的方向轻轻喊一声。
官方给了一个数字。相比上一代语音模式,GPT-Live的对话流畅度从3.80分跳到4.96分,满分7分。数字不大,但放在那段长达两三秒的停顿面前,已经算得上一个清晰的解法。
一个拿到内测的开发者说,他在散步时跟GPT-Live连续聊了一个小时。它会先接着话,把对方的节奏接住,让后台的答案慢慢跑出来,最后不慌不忙地送到嘴边。听起来像散文里的留白。
官方演示里更是把这种用法推到了极致。有人拿着它当搜索引擎使,问天气,问实时信息流,东一句西一句,所问之物都答得真实有效。它不再像Siri那样只能接住简单的命令,而是把那种「有点复杂的问题」也包揽了进来。
这是个相当漂亮的产品思路。也因此显得接下来的几个槽点更值得记一笔。
...
然后是缺点部分。让我用更文学的方式写。
不过再漂亮的架构,也还有几道没填完的缝。
GPT-Live上线的时候,不支持视频,不支持屏幕共享。你不能举着手机让它看你眼前的东西,至少目前不行。这像是一个人耳朵和嘴都好使,偏偏被蒙住了眼。
它暂时不面向企业用户,也不在桌面端App、Codex和自定义GPT里露面。OpenAI连API的定价都还没公布。参考上代gpt音频模型,输入价格是每百万token 32美元,输出64美元,mini版便宜一些,10和20美元。但语音API的坑还不止这些。模型说出口之后,哪怕被中断的对话也会算钱,连续打断几次,成本会像水一样漫上来。总体看,不便宜。
还有一个细节,是它学会了「嗯嗯」「对」这种垫话。但有时会过于主动地打断你。
我每次听别人讲起这种细节,都忍不住笑。机器在学「嗯嗯」这件事本身,就带着一种卑微的认真。一个算法在练习做一个有礼貌的倾听者,听起来像极了我们第一次学用筷子夹花生,怕掉,又怕不出声。
...
然后是赛道部分。这里有很多公司列举。让我用更诗意的方式组织。
把视线放宽一点,这条赛道上,大家押的注都不一样。
字节豆包四月上线了全双工语音模型Seeduplex,这是国内第一个规模化落地的全双工语音模型。它解决的核心问题也是,边听边说,不抢话,不误打断。但豆包目前重心还是在对话体验层。它能和AI共享屏幕、打视频,但没打出后台委派强模型这张牌。像一个手艺不错的茶馆,听得热闹,后厨不大。
MiniMax一月发布了MiniMax Speech 2.8,主打TTS和声音克隆。它专门补真人说话里的小瑕疵,um,ah,呼吸,停顿,清嗓子这些语气标签。用户给一段十秒参考音频,它就能做声音克隆,还要那种录音棚级的干净输出。价格上,turbo版60美元每百万字符,hd版100美元每百万字符。它更像一个内容生产工具,有声书、短视频配音、AI角色、客服播报,是它的主战场。
面壁智能四月发了MiniCPM-o 4.5,走全模态全双工路线,端侧开源小钢炮。它能在同一条时间轴上同时处理视觉、环境音频和输出流。简单说,就是边看,边听,边说。比GPT还要全能,而且开源免费。它还有VoxCPM,支持30种语言和9种中文方言,能做音色设计,可控声音克隆,原生48kHz音频输出。
小米七月上线了MiMo-V2.5-TTS Series加ASR。其中ASR主打语音识别,支持中英双语、粤语、吴语、闽南语、四川话,强噪音、多说话人、歌词识别都包了。按音频转写时长计费,0.5元一小时。
海外那边,Google推的是Gemini 3.1 Flash Live Preview,主打低价多模态。每分钟大概0.036美元,比OpenAI上代gpt-realtime便宜一个数量级。还单独出了Gemini 3.5 Live Translate,支持70多种语言实时翻译,每分钟输入不到1美分。比的就是谁便宜,谁快,谁的语种多。
垂类玩家里比较知名的是ElevenLabs。它走企业语音Agent路线,极致音色还原,电话SIP接入,RAG知识库,每分钟通话0.08美元。
拉开来看,大家押的方向不太一样。但所有人都在押同一件事,语音会成为AI的下一个默认入口。
...
接下来是最后一部分,关于「说话比打字更自然」。
OpenAI说,每周有超过1.5亿人在用ChatGPT的语音和听写功能。
当我看见这个数字,总会想起小区门口那位永远笑着打招呼的保安大叔。他不会写字,但他会跟每一个人说,「今天天气不错」。那是他处理这个世界的方式。声音,有时候比文字更古老,更接近我们呼吸的节奏。
GPT-Live押的是哪些场景呢。通勤,做饭,开车,跑步,带孩子。这些时刻里你的双手都不属于你自己,但你的嘴是。让前台负责像人,让后台负责有用。这两件事能不能真正在一个产品里平衡好,可能要等几亿人用起来之后才能下结论。
但回到开头那个场景。
你走在路上,随口问了一句航班和咖啡店的事。三秒的井口,这一次没有再等下去。前台接住了你说的那句轻飘飘的话,把它转交给后台。GPT-5.5在远处安静地开始查机场的实时数据,搜周围的咖啡店。过了一会儿,GPT-Live嘴里不急不缓地吐出答案,今晚航班没有晚点,公司东边五百米有一家,可以坐两个小时。
你听到这些,没有太惊喜,也没有不惊喜。只是觉得今天这路,走得比昨天顺一点。
而巷口的灯,开始一盏一盏亮起来。
OK, this is shaping up. Let me check: - Starts with concrete image ✓ (the scene of walking) - ~5000 characters estimate, in 4000-8000 range ✓ - Mixed classical/modern ✓ - Imagery throughout (same传译箱, 前台大堂, 沉默三秒深井, 留白, 垫话学筷子, 茶馆后厨, 保安大叔) - Time folds ✓ (referring to old Siri, childhood 百货大楼) - Round structure ✓ (returns to opening scene) - Personal voice ✓ (我每次, 我听到时觉得有点孤独, 当我看见) - No colons ✓ (changing to commas) - No em dashes ✓ (had to be careful) - No double quotes ✓ (using 「」 or none) - No 首先其次最后 ✓ - No banned words ✓ (need to check) - No direct emotional declaration ✓ - Subtitle flow without headings ✓ - Imagery anchoring: I'm using 前台/后台 and 同传箱 as the two core images
Let me double-check banned words: - 说白了 - not used ✓ - 意味着什么 - not used - 本质上 - not used - 换句话说 - not used - 不可否认 - not used - 震撼 - not used - 赋能 - not used - 助力 - not used - 打造 - not used ✓
Good. Let me check punctuation: - ":" should not be used - hmm I might have one for markdown formatting. Need to convert to comma - "——" should not be used - "" should not be used - I'm using 「」
Wait, the rule says "不使用双引号用「」" so that should be fine. Let me check the source material - it uses 「」 for quotes. So I can use 「」.
Actually re-reading: "不使用双引号用「」" - this means use 「」 instead of """. So 「」 is OK.
Let me also check for colons ":" - I should replace with commas (,). Let me scan my draft... I don't see any in the prose.
Let me also make sure the piece is around 5000-6000 characters. Let me count roughly... my draft is roughly that.
Let me also think about the AI改写率100% requirement - this means I need to fully rewrite, not paraphrase sections. The structure can match the source (it's organized around the same topic) but the language must be original. My draft is original.
Now let me think about whether I missed any key points: - GPT-Live's architecture (前台+后台) ✓ - 4.96/3.80 score improvement ✓ - No video/screen share ✓ - No B2B, no Codex ✓ - Pricing not announced, reference prices ✓ - 嗯嗯 filler issue ✓ - Domestic players: 豆包, MiniMax, 面壁, 小米 ✓ - International: Google, ElevenLabs ✓ - Voice as next default interface ✓ - 1.5亿人 stat ✓ - Return to opening scene ✓
I should also weave in the specific numbers more naturally: - 32/64 美元 per million tokens - 10/20 for mini - Doubao 4月 - MiniMax 1月 - 面壁 4月 - 小米 7月 - Google 0.036 dollars/min - ElevenLabs 0.08 dollars/min - MiniMax 60/100 - 1.5亿人 - 3.80/4.96
Some of these are very specific. I should include them but naturally.
Let me also think about length. I think 5000-6000 chars is a good target. Let me write out the final version more carefully.
One more thought - I want to make sure the imagery is strong throughout. Let me consider adding one more strong image. The idea of 「沉默三秒的深井」 is good. The 同传箱 is excellent. The 前台大厅/仓库 is great. Maybe I can add an image about 中断/打断:
「被打断的对话也会算钱」 - this could be a striking image. Let me think...
Maybe: 「它像一个吝啬鬼的账本,连对方刚说出口就咽下去的那半句话,也要算清楚。」 Or: 「它像一根接着水管的杯子,轻轻一碰就满溢。」
Hmm, let me refine. Let me also think about how to weave in the 4.96 score nicely.
OK let me now write the final version. I'll aim to write it cleanly.
Let me also make sure to add the fixed footer at the end. The instructions say:
固定尾部: 以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~ 谢谢你读到这里。下次见。
/ 作者:炽驹Polaris / 投稿或爆料,请联系邮箱:wsyxjer@gmail.com
So I need to add this at the end.
Let me write the final version now:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏的余温和远处烤红薯的甜。你走在人行道上,刚从写字楼里出来,肩膀上还挂着屏幕残留的冷光。
你随口说了一句,「帮我查一下今晚的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。」
手机还没掏出来。Siri和小爱大概率会沉默三秒,然后开始念一段网页摘要。再不然,就是摊开手说,我暂时还做不到。
那三秒其实不长。但它有把人从对话里甩出去的魔力。你说出去的话掉进一口深井里,等井底有什么动静传上来,连自己刚才期待什么都快忘了。它在转圈,调用一个又一个接口,把摘要拼起来念给你听。像一台会朗读的复印机,语气恭敬,内容空心。
这是过去几年语音AI的日常切面。快和聪明,像一道选择题的两个选项,永远站在彼此对面。它们被焊死在同一个模型的两端,想要哪头,就得舍弃另一头。所以我们见到的语音助手,要么像Siri一样反应快,但蠢得很稳定;要么像老版ChatGPT Voice,有点聪明,但常沉默到让人在客厅里尴尬地咳嗽。
直到OpenAI在上周把GPT-Live摆上了桌面。
社区里最先传开的两句话是,「像真人一样说话」,「同声传译要失业了」。说实话,这些都是水面上的浪花。
这模型真正的变化是,它把自己降格成了一个前台。真正干活的,是后台那个叫GPT-5.5的家伙。
要弄明白这件事为什么重要,得聊聊语音AI这些年卡住的死结。
我总想起同声传译的那间玻璃小箱子。译员坐在里面,耳朵里塞满耳机,嘴贴近话筒。外面的人看见的是一个安静的、有条不紊地说话的人。但你看不见的那半边,才是他真正用力气的地方。耳机里全是密集的信息流,他的大脑几乎在同时进行三件事,听,理解,译。
GPT-Live做的事情有一种结构上的相似。它是一间透明的同传箱,又或者是一个格外能干的前台大堂。你说话的时候它在听,你停顿它知道该接,你打断它不会硬着头皮念完。这都是前台的本事,把人和后面那间屋子的距离感抹平。
后台,是GPT-5.5。当对话中冒出搜索、推理、数学或者复杂任务的时候,GPT-Live就把这个问题打包甩进后台。GPT-5.5在另一头跑完,把结果传回来,GPT-Live再用自然语言说给你听。
更细的分级是,Instant或mini模式,后台跑的是GPT-5.5 Instant;用Medium或High模式,后台跑的是GPT-5.5 Thinking。
OpenAI把这套机制叫做委派,delegate。一个我第一次听到时觉得有点孤独的词。它让我想起小时候百货大楼里那些永远站得笔直的导购员。她们解决不了的,就转身对着后面仓库的方向轻轻喊一声,那声音穿过货架、穿过塑料布、穿过某种说不清的孤独,最后有人接住。
OpenAI给了一个数字。相比上一代语音模式,GPT-Live的对话流畅度从3.80分跳到4.96分,满分七分。变化幅度不大,但放在那段长达两三秒的沉默面前,已经算得上一个清晰的解法。
一个拿到内测的开发者说,他在散步时跟GPT-Live连续聊了一个小时。它会先把话接住,让后台的答案慢慢跑出来,再不慌不忙地送到你嘴边。听起来像散文里那种恰到好处的留白。
官方演示把这种用法推到了极致。有人把它当搜索引擎使,问天气,问实时信息,东一句西一句,所问之物全部答得真实有效。它不再像Siri那样只能接住几个简单的命令,而是把那种「有点复杂」的问题也包揽了进来。
这是个相当漂亮的产品思路。也因此接下来这几道没填完的缝,更显得值得记上一笔。
GPT-Live上线的时候,不支持视频,也不支持屏幕共享。你不能举着手机让它看你面前的东西,至少目前不行。这像是一个耳朵和嘴都好使的人,偏偏被蒙住了眼睛。
它暂时不面向企业用户,也不露面于桌面端App、Codex和自定义GPT。连API的定价都还没公布。参考上代gpt音频模型,输入价格每百万token 32美元,输出64美元,mini版便宜些,10和20美元。但语音API的坑还不止这些。模型说出口后,哪怕被中断的对话也会算钱,连续打断几次,成本就像水一样漫上来。总体看,不便宜。
还有一个细节,是它学会了「嗯嗯」「对」这种垫话。但有时会过于主动地打断你。
我每次听别人讲起这种细节都忍不住笑。一个算法在学「嗯嗯」这件事本身,就带着一种谦卑的认真。它像一个第一次学用筷子夹花生的人,怕掉,又怕不出声。
把视线放宽一点,这条赛道上,大家押的注不一样。
字节豆包四月上线了全双工语音模型Seeduplex,算是国内第一个规模化落地的全双工语音模型。它解决的核心问题也是边听边说、不抢话、不误打断。但豆包目前的重心还是在对话体验层面。它能和AI共享屏幕、打视频,却没打出后台委派强模型这张牌。像一个手艺不错的茶馆,前厅热闹,后厨不大。
MiniMax一月发布了MiniMax Speech 2.8,主打TTS和声音克隆。它专门补真人说话里的小瑕疵,um,ah,呼吸,停顿,清嗓子这些语气标签。用户给一段十秒参考音频,它就能做声音克隆,还强调那种录音棚级的干净输出。价格上,turbo版是60美元每百万字符,hd版100美元每百万字符。它更像一个内容生产工具。有声书、短视频配音、AI角色、客服播报,都是它的主战场。
面壁智能四月发了MiniCPM-o 4.5,走全模态全双工的路线,端侧开源的小钢炮。它能在同一条时间轴上同时处理视觉、环境音频和输出流。简单说,就是边看,边听,边说。比GPT还要全能,而且开源免费。它还有VoxCPM,支持三十种语言和九种中文方言,能做音色设计,可控声音克隆,原生48kHz音频输出。
小米七月上线了MiMo-V2.5-TTS Series加ASR。其中ASR主打语音识别,支持中英双语、粤语、吴语、闽南语、四川话,强噪音、多说话人、歌词识别都包了。按音频转写时长计费,0.5元一小时。
海外那边,Google推的是Gemini 3.1 Flash Live Preview,主打低价多模态。每分钟大概0.036美元,比OpenAI上代便宜一个数量级。还单独出了Gemini 3.5 Live Translate,支持七十多种语言实时翻译,每分钟输入不到一美分。比的就是谁便宜,谁快,谁的语种多。
还有一家垂类玩家,ElevenLabs。它走企业语音Agent的路线,核心卖点是极致音色还原、电话SIP接入、RAG知识库,每分钟通话0.08美元。
拉开来看,各家押的方向不太一样。但所有人都在押同一件事,语音会成为AI的下一个默认入口。
OpenAI说,每周有超过1.5亿人在用ChatGPT的语音和听写功能。
这个数字让我想起小区门口那位永远笑着跟人打招呼的保安大叔。他不会写字,但他会跟每一个人说,今天天气不错。那是他处理世界的方式。声音有时候比文字更古老,更接近我们呼吸的节奏。
GPT-Live押的是哪些场景。通勤,做饭,开车,跑步,带孩子。这些时刻里你的双手都不属于你自己,但你的嘴是。让前台负责像人,让后台负责有用。这两件事能不能真正在一个产品里平衡好,可能要等几亿人真的用起来之后才看得清。
但回到开头那个场景。
你走在路上,随口问了一句航班和咖啡店的事。三秒的井口,这一次没有再等下去。前台接住了你说的那句轻飘飘的话,转交给后台。GPT-5.5在远处安静地翻机场数据,扫周围的咖啡店。过了一会儿,GPT-Live不急不缓地吐出答案,今晚航班没延误,公司东边五百米有一家,可以坐两个小时。
你听完,没怎么惊喜,也没怎么不惊喜。只是觉得今天这路,比昨天走得顺一点。
而巷口的灯,正一盏一盏亮起来。
OK let me count roughly... this looks like maybe 4500-5000 chars. Good.
Let me refine a bit and make sure the flow is smooth. Let me also double-check:
- No colons ":" - let me scan... I don't see any in the prose. ✓
- No em dashes "——" - none ✓
- No double quotes "" - using 「」 where needed ✓
- No banned words - let me check:
- 说白了 ✓ (no)
- 意味着什么 ✓ (no)
- 本质上 ✓ (no)
- 换句话说 ✓ (no)
- 不可否认 ✓ (no)
- 震撼 ✓ (no)
- 赋能 ✓ (no)
- 助力 ✓ (no)
- 打造 ✓ (no)
Wait, the source material uses 「」-style quotes consistently, but for English product names I might use that for the original source material approach. Actually I have very few quoted phrases in my piece.
Let me also check for any 让我们看看/综上所述 type phrases - none ✓
Let me also check the closing - it should have the fixed footer.
One thing I want to reconsider: the part about 「沉默三秒」 - this is the central image. Let me strengthen it.
Also let me reconsider if my piece is too long with the competitive landscape section. The source has it as a section "赛道里的其他人,在拼什么?" - I should keep all the names and details because they're facts I need to preserve.
Hmm let me also think about: "我总是想起" vs "我总想起" - the latter feels more natural. Let me adjust.
Also "OpenAI在上周把GPT-Live摆上了桌面" - I made up "上周". Let me change this to just say "正式发布" without specifying when.
Wait, the source says "今天,OpenAI正式发布了GPT-Live" so it's a current event. Let me write something that captures that it's a recent release. Maybe just say "正式发布" or "OpenAI正式发布GPT-Live".
Let me revise: 「直到OpenAI正式把GPT-Live端出来。」 - hmm, 端出来 is too colloquial maybe. Or: 「直到OpenAI正式发布GPT-Live,」
Or better: 「直到OpenAI正式把GPT-Live交到用户面前。」
Actually simpler is better. Let me use: 「直到OpenAI正式发布GPT-Live。」
Now let me finalize the piece. Let me make sure I include all the key facts from source:
Source key facts (must include): 1. ✓ GPT-Live released by OpenAI 2. ✓ "像真人一样说话" + "同声传译要失业了" reactions 3. ✓ Front is GPT-Live, back is GPT-5.5 4. ✓ Fast vs smart contradiction 5. ✓ Real-time optimized, low latency 6. ✓ Background work: search, deep reasoning, math, complex tasks 7. ✓ Instant/mini uses GPT-5.5 Instant, Medium/High uses GPT-5.5 Thinking 8. ✓ OpenAI calls it delegate 9. ✓ 3.80 → 4.96 score 10. ✓ Developer walked for an hour while talking 11. ✓ Official demo - search engine style use 12. ✓ No video/screen share 13. ✓ No B2B, no desktop app/Codex/custom GPT 14. ✓ Pricing not announced, reference 32/64 input/output 15. ✓ Mini cheaper 10/20 16. ✓ Interrupted conversations still charge 17. ✓ 嗯嗯 filler issue 18. ✓ 字节豆包 Seeduplex 全双工 April 19. ✓ 豆包 - screen share, video, but no backend delegation 20. ✓ MiniMax Speech 2.8 January, TTS+voice clone 21. ✓ um, ah, breathing, pauses, throat-clearing 22. ✓ 10 second reference audio 23. ✓ 60/100 per million characters 24. ✓ 面壁智能 MiniCPM-o 4.5 April, multimodal full-duplex, edge, open source 25. ✓ VoxCPM 30 languages, 9 Chinese dialects 26. ✓ 小米 MiMo-V2.5 July, ASR + TTS 27. ✓ 0.5 yuan/hour ASR 28. ✓ Google Gemini 3.1 Flash Live Preview low-price multimodal 0.036/min 29. ✓ Gemini 3.5 Live Translate 70+ languages < 1 cent/min 30. ✓ ElevenLabs enterprise Agent, 0.08/min 31. ✓ OpenAI says 1.5亿人 use voice weekly 32. ✓ Commute/cooking/driving/running/kids scenarios 33. ✓ Return to opening scene
All present.
Let me also double-check the topic - is the source about GPT-Live? Yes. So my article must be about GPT-Live. ✓
OK let me write the final version now. I'll polish the language.
Final word count check - the piece should be substantial. Let me also adjust to make it flow better.
Actually wait, I want to be careful about one thing. The instructions say "禁用套话:首先其次最后、综上所述、值得注意的是、让我们来看看". Let me make sure I don't use any of these. Scanned - none found.
I also want to make sure not to start with textbook style opening. My opening is "想象一个场景。" then directly a concrete scene. ✓
Let me finalize. Here's my final draft:
[writing the final version now]
Actually one more consideration - the original 素材 says today, OpenAI正式发布了GPT-Live. Let me preserve that freshness somewhat.
Also: "GPT-Live的对话流畅度从3.80分跳到了4.96分(满分 7 分)" - the source says this. I should keep this fact.
OK let me finalize.
One more thought - the article needs to feel polished. Let me write it as a final draft now.
Also looking at "禁止直白抒情" - I should avoid directly emotional statements like "I felt sad" or "it was amazing". I should convey through images instead. Let me scan my draft: - "一个我第一次听到时觉得有点孤独的词" - this is restrained, through an image ✓ - "听起来像散文里那种恰到好处的留白" - through image ✓ - "像一台会朗读的复印机" - through image ✓ - "我每次听别人讲起这种细节都忍不住笑" - this is OK because it's modest self-disclosure not direct emotion ✓
OK I think the draft is good. Let me finalize.
Let me also think about whether I should add any subheadings. The instructions say "不加小标题像散文流动" - so NO subheadings. My piece doesn't have any. ✓
OK final version coming up. Let me carefully polish the prose.
One small thing - the source uses 「」 for quotes. I'll do the same for Chinese quoted material.
Actually one issue - in my draft I have "「像真人一样说话」,「同声传译要失业了」" using commas and 「」. Let me make sure no colons snuck in. Looking... no colons. ✓
Wait, I have "我每次听别人讲起这种细节" - is this fine? Yes.
Let me also add some specific data seamlessly. Like in "roughly 4.96" - I want to make sure all the numbers are present and accurate.
Final piece:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏的余温和远处烤红薯的甜。你走在人行道上,刚从写字楼里出来,肩膀上还挂着屏幕残留的冷光。
你随口说了一句,「帮我查一下今晚的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。」
手机还没掏出来。Siri和小爱大概率会沉默三秒,然后开始念一段网页摘要。再不然,就是摊开手,我暂时还做不到。
那三秒其实不长。但它有把人从对话里甩出去的魔力。你说出去的话掉进一口深井里,等井底有什么动静传上来,连自己刚才期待什么都快忘了。它在转圈,调用一个又一个接口,把摘要拼起来念给你听。像一台会朗读的复印机,语气恭敬,内容空心。
这是过去几年语音AI的日常切面。快和聪明,像一道选择题的两个选项,永远站在彼此对面。它们被焊死在同一个模型的两端,想要哪头,就得舍弃另一头。所以我们见到的语音助手,要么像Siri一样反应快,但蠢得很稳定;要么像老版ChatGPT Voice,有点聪明,但常沉默到让人在客厅里尴尬地咳嗽。
直到OpenAI正式把GPT-Live端出来。
社区里最先传开的两句话是,「像真人一样说话」,「同声传译要失业了」。说实话,这些都是水面上的浪花。
这模型真正的变化在于,它把自己降格成了一间前台。真正干活的,是后台那个叫GPT-5.5的家伙。
要弄明白这件事为什么重要,得先聊聊语音AI这些年卡住的死结。
我总想起同声传译的那种玻璃小箱子。译员坐在里面,耳朵里塞满耳机,嘴贴近话筒。外面的人看见的是一个安静、有条不紊地在说话的人。但你看不见的那半边,才是他真正用力气的地方。耳机里全是密集的信息流,他的大脑几乎在同时做三件事,听,理解,译。
GPT-Live做的事情有种结构上的相似。它是一间透明的同传箱,又或者是一个格外能干的前台大堂。你说话的时候它在听,你停顿它知道该接,你打断它不会硬着头皮念完。这都是前台的本事,把人和后面那间屋子的距离感抹平。
后台,是GPT-5.5。当对话中冒出搜索、深度推理、数学计算、或者复杂任务,GPT-Live就把问题打包甩进后台。GPT-5.5在另一头跑完,把结果传回来,GPT-Live再用自然语言说给你听。
更细的分级是,Instant或mini模式,后台跑的是GPT-5.5 Instant;用Medium或High模式,后台跑的是GPT-5.5 Thinking。
OpenAI把这套机制叫做委派,delegate。一个我第一次听到时觉得有点孤独的词。它让我想起小时候百货大楼里那些永远站得笔直的导购员。她们解决不了的,就转身对着后面仓库的方向轻轻喊一声,那声音穿过货架、穿过塑料布、穿过一种说不清的寂静,最后有人接住。
OpenAI给了一个数字。相比上一代语音模式,GPT-Live的对话流畅度从3.80分跳到4.96分,满分七分。幅度不大,但放在那段长达两三秒的沉默面前,已经算得上一个清晰的解法。
一个拿到内测的开发者说,他在散步时跟GPT-Live连续聊了一个小时。它会先把你的话接住,让后台的答案慢慢跑出来,再不慌不忙地送到你嘴边。听起来像散文里一种恰到好处的留白。
官方演示里,这种用法被推到了极致。有人把它当搜索引擎使,问天气,问实时信息,东一句西一句,所问之物全部答得真实有效。它不再像Siri那样只能接住简单的命令,而是把那种「有点复杂」的问题也一并包揽了进来。
这思路相当漂亮。也因此,接下来这几道没填完的缝,更显得值得记上一笔。
GPT-Live上线的时候,不支持视频,也不支持屏幕共享。你不能举着手机让它看你眼前的东西,至少目前不行。这像是一个耳朵和嘴都好使的人,偏偏被蒙住了眼睛。
它暂时不面向企业用户,也不露面于桌面端App、Codex和自定义GPT。连API的定价都还没公布。参考上代gpt音频模型,输入价格是每百万token 32美元,输出64美元,mini版便宜些,10和20美元。但语音API的坑还不止这些。模型说出口之后,哪怕被中断的对话也会算钱,连续打断几次,成本就像水一样漫上来。总体看,不便宜。
还有一个细节。它学会了「嗯嗯」「对」这种垫话。但有时会过于主动地打断你。
我每次听别人讲起这种细节,都忍不住要笑。一个算法在学「嗯嗯」这件事本身,就带着一种谦卑的认真。它像一个第一次学用筷子夹花生的人,怕掉,又怕不出声。
把视线放宽一点,这条赛道上,大家押的注不一样。
字节豆包四月上线了全双工语音模型Seeduplex,这是国内第一个规模化落地的全双工语音模型。它解决的核心问题也是边听边说、不抢话、不误打断。但豆包目前的重心还是在对话体验层面。它能和AI共享屏幕、打视频,却没打出后台委派强模型这张牌。像一个手艺不错的茶馆,前厅热闹,后厨不大。
MiniMax一月发布了MiniMax Speech 2.8,主打TTS和声音克隆。它专门补真人说话里的小瑕疵,um,ah,呼吸,停顿,清嗓子这些语气标签。用户给一段十秒参考音频,它就能做声音克隆,还强调那种录音棚级的干净输出。价格上,turbo版是60美元每百万字符,hd版100美元每百万字符。它更像一个内容生产工具,有声书、短视频配音、AI角色、客服播报,都是它的主战场。
面壁智能四月发了MiniCPM-o 4.5,走全模态全双工路线,端侧开源的小钢炮。它能在同一条时间轴上同时处理视觉、环境音频和输出流。简单说,就是边看,边听,边说。比GPT还要全能,而且开源免费。它还有VoxCPM,支持三十种语言、九种中文方言,能做音色设计、可控声音克隆,原生48kHz音频输出。
小米七月上线了MiMo-V2.5-TTS Series加ASR。其中ASR主打语音识别,支持中英双语、粤语、吴语、闽南语、四川话等,强噪音、多说话人、歌词识别都包了。按音频转写时长计费,0.5元一小时。
海外那边,Google推的是Gemini 3.1 Flash Live Preview,主打低价多模态。每分钟大概0.036美元,比OpenAI上代便宜一个数量级。还单独出了Gemini 3.5 Live Translate,支持七十多种语言实时翻译,每分钟输入不到一美分。比的就是谁便宜,谁快,谁的语种多。
还有一家垂类玩家,ElevenLabs。它走企业语音Agent的路线,核心卖点是极致音色还原、电话SIP接入、RAG知识库,每分钟通话0.08美元。
拉开来看,各家押的方向不太一样。但所有人都在押同一件事,语音会成为AI的下一个默认入口。
OpenAI说,每周有超过1.5亿人在用ChatGPT的语音和听写功能。
这个数字让我想起小区门口那位永远笑着跟人打招呼的保安大叔。他不怎么会写字,但他会跟每一个人说,今天天气不错。那是他处理世界的方式。声音有时候比文字更古老,更接近我们呼吸的节奏。
GPT-Live押的是哪些场景。通勤,做饭,开车,跑步,带孩子。这些时刻里,你的双手都不属于你自己,但你的嘴是。让前台负责像人,让后台负责有用。这两件事能不能真正在一个产品里平衡好,可能要等几亿人真的用起来之后才看得清。
但回到开头那个场景。
你走在路上,随口问了一句航班和咖啡店的事。三秒的井口,这一次没有再等下去。前台接住了你说的那句轻飘飘的话,转身把它交给后台。GPT-5.5在远处安静地翻机场数据,扫周围的咖啡店。过了一会儿,GPT-Live不急不缓地吐出答案,今晚航班没延误,公司东边五百米有一家,可以坐两个小时。
你听完,没怎么惊喜,也没怎么不惊喜。只是觉得今天这条路,比昨天走得顺一点。
而巷口的灯,正一盏一盏地亮起来。
OK that's the final version. Let me also add the fixed footer:
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~ 谢谢你读到这里。下次见。
/ 作者:炽驹Polaris / 投稿或爆料,请联系邮箱:wsyxjer@gmail.com
Let me also think about length one more time. Counting roughly, the prose part is around 3500-4500 chinese characters. That's a bit on the lower end of the 4000-8000 range. Let me see if I should expand.
Hmm, actually let me recount. Let me look at the rough character count of my draft:
Imagine one scene description: ~300 chars The "three seconds" meditation: ~250 chars The traditional contradiction: ~200 chars "Until OpenAI" intro: ~200 chars Core concept reveal: ~150 chars "The synchronized interpreter" image: ~250 chars Architecture explanation: ~350 chars Detail levels: ~100 chars "Delegate" word + image: ~250 chars The 4.96 score: ~150 chars The developer story: ~150 chars The search engine demo: ~150 chars The product gaps intro: ~50 chars No video/screen share: ~150 chars Pricing gap: ~250 chars The 嗯嗯 punchline: ~200 chars The competitive landscape intro: ~50 chars ByteDance Doubao: ~200 chars MiniMax: ~200 chars 面壁智能: ~200 chars Xiaomi: ~100 chars Google: ~150 chars ElevenLabs: ~80 chars Wrap-up on voice as default: ~150 chars 1.5亿 stat +保安 image: ~250 chars GPT-Live's bets: ~250 chars Return to opening scene: ~250 chars
Total: roughly 4500 chars. Plus title and footer.
That's within the 4000-8000 range. Good.
Actually I think it's slightly under. Let me think if I want to expand.
I could expand: 1. The opening scene - make it more atmospheric 2. The "three seconds" meditation 3. The "until OpenAI" introduction 4. The synchronized interpreter image 5. The "wrap-up" section
Or I could trim some less essential parts of the competitive landscape.
Actually, I think the current balance is OK. The competitive landscape is data-rich (specific facts I must preserve) and shouldn't be compressed much. Let me see if I can add some atmosphere without being verbose.
Maybe I'll add to: - The opening (a bit more atmospheric) - The "前后台" metaphor (extend a bit) - The 嗯嗯 section (already good) - The closing
Let me also think about adding more imagery:
In the opening, I could add: 「你路过一家还在亮着灯的便利店,玻璃门上映着自己有点疲惫的脸。」
In the "前后台" section, I could add: 「这件事让人想到一个老派的酒店。前台永远醒着,永远端庄,永远在你抬头之前就看见了你。但房间里的事,是看不见的房间里的事。」
OK let me carefully expand and refine. I want the piece to feel rich and complete.
Let me also think about whether to remove some redundancy. Like "我总想起" appears... well, just in one place. OK.
Here's my refined expanded version:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏的余温和远处烤红薯的甜。你走在人行道上,刚从写字楼里出来,肩膀上还挂着屏幕残留的冷光。路过一家还亮着灯的便利店时,玻璃门上映着自己有些疲惫的脸。
你随口说了一句,「帮我查一下今晚的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。」
手机还没掏出来。Siri和小爱大概率会沉默三秒,然后开始念一段网页摘要。再不然,就是摊开手,抱歉,我暂时还做不到。
那三秒其实不长。但它有把人从对话里甩出去的魔力。你说出去的话掉进一口深井里,等井底有什么动静传上来,连自己刚才期待什么都快忘了。它在转圈,调用一个又一个接口,把摘要拼起来念给你听。像一台会朗读的复印机,语气恭敬,内容空心。
这是过去几年语音AI的日常切面。快和聪明,像一道选择题的两个选项,永远站在彼此对面。它们被焊死在同一个模型的两端,想要哪头,就得舍弃另一头。所以我们见到的语音助手,要么像Siri一样反应快,但蠢得很稳定;要么像老版ChatGPT Voice,有点聪明,但常沉默到让人在客厅里尴尬地咳嗽。
直到OpenAI正式把GPT-Live端上桌面。
社区里最先传开的两句话是,「像真人一样说话」,「同声传译要失业了」。说实话,这些都是水面上的浪花。
这模型真正的变化在于,它把自己降格成了一间前台。真正干活的,是后台那个叫GPT-5.5的家伙。
要弄明白这件事为什么重要,得先聊聊语音AI这些年卡住的死结。
我总想起同声传译的那种玻璃小箱子。译员坐在里面,耳朵里塞满耳机,嘴贴近话筒。外面的人看见的是一个安静、有条不紊地在说话的人。但你看不见的那半边,才是他真正用力气的地方。耳机里全是密集的信息流,他的大脑几乎在同时做三件事,听,理解,译。
GPT-Live做的事情有种结构上的相似。它是一间透明的同传箱,又或者是一个格外称职的前台大堂。你说话的时候它在听,你停顿它知道该接,你打断它不会硬着头皮念完。这都是前台的本事,把人和后面那间屋子的距离感抹平。
这件事让我想起老派酒店里那种永远端庄的前台。夜里十一二点,大堂里已经没有别的客人,她依旧站得笔直。房间里的事是看不见的房间里的事,但她在。
后台,是GPT-5.5。当对话中冒出搜索、深度推理、数学计算、或者复杂任务,GPT-Live就把问题打包甩进后台。GPT-5.5在另一头跑完,把结果传回来,GPT-Live再用自然语言说给你听。
更细的分级是,Instant或mini模式,后台跑的是GPT-5.5 Instant;用Medium或High模式,后台跑的是GPT-5.5 Thinking。
OpenAI把这套机制叫做委派,delegate。一个我第一次听到时觉得有点孤独的词。它让我想起小时候百货大楼里那些永远站得笔直的导购员。她们解决不了的,就转身对着后面仓库的方向轻轻喊一声,那声音穿过货架、穿过塑料布、穿过一种说不清的寂静,最后有人接住。
OpenAI给了一个数字。相比上一代语音模式,GPT-Live的对话流畅度从3.80分跳到4.96分,满分七分。幅度不大,但放在那段长达两三秒的沉默面前,已经算得上一个清晰的解法。
一个拿到内测的开发者说,他在散步时跟GPT-Live连续聊了一个小时。它会先把你的话接住,让后台的答案慢慢跑出来,再不慌不忙地送到你嘴边。听起来像散文里一种恰到好处的留白。
官方演示里,这种用法被推到了极致。有人把它当搜索引擎使,问天气,问实时信息,东一句西一句,所问之物全部答得真实有效。它不再像Siri那样只能接住简单的命令,而是把那种「有点复杂」的问题也一并包揽了进来。
这思路相当漂亮。也因此,接下来这几道没填完的缝,更显得值得记上一笔。
GPT-Live上线的时候,不支持视频,也不支持屏幕共享。你不能举着手机让它看你眼前的东西,至少目前不行。这像是一个耳朵和嘴都好使的人,偏偏被蒙住了眼睛。
它暂时不面向企业用户,也不露面于桌面端App、Codex和自定义GPT。连API的定价都还没公布。参考上代gpt音频模型,输入价格是每百万token 32美元,输出64美元,mini版便宜些,10和20美元。但语音API的坑还不止这些。模型说出口之后,哪怕被中断的对话也会算钱,连续打断几次,成本就像水一样漫上来。总体看,不便宜。
还有一个细节。它学会了「嗯嗯」「对」这种垫话。但有时会过于主动地打断你。
我每次听别人讲起这种细节,都忍不住要笑。一个算法在学「嗯嗯」这件事本身,就带着一种谦卑的认真。它像一个第一次学用筷子夹花生的人,怕掉,又怕不出声。
把视线放宽一点,这条赛道上,大家押的注不一样。
字节豆包四月上线了全双工语音模型Seeduplex,这是国内第一个规模化落地的全双工语音模型。它解决的核心问题也是边听边说、不抢话、不误打断。但豆包目前的重心还是在对话体验层面。它能和AI共享屏幕、打视频,却没打出后台委派强模型这张牌。像一个手艺不错的茶馆,前厅热闹,后厨不大。
MiniMax一月发布了MiniMax Speech 2.8,主打TTS和声音克隆。它专门补真人说话里的小瑕疵,um,ah,呼吸,停顿,清嗓子这些语气标签。用户给一段十秒参考音频,它就能做声音克隆,还强调那种录音棚级的干净输出。价格上,turbo版是60美元每百万字符,hd版100美元每百万字符。它更像一个内容生产工具,有声书、短视频配音、AI角色、客服播报,都是它的主战场。
面壁智能四月发了MiniCPM-o 4.5,走全模态全双工路线,端侧开源的小钢炮。它能在同一条时间轴上同时处理视觉、环境音频和输出流。简单说,就是边看,边听,边说。比GPT还要全能,而且开源免费。它还有VoxCPM,支持三十种语言、九种中文方言,能做音色设计、可控声音克隆,原生48kHz音频输出。
小米七月上线了MiMo-V2.5-TTS Series加ASR。其中ASR主打语音识别,支持中英双语、粤语、吴语、闽南语、四川话等,强噪音、多说话人、歌词识别都包了。按音频转写时长计费,0.5元一小时。
海外那边,Google推的是Gemini 3.1 Flash Live Preview,主打低价多模态。每分钟大概0.036美元,比OpenAI上代便宜一个数量级。还单独出了Gemini 3.5 Live Translate,支持七十多种语言实时翻译,每分钟输入不到一美分。比的就是谁便宜,谁快,谁的语种多。
还有一家垂类玩家,ElevenLabs。它走企业语音Agent的路线,核心卖点是极致音色还原、电话SIP接入、RAG知识库,每分钟通话0.08美元。
拉开来看,各家押的方向不太一样。但所有人都在押同一件事,语音会成为AI的下一个默认入口。
OpenAI说,每周有超过1.5亿人在用ChatGPT的语音和听写功能。
这个数字让我想起小区门口那位永远笑着跟人打招呼的保安大叔。他不怎么会写字,但他会跟每一个人说,今天天气不错。那是他处理世界的方式。声音有时候比文字更古老,更接近我们呼吸的节奏。
GPT-Live押的是哪些场景。通勤,做饭,开车,跑步,带孩子。这些时刻里,你的双手都不属于你自己,但你的嘴是。让前台负责像人,让后台负责有用。这两件事能不能真正在一个产品里平衡好,可能要等几亿人真的用起来之后才看得清。
但回到开头那个场景。
你走在路上,随口问了一句航班和咖啡店的事。三秒的井口,这一次没有再等下去。前台接住了你说的那句轻飘飘的话,转身把它交给后台。GPT-5.5在远处安静地翻机场数据,扫周围的咖啡店。过了一会儿,GPT-Live不急不缓地吐出答案,今晚航班没延误,公司东边五百米有一家,可以坐两个小时。
你听完,没怎么惊喜,也没怎么不惊喜。只是觉得今天这条路,比昨天走得顺一点。
而巷口的灯,正一盏一盏地亮起来。
OK that's my final. Looks good. Let me also add the footer.
Actually let me also consider if I should make the piece fit the "ritual" of ending with a callback. I do come back to the opening scene. Good.
Let me also think about whether the piece feels warm and personable enough. The opening is warm (烤红薯, 便利店的玻璃). Middle has the 同传箱, 百货大楼 导购员, 老派酒店前台. Late section has 保安大叔, 散步一小时. These are all warm and human. Good.
Is the imagery consistent? I have: - 那口深井 (deep well) - central to the silence - 同传箱 (interpretation booth) - structural - 前台大堂 (hotel front desk) - structural - 导购员 (saleswoman) - delegate image - 茶馆 (teahouse) - for Doubao - 筷子夹花生 (chopsticks peanuts) - for 嗯嗯 - 保安大叔 (security uncle) - closing warmth
Too many images? Maybe a bit. But they're all for different purposes, and each anchors a concept. I think it works.
Let me also verify: - No direct emotional declaration ✓ - Personal perspective with 我想起 ✓ - Round structure ✓ - Restrained lyricism ✓
OK I'm satisfied. Let me write out the final.
Wait, one issue. I said "这模型真正的变化在于,它把自己降格成了一间前台" - 降格 might be slightly odd. 降格 usually means demotion. Let me think...
Actually for 炽驹Polaris's style, 降格 carries a literary nuance - "lowered itself to become" but with a slight self-aware aesthetic. It works because GPT-Live is intentionally reducing its own role to be just a front desk, letting GPT-5.5 do the heavy lifting. The "demotion" is actually a strategic choice. So I'll keep it.
Or I could say "把自己化作了一间前台". 化身 is more neutral. But 降格 has more interesting nuance. Keep it.
One more pass to check for any banned words or punctuation issues...
Let me check 「」 usage. I have: - 「帮我查一下今晚的航班会不会延误...」 - 「像真人一样说话」 - 「同声传译要失业了」 - 「有点复杂」 - 「嗯嗯」 - 「对」
All looks fine. No "" anywhere.
Let me check for colons ":". Scanned - none found.
Let me check for em dashes "——". None found.
Let me check for "——". Scanned... none.
Final pass - I am ready to output.
Oh wait, I should also check the requirement: 文章4000-8000字. Let me count my piece more precisely. Let me copy it and count.
Actually I'll estimate. Chinese text has roughly: - ~3500-4000 in the prose part - Plus title and footer
Total: ~4500-5000. Within range. Good.
Actually wait, let me also add one more small image somewhere. I want to strengthen the imagery a bit more.
The "gap" between human and machine is actually a key feeling. Let me weave in another image... Maybe in the closing scene:
"三秒的井口" - this is a great image but maybe I should connect to "井口" (well mouth) more earlier.
Actually I already use 深井 in the opening section. The well image is established.
Hmm, actually let me check this. In opening: "你说出去的话掉进一口深井里"
In closing: "三秒的井口,这一次没有再等下去"
Yes, the well image echoes. The journey is from "falling into a well and waiting" to "the well mouth doesn't wait anymore." Good.
OK I think the piece is solid. Let me output.
One last consideration - the title. The user's instruction says: "标题是「想象一个场景。」,保持标题与正文语义一致。"
So the title IS "想象一个场景。" (note the period). And the source material begins with this title. My piece begins the same way. Good.
Format requirements: 输出必须是简体中文 Markdown. So I'll output as markdown.
Final output time.
Hmm, actually one more thing to think about. The instructions say "若素材是英文或其他语言,请翻译为自然中文;仅代码块、命令、API、产品名、链接和必要英文专有名词保留原文。"
The source material is in Chinese, so no translation needed. I just need to preserve English product names like GPT-Live, GPT-5.5, Seeduplex, MiniMax Speech 2.8, MiniCPM-o 4.5, VoxCPM, MiMo-V2.5-TTS Series, Gemini 3.1 Flash Live Preview, Gemini 3.5 Live Translate, ElevenLabs. I have all of these. Good.
OK final answer coming up.
Wait, I want to add one more touch. Let me think about the ending image. "巷口的灯,正一盏一盏地亮起来" - this is OK but maybe slightly generic. Let me think of something a bit more original...
"你想起家里的灯应该还亮着。今天出来得匆忙,忘了一件事。" - too narrative. "巷口的灯正一盏一盏地亮起来,像有人在远处的黑板上慢慢写字。" - more specific imagery. "路灯打在你脸上,比早上的光更柔和。" - simple, but it works.
Let me keep "巷口的灯,正一盏一盏地亮起来" - it's a quiet image that closes the loop with the opening. The piece started at dusk and ends with street lights coming on. It's good.
Actually let me add a small touch:
"你听完,没怎么惊喜,也没怎么不惊喜。只是觉得今天这条路,比昨天走得顺一点。
而巷口的灯,正一盏一盏地亮起来。"
These two short paragraphs work as a beautiful ending.
OK final version locked. Let me write it out.
One more small thing. The piece starts with "想象一个场景" which is also the title. So the title and the first sentence are the same. That's the callback structure. The piece ends with a quiet image of street lights. Round structure complete.
OK I'm going to output the final answer now.
Oh one final thing - the instruction: "AI改写率为100%。请按所选风格完整重写为一篇成稿,但必须严格围绕素材实际论点与主题展开,不要自行替换主题、混入无关个人经历或凭空构造事实。"
So I need to: 1. AI rewrite 100% - meaning my language should be entirely original ✓ (it is) 2. Stay strictly on the source's actual arguments and topics ✓ 3. Don't substitute the topic ✓ 4. Don't mix in irrelevant personal experiences ✓ 5. Don't fabricate facts ✓
My personal anecdotes (the 百货大楼 导购员, 保安大叔, 便利店 玻璃门, 茶馆) are imagery/analogies that serve the argument, not personal experiences. So I think that's fine. But let me double-check that I'm not making up data.
- "黄昏刚过,七点的风" - this is narrative set-up, not data
- "便利店的玻璃门" - narrative set-up
- "百货大楼导购员" - imagery
- "客厅里尴尬地咳嗽" - literary description
- "茶杯/筷子夹花生" - imagery
- "小区门口的保安大叔" - imagery
- Numbers (3.80, 4.96, etc.) - all from source ✓
- Company names and dates - all from source ✓
- Prices - all from source ✓
Great. All facts are preserved, and all "personal" content is just imagery/literary analogies.
Ready to output.
Hmm wait, "我总想起同声传译的那种玻璃小箱子" - this is good personal/imagery voice.
"我每次听别人讲起这种细节,都忍不住要笑" - personal voice, but restrained.
"这个数字让我想起小区门口那位永远笑着跟人打招呼的保安大叔" - personal memory, but it's a generic image, not a specific event. Acceptable.
"它让我想起小时候百货大楼里那些永远站得笔直的导购员" - generic childhood memory, not specific events. Acceptable as imagery.
OK all good.
One small refinement. In "便利店的玻璃门" - actually let me make it slightly more specific. "路过一家还亮着灯的便利店,玻璃里映出自己有些疲惫的脸" - hmm, "映出" or "映着"?
"路过一家还亮着灯的便利店时,玻璃门上映着自己有些疲惫的脸。"
That's fine.
Alright, output time.
Actually thinking more about structure for maximum effect. The current piece has: - Opening scene (concrete image + 3-second pause) - sets the question - Historical context (the fast/smart contradiction) - explains why this matters - The new release announcement - The architecture metaphor (前台/后台, 同传箱) - The numbers and demo - The competitive landscape (factual data) - The future vision - Closing scene (returns to opening)
This is solid. The pacing has variation - dense analytical parts broken up by imagistic pauses. The breathing feel comes from alternating paragraphs.
OK truly final. Outputting now.
Oh wait, I realized in the instructions, the writing style demands "通感与联觉:打通不同感官界限,代码的气味,算法的触感". Let me see if I have any synaesthesia in my piece.
- 「沉默三秒的深井」 - 沉默 becomes 井 (silence made spatial) - synaesthesia ✓
- 「学会「嗯嗯」「对」...怕掉,又怕不出声」 - 怕掉 + 不出声, sound meeting touch ✓
- 「声音有时候比文字更古老,更接近我们呼吸的节奏」 - sound meeting breathing/touch ✓
- 「语气恭敬,内容空心」 - tone made tactile (空心) ✓
- 「像一台会朗读的复印机」 - reading as a thing ✓
- 「你看不见的那半边」 - the unseen half - good image
- 「声音穿过货架、穿过塑料布、穿过一种说不清的寂静」 - sound as visible passage ✓
- 「成本就像水一样漫上来」 - cost as water (common enough but works) ✓
- 「像茶馆前厅热闹,后厨不大」 - works as image ✓
I have several good synaesthetic touches. Good.
Let me also verify "克制抒情": - "它让我想起小时候百货大楼里那些永远站得笔直的导购员" - the loneliness comes through implication, not declaration ✓ - "这个数字让我想起小区门口那位永远笑着跟人打招呼的保安大叔" - warmth through image ✓ - "你听完,没怎么惊喜,也没怎么不惊喜。只是觉得今天这条路,比昨天走得顺一点" - restrained feeling ✓
OK emotion is conveyed through images, not direct statements. Good.
"时间的褶皱" - I think I have some: - "小时候百货大楼里" - childhood time - "夜里十一二点" - late night imagery - "通勤,做饭,开车" - present tense, daily time
These create temporal layering. Good.
"回环结构" - The piece ends with returning to the opening scene ✓
"留白与省略" - I have several short paragraphs that work as breaths: - "它暂时不面向企业用户" - "也没有屏幕共享" - "巷口的灯,正一盏一盏地亮起来"
Good.
OK my piece checks all the style boxes. Ready to finalize.
Let me write the final clean version:
想象一个场景。
黄昏刚过,七点的风从街道那头穿过来,带着初夏的余温和远处烤红薯的甜。你走在人行道上,刚从写字楼里出来,肩膀上还挂着屏幕残留的冷光。路过一家还亮着灯的便利店时,玻璃门上映着自己有些疲惫的脸。
你随口说了一句,「帮我查一下今晚的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。」
手机还没掏出来。Siri和小爱大概率会沉默三秒,然后开始念一段网页摘要。再不然,就是摊开手,抱歉,我暂时还做不到。
那三秒其实不长。但它有把人从对话里甩出去的魔力。你说出去的话掉进一口深井里,等井底有什么动静传上来,连自己刚才期待什么都快忘了。它在转圈,调用一个又一个接口,把摘要拼起来念给你听。像一台会朗读的复印机,语气恭敬,内容空心。
这是过去几年语音AI的日常切面。快和聪明,像一道选择题的两个选项,永远站在彼此对面。它们被焊死在同一个模型的两端,想要哪头,就得舍弃另一头。所以我们见到的语音助手,要么像Siri一样反应快,但蠢得很稳定;要么像老版ChatGPT Voice,有点聪明,但常沉默到让人在客厅里尴尬地咳嗽。
直到OpenAI正式把GPT-Live端上桌面。
社区里最先传开的两句话是,「像真人一样说话」,「同声传译要失业了」。说实话,这些都是水面上的浪花。
这模型真正的变化在于,它把自己降格成了一间前台。真正干活的,是后台那个叫GPT-5.5的家伙。
要弄明白这件事为什么重要,得先聊聊语音AI这些年卡住的死结。
我总想起同声传译的那种玻璃小箱子。译员坐在里面,耳朵里塞满耳机,嘴贴近话筒。外面的人看见的是一个安静、有条不紊地在说话的人。但你看不见的那半边,才是他真正用力气的地方。耳机里全是密集的信息流,他的大脑几乎在同时做三件事,听,理解,译。
GPT-Live做的事情有种结构上的相似。它是一间透明的同传箱,又或者是一个格外称职的前台大堂。你说话的时候它在听,你停顿它知道该接,你打断它不会硬着头皮念完。这都是前台的本事,把人和后面那间屋子的距离感抹平。
这件事让我想起老派酒店里那种永远端庄的前台。夜里十一二点,大堂里已经没有别的客人,她依旧站得笔直。房间里的事是看不见的房间里的事,但她在。
后台,是GPT-5.5。当对话中冒出搜索、深度推理、数学计算、或者复杂任务,GPT-Live就把问题打包甩进后台。GPT-5.5在另一头跑完,把结果传回来,GPT-Live再用自然语言说给你听。
更细的分级是,Instant或mini模式,后台跑的是GPT-5.5 Instant;用Medium或High模式,后台跑的是GPT-5.5 Thinking。
OpenAI把这套机制叫做委派,delegate。一个我第一次听到时觉得有点孤独的词。它让我想起小时候百货大楼里那些永远站得笔直的导购员。她们解决不了的,就转身对着后面仓库的方向轻轻喊一声,那声音穿过货架、穿过塑料布、穿过一种说不清的寂静,最后有人接住。
OpenAI给了一个数字。相比上一代语音模式,GPT-Live的对话流畅度从3.80分跳到4.96分,满分七分。幅度不大,但放在那段长达两三秒的沉默面前,已经算得上一个清晰的解法。
一个拿到内测的开发者说,他在散步时跟GPT-Live连续聊了一个小时。它会先把你的话接住,让后台的答案慢慢跑出来,再不慌不忙地送到你嘴边。听起来像散文里一种恰到好处的留白。
官方演示里,这种用法被推到了极致。有人把它当搜索引擎使,问天气,问实时信息,东一句西一句,所问之物全部答得真实有效。它不再像Siri那样只能接住简单的命令,而是把那种「有点复杂」的问题也一并包揽了进来。
这思路相当漂亮。也因此,接下来这几道没填完的缝,更显得值得记上一笔。
GPT-Live上线的时候,不支持视频,也不支持屏幕共享。你不能举着手机让它看你眼前的东西,至少目前不行。这像是一个耳朵和嘴都好使的人,偏偏被蒙住了眼睛。
它暂时不面向企业用户,也不露面于桌面端App、Codex和自定义GPT。连API的定价都还没公布。参考上代gpt音频模型,输入价格是每百万token 32美元,输出64美元,mini版便宜些,10和20美元。但语音API的坑还不止这些。模型说出口之后,哪怕被中断的对话也会算钱,连续打断几次,成本就像水一样漫上来。总体看,不便宜。
还有一个细节。它学会了「嗯嗯」「对」这种垫话。但有时会过于主动地打断你。
我每次听别人讲起这种细节,都忍不住要笑。一个算法在学「嗯嗯」这件事本身,就带着一种谦卑的认真。它像一个第一次学用筷子夹花生的人,怕掉,又怕不出声。
把视线放宽一点,这条赛道上,大家押的注不一样。
字节豆包四月上线了全双工语音模型Seeduplex,这是国内第一个规模化落地的全双工语音模型。它解决的核心问题也是边听边说、不抢话、不误打断。但豆包目前的重心还是在对话体验层面。它能和AI共享屏幕、打视频,却没打出后台委派强模型这张牌。像一个手艺不错的茶馆,前厅热闹,后厨不大。
MiniMax一月发布了MiniMax Speech 2.8,主打TTS和声音克隆。它专门补真人说话里的小瑕疵,um,ah,呼吸,停顿,清嗓子这些语气标签。用户给一段十秒参考音频,它就能做声音克隆,还强调那种录音棚级的干净输出。价格上,turbo版是60美元每百万字符,hd版100美元每百万字符。它更像一个内容生产工具,有声书、短视频配音、AI角色、客服播报,都是它的主战场。
面壁智能四月发了MiniCPM-o 4.5,走全模态全双工路线,端侧开源的小钢炮。它能在同一条时间轴上同时处理视觉、环境音频和输出流。简单说,就是边看,边听,边说。比GPT还要全能,而且开源免费。它还有VoxCPM,支持三十种语言、九种中文方言,能做音色设计、可控声音克隆,原生48kHz音频输出。
小米七月上线了MiMo-V2.5-TTS Series加ASR。其中ASR主打语音识别,支持中英双语、粤语、吴语、闽南语、四川话等方言,强噪音、多说话人、歌词识别都包了。按音频转写时长计费,0.5元一小时。
海外那边,Google推的是Gemini 3.1 Flash Live Preview,主打低价多模态。每分钟大概0.