收購Hugging Face!)
最近一周AI科技圈又發(fā)生了啥新鮮事OpenAI宣布終止與Cursor的合作關(guān)系OpenAI發(fā)布聲明宣布因Cursor被SpaceX收購后無法確信其能在服務(wù)條款范圍內(nèi)使用技術(shù)將自11月12日起終止Cursor對OpenAI模型的直接訪問權(quán)限。OpenAI提及SpaceX旗下xAI曾違反服務(wù)條款的歷史而Cursor創(chuàng)始人回應(yīng)稱OpenAI模型僅占其用戶流量的約5%。此次斷供的背景是OpenAI正為具備潛在關(guān)鍵級網(wǎng)絡(luò)攻擊能力的Astra模型部署做準(zhǔn)備需嚴(yán)格控制分發(fā)渠道。此前Anthropic也曾因類似原因切斷過Windsurf等產(chǎn)品的模型訪問權(quán)限https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/騰訊姚順雨再交卷開源Hy4 preview騰訊混元發(fā)布并開源新一代大語言模型Hy4 preview總參數(shù)達(dá)770B單次推理激活49B支持1M上下文采用Apache 2.0許可。模型在軟件工程與Agent任務(wù)上表現(xiàn)突出Terminal-Bench 2.1得分從70.8升至85.4DeepSWE從28.0升至64.3在Arena Code Arena榜單以1633分位列開源模型第三。模型訓(xùn)練首次納入CodeBuddy、WorkBuddy等產(chǎn)品使用反饋形成閉環(huán)并借助自身優(yōu)化將推理吞吐較基線提升31.8%。目前已開放權(quán)重與API服務(wù)輸入每百萬tokens 6元、輸出18元https://hy.tencent.ai/research/hy4-preview谷歌發(fā)布Gemini 3.5 Transcribe語音轉(zhuǎn)文本模型Gemini 3.5 Transcribe能夠自動(dòng)刪除“嗯”“呃”等口頭禪以及說錯(cuò)后自行糾正的內(nèi)容生成更通順的文本。與上一代Chirp 3引擎相比整體轉(zhuǎn)錄速度提升約70%在實(shí)時(shí)語音場景下錯(cuò)誤率降至5.5%Chirp 3為7.32%。該模型支持85種語言可處理最多包含3名說話者的預(yù)錄音頻并提供自定義詞匯表功能以提升專業(yè)術(shù)語識別能力目前已為Pixel 11上Gboard鍵盤的“Rambler”功能提供支持https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/騰訊混元推出極低比特翻譯模型Hy-MT2-1.8B騰訊混元將Hy-MT2-1.8B翻譯模型通過2-bit與1.25-bit量化方案壓縮至574MB和440MB原始FP16精度下體積為3.3GB翻譯質(zhì)量幾乎無損。該模型原生支持33個(gè)語種互譯在FLORES-200評測中整體質(zhì)量優(yōu)于部分商業(yè)翻譯API。1.25-bit方案基于自研Sherry技術(shù)每4個(gè)參數(shù)中3個(gè)用±1存儲、1個(gè)置0平均僅需1.25-bit。英特爾針對x86平臺優(yōu)化算子后量化格式的token rate分別提升約2.7倍和5倍。該模型已在嗶哩嗶哩直播彈幕實(shí)時(shí)翻譯中落地平均單條彈幕翻譯耗時(shí)500至800毫秒資源下載約600MB、內(nèi)存占用500至700MBhttps://mp.weixin.qq.com/s/wCoqiJ6HCS2YBWCegc1KEw智譜開源GLM-5.3-Flash模型GLM-5.3-Flash是一款320B總參數(shù)、18B激活參數(shù)的原生多模態(tài)模型在Artificial Analysis Intelligence Index中取得57分與Claude Opus 4.8持平編程表現(xiàn)相當(dāng)定價(jià)僅為后者的四十分之一。該模型采用稀疏注意力和線性注意力的混合架構(gòu)大幅降低長上下文服務(wù)成本。此次發(fā)布還首次在大規(guī)模流量中用國產(chǎn)芯片集群提供服務(wù)端到端性能提升了3倍。模型已開源并接入ZCode等平臺https://z.ai/blog/glm-5.3-flash阿里發(fā)布Qwen3.8-Flash模型Qwen3.8-Flash是一個(gè)多模態(tài)MoE模型主模型參數(shù)量為125B額外配備51B的N-gram Embedding每token激活6B參數(shù)原生支持262,144 token上下文并可擴(kuò)展至1M。采用GDN與QSA混合的Attention架構(gòu)其中QSA通過micro-block粒度篩選重要上下文以實(shí)現(xiàn)長序列加速引入Gated Residual機(jī)制將殘差流擴(kuò)展為4條分支以增強(qiáng)跨層信息傳遞N-gram Embedding以少量計(jì)算擴(kuò)展模型容量并可卸載至Host Memory。相比Qwen3.7-Plus訓(xùn)練開銷僅約為前者的1/9但編碼和辦公任務(wù)能力更強(qiáng)API服務(wù)定價(jià)為每百萬Tokens輸入1元、輸出3元。同步開源的Qwen3.8-Flash-Next權(quán)重被視為Qwen4系列模型的雛形https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf愛詩科技發(fā)布PixVerse R2實(shí)時(shí)世界模型PixVerse R2技術(shù)報(bào)告呈現(xiàn)實(shí)時(shí)全模態(tài)世界模型的持續(xù)擴(kuò)展路徑。R2采用Omni Causal AR統(tǒng)一訓(xùn)練框架支持文本、圖像、視頻、音頻和動(dòng)作等多模態(tài)信號輸入并能同步輸出音視頻。模型通過Dynamic Chunk統(tǒng)一不同控制信號的時(shí)間尺度、Hybrid Teacher/Diffusion Forcing縮小訓(xùn)練與推理分布差異、Multi-Timescale Memory協(xié)同保存長期身份與近期動(dòng)態(tài)、Error Bank將長期漂移轉(zhuǎn)化為可學(xué)習(xí)訓(xùn)練信號從而構(gòu)建可持續(xù)運(yùn)行的世界狀態(tài)。在實(shí)時(shí)加速方面R2從完成長程預(yù)訓(xùn)練的Omni Causal AR直接蒸餾結(jié)合DDMD對抗正則、Block-sparse Attention和Pyramid分層生成將能力加速至低延遲實(shí)時(shí)運(yùn)行區(qū)間https://mp.weixin.qq.com/s/vjIPBLJXa_Plcbxidv_Qiw谷歌推出多人實(shí)時(shí)協(xié)作Vibe Coding工具Play with Putty谷歌Labs推出的Play with Putty是一款多人實(shí)時(shí)協(xié)作的Vibe Coding實(shí)驗(yàn)工具支持多名用戶在同一共享空間內(nèi)用自然語言描述需求由AI自動(dòng)生成代碼并實(shí)時(shí)同步渲染無需編程基礎(chǔ)即可共同搭建可直接使用的工具或網(wǎng)站。產(chǎn)品采用候補(bǔ)名單制分批開放定位輕量社交化創(chuàng)作適用于團(tuán)隊(duì)快速原型驗(yàn)證、編程教學(xué)、黑客馬拉松及企業(yè)內(nèi)部小工具搭建等場景https://labs.google/playwithputty英偉達(dá)同意129億美元收購Hugging Face英偉達(dá)同意以129億美元收購AI模型社區(qū)Hugging Face后者年化收入超過1.5億美元收購價(jià)約合其八十多倍年化收入。Hugging Face提供模型發(fā)現(xiàn)、下載、訓(xùn)練、部署和推理服務(wù)已成為開放模型生態(tài)的重要基礎(chǔ)設(shè)施。此次收購是英偉達(dá)近期一系列布局開放模型生態(tài)動(dòng)作中的一環(huán)此前已投入約990億美元用于AI產(chǎn)業(yè)鏈股權(quán)投資并組建Nemotron Coalition、收購Kumo AI和吸收Essential AI團(tuán)隊(duì)。該交易若完成或?qū)⒏淖僅ugging Face此前作為中立平臺的角色定位https://mp.weixin.qq.com/s/rLzd8hhMU9v0wf5uraD8MQ小紅書開源FireRedTTS3統(tǒng)一語音生成與編輯模型FireRedTTS3模型基于RedAE語義增強(qiáng)連續(xù)表示與LLM-DiT架構(gòu)在單一模型中實(shí)現(xiàn)零樣本音色克隆支持24種語言與21種中文方言、自然語言描述的聲音設(shè)計(jì)以及指定區(qū)域的精準(zhǔn)語音編輯包括改詞、調(diào)速、變調(diào)與調(diào)音量。該模型在Seed-TTS-Eval、MiniMax-MLS-Test等四個(gè)公開評測集上均取得最優(yōu)或次優(yōu)成績其中零樣本克隆說話人相似度達(dá)78.8%。模型已全面開源并支持本地部署https://github.com/FireRedTeam/FireRedTTS3字節(jié)推出 AI Agent 辦公產(chǎn)品「豆包工作」“豆包工作”專注于賦能生產(chǎn)力場景定位為下一代智能辦公助手。該產(chǎn)品具備強(qiáng)大的自主決策與執(zhí)行能力能夠拆解復(fù)雜任務(wù)、聯(lián)動(dòng)多元工具并自動(dòng)化推進(jìn)工作流全面覆蓋文檔撰寫、PPT制作、網(wǎng)頁搭建及系統(tǒng)開發(fā)等全棧需求。值得一提的是豆包工作支持虛擬桌面操控全程操作可視透明并支持用戶隨時(shí)介入接管。此外產(chǎn)品深度集成飛書生態(tài)可基于企業(yè)真實(shí)上下文智能檢索會議紀(jì)要、提煉群聊精華并自動(dòng)生成周期性報(bào)告大幅提升團(tuán)隊(duì)協(xié)作效率https://mp.weixin.qq.com/s/SsXHiqKB8RV6bBWzRluGzw