跳到正文
AI
返回首页
🔶36氪 AI·

黄仁勋为何力挺梁文锋、杨植麟?

黄仁勋为何力挺梁文锋、杨植麟?

中国大模型公司把Transformer沿用九年的关键零件——注意力、残差连接、优化器等做了逐一重造。这种重造发生在高端GPU断供的背景下,中国模型就像被一堵高墙环绕。现在,这条被围墙逼出的技术路线,开始反过来改写全球算力与存储的账单。 7月27日深夜,Kimi K3完整权重挂上了Hugging Face。 十天前它发布时,中文圈的讨论多停在跑分与“开源追平闭源”上——头部基准逼近GPT-5.6 Sol和Claude Fable 5。但对技术人来说,架构清单比跑分更重要:注意力换成KDA混合线性机制,残差连接换成注意力残差,优化器换成按头调节的Muon。 深度学习沿用九年的“三大件”,在一个模型

分享:

相关推荐

K3 2.8万亿参数封神,Kimi凭啥碾压海外巨头?
🔶36氪 AI··9 分钟阅读

K3 2.8万亿参数封神,Kimi凭啥碾压海外巨头?

2.8万亿参数,全球参数最大。这是K3近期震动全球的成绩。 瞬间,春节之后沉浸了许久的大模型行业再度迎来喧嚣时刻,K3全新模型收获海内外广泛关注,复刻了此前DeepSeek R1横空出世时轰动行业的高光。 不着急赚钱的DeepSeek与Kimi在应对商业化、算力生态以及资本市场方面有些截然不同的态度与打法,不过这并不影响两家中国AI公司身上如出一辙的标签。 两者先后依靠技术突破打破海外厂商的技术壁垒,背后是相近的生存思路:不靠低价补贴抢占用户,依托硬核模型能力争夺行业话语权,换取可持续的商业收益。 再现DeepSeek高光时刻,K3出圈的不只有训练成本 大模型是人工智能产业的重要底座,是AI

开放K3权重、抢招全球大使,Kimi这次想干什么?
🔶36氪 AI··10 分钟阅读

开放K3权重、抢招全球大使,Kimi这次想干什么?

刚刚,月之暗面正式启动 Kimi 全球大使计划,面向全球招募一批先行者。 而就在昨晚,月之暗面刚把 Kimi K3 的技术底牌摊开了。 模型权重、技术报告,以及支撑模型训练的 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术,一次性向全球开放。 月之暗面究竟要打一副怎样的明牌? Kimi K3 模型权重:https://huggingface.co/moonshotai Kimi K3 技术报告:https://github.com/MoonshotAI/Kimi-K3 MoonEP GitHub 仓库:https://github.com/moonshotA

「他们更慌了」,Kimi正式开源:硅谷深陷分裂,「内战」打响,黄仁勋罕见与白宫唱反调
🔶36氪 AI··9 分钟阅读

「他们更慌了」,Kimi正式开源:硅谷深陷分裂,「内战」打响,黄仁勋罕见与白宫唱反调

7月27日晚,月之暗面开源Kimi K3模型及技术报告,同时开源MoonEP、FlashKDA、AgentEnv三项关键Infra。在过去两周时间,Kimi几乎成为美国AI圈热议的话题,很多人表现出恐惧。 “很慌”,这种恐惧直接反映在资本市场上——费城半导体指数一度跌入熊市区间,纳斯达克期货应声下挫,英伟达等主要芯片股股价短线走低,市场将其与2025年初的“DeepSeek时刻”相类比。市场反应很容易理解:如果中国开源模型已经以低成本提供媲美美国头部模型的性能,那么美国诸多AI巨头的天价资本支出的合理性就面临着质疑。 同时,硅谷还围绕人工智能的开放与封闭问题,出现了生成式AI浪潮兴起以来最为明