• 一场DeepSeek投资者交流会内容流出,其中梁文锋用近4小时阐述DeepSeek组织文化、开源逻辑、技术路线图及对行业竞争格局的看法。

    腾讯科技文字版实录:
    https://news.qq.com/rain/a/20260723A04GBI00
    一场DeepSeek投资者交流会内容流出,其中梁文锋用近4小时阐述DeepSeek组织文化、开源逻辑、技术路线图及对行业竞争格局的看法。腾讯科技文字版实录:https://news.qq.com/rain/a/20260723A04GBI00
    0 Comments ·0 Shares ·50 Views
  • #英伟达 下一代Vera Rubin服务器系统量产进展顺利,CoreWeave、微软、OpenAI、Anthropic和SpaceXAI等数十家客户已收到测试机架,每架搭载72块GPU,售价700至800万美元。

    相比Blackwell,新系统采用无线缆设计并引入机器人组装,生产效率显著提升。
    ———-
    同时,英伟达表示,针对GB200 NVL72平台的系列优化,使其在运行DeepSeek R1 0528(1K输入/1K输出配置)时,每兆瓦算力吞吐量在三个月内实现4倍增长。

    英伟达将这一扩展表现归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片。高速互联直接决定了多机训练中的通信开销,进而影响整体扩展效率,该网络能力被视为支撑上述跨框架高效率表现的核心基础设施组件。
    #英伟达 下一代Vera Rubin服务器系统量产进展顺利,CoreWeave、微软、OpenAI、Anthropic和SpaceXAI等数十家客户已收到测试机架,每架搭载72块GPU,售价700至800万美元。相比Blackwell,新系统采用无线缆设计并引入机器人组装,生产效率显著提升。———-同时,英伟达表示,针对GB200 NVL72平台的系列优化,使其在运行DeepSeek R1 0528(1K输入/1K输出配置)时,每兆瓦算力吞吐量在三个月内实现4倍增长。英伟达将这一扩展表现归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片。高速互联直接决定了多机训练中的通信开销,进而影响整体扩展效率,该网络能力被视为支撑上述跨框架高效率表现的核心基础设施组件。
    0 Comments ·0 Shares ·104 Views
  • #阿里巴巴 千问Token Plan个人版发布,2.4万亿参数Qwen3.8-Max预览版首发上线。Qwen3.8-Max预览版在代码工程与专业办公场景表现突出,或为仅次于Fable 5的最强模型,正式版将近期开源。

    #DeepSeek V4“满血版”曝光,最快7月20日发布,首度引入“峰谷计费”。有开发者灰度测试体验后称,V4整体表现接近Opus 4.8级别,编码直追GPT-5.6 Sol。

    #Kimi:算力紧缺,19日起暂停C端新用户订阅,将已有算力全部投入于服务已订阅用户。
    #阿里巴巴 千问Token Plan个人版发布,2.4万亿参数Qwen3.8-Max预览版首发上线。Qwen3.8-Max预览版在代码工程与专业办公场景表现突出,或为仅次于Fable 5的最强模型,正式版将近期开源。#DeepSeek V4“满血版”曝光,最快7月20日发布,首度引入“峰谷计费”。有开发者灰度测试体验后称,V4整体表现接近Opus 4.8级别,编码直追GPT-5.6 Sol。#Kimi:算力紧缺,19日起暂停C端新用户订阅,将已有算力全部投入于服务已订阅用户。
    0 Comments ·0 Shares ·67 Views
  • 7月16日周四,月之暗面正式发布新一代开源基础模型 #Kimi K3,参数规模达2.8万亿,并同步上线API服务及开发者文档。

    Kimi K3是月之暗面迄今最强旗舰模型,专为长程智能体编程与自我演进工作流而打造。它引入了月之暗面自研的Kimi Delta Attention(KDA)混合线性注意力机制以及 Attention Residuals(AttnRes)结构,通过优化长序列信息处理和深层网络信息传递能力,提高大规模模型的训练效率和推理表现。

    Kimi K3支持100万Token上下文窗口,并原生具备视觉理解能力,主要面向软件工程、知识工作以及复杂推理等高难度场景。

    知识工作评测方面,社区整理的GDPval-AA v2数据显示,Kimi K3取得1687分,超过Claude Opus 4.8 Max的1600分,仅次于Claude Fable 5 Max和GPT-5.6 Sol Max。该测试主要评估模型在44类职业、9个行业中的真实工作能力,涵盖研究分析、商业判断、专业写作等复杂任务。

    金融时报报道称,月之暗面正在进行新一轮融资,估值约315亿美元;
    DeepSeek也已启动新一轮融资,估值约710亿美元。
    相比之下,Anthropic最新融资后的估值约为9650亿美元,OpenAI最新估值约为8520亿美元。
    7月16日周四,月之暗面正式发布新一代开源基础模型 #Kimi K3,参数规模达2.8万亿,并同步上线API服务及开发者文档。Kimi K3是月之暗面迄今最强旗舰模型,专为长程智能体编程与自我演进工作流而打造。它引入了月之暗面自研的Kimi Delta Attention(KDA)混合线性注意力机制以及 Attention Residuals(AttnRes)结构,通过优化长序列信息处理和深层网络信息传递能力,提高大规模模型的训练效率和推理表现。Kimi K3支持100万Token上下文窗口,并原生具备视觉理解能力,主要面向软件工程、知识工作以及复杂推理等高难度场景。知识工作评测方面,社区整理的GDPval-AA v2数据显示,Kimi K3取得1687分,超过Claude Opus 4.8 Max的1600分,仅次于Claude Fable 5 Max和GPT-5.6 Sol Max。该测试主要评估模型在44类职业、9个行业中的真实工作能力,涵盖研究分析、商业判断、专业写作等复杂任务。金融时报报道称,月之暗面正在进行新一轮融资,估值约315亿美元;DeepSeek也已启动新一轮融资,估值约710亿美元。相比之下,Anthropic最新融资后的估值约为9650亿美元,OpenAI最新估值约为8520亿美元。
    0 Comments ·0 Shares ·196 Views
  • #DeepSeek V4正式版发布后将同步调整API定价策略,引入峰谷定价机制。API 高峰时段价格将是平时价格的2倍,高峰时间段为每天的上午9 点到12点、下午2点到6点。
    #DeepSeek V4正式版发布后将同步调整API定价策略,引入峰谷定价机制。API 高峰时段价格将是平时价格的2倍,高峰时间段为每天的上午9 点到12点、下午2点到6点。
    0 Comments ·0 Shares ·28 Views
  • Jefferies策略师指出,#智谱 推出的GLM5.2模型"性能几乎与Anthropic相当,但每token成本仅为后者的四分之一",将过去这一周定性为"又一个DeepSeek时刻"。
    Jefferies策略师指出,#智谱 推出的GLM5.2模型"性能几乎与Anthropic相当,但每token成本仅为后者的四分之一",将过去这一周定性为"又一个DeepSeek时刻"。
    0 Comments ·0 Shares ·89 Views
  • #DeepSeek V4更新DSpark,推理速度提升80%。新框架旨在解决大语言模型在高并发生产环境中的推理效率瓶颈,已部署于DeepSeek-V4-Flash与DeepSeek-V4-Pro的预览版服务引擎中。

    推测性解码是一种在不改变模型输出分布的前提下加速大语言模型推理的技术。其核心思路是引入一个轻量级的「草稿模型」(draft model),预先生成若干候选 token,再由目标模型(target model)对这批候选进行批量验证和接受,从而将串行逐 token 生成转变为并行批量校验,大幅降低端到端延迟。

    在此基础上,DSpark 的创新在于引入半自回归生成架构(Semi-Autoregressive Generation):它保留并行草稿模型的高吞吐优势,同时加入轻量级串行模块,对 block 内 token 之间的依赖关系进行建模,以缓解并行草稿模型在后续位置上容易出现的接受率衰减问题。
    #DeepSeek V4更新DSpark,推理速度提升80%。新框架旨在解决大语言模型在高并发生产环境中的推理效率瓶颈,已部署于DeepSeek-V4-Flash与DeepSeek-V4-Pro的预览版服务引擎中。推测性解码是一种在不改变模型输出分布的前提下加速大语言模型推理的技术。其核心思路是引入一个轻量级的「草稿模型」(draft model),预先生成若干候选 token,再由目标模型(target model)对这批候选进行批量验证和接受,从而将串行逐 token 生成转变为并行批量校验,大幅降低端到端延迟。在此基础上,DSpark 的创新在于引入半自回归生成架构(Semi-Autoregressive Generation):它保留并行草稿模型的高吞吐优势,同时加入轻量级串行模块,对 block 内 token 之间的依赖关系进行建模,以缓解并行草稿模型在后续位置上容易出现的接受率衰减问题。
    0 Comments ·0 Shares ·57 Views
  • #DeepSeek 宣布将所有部门规模至少扩大一倍,广招服务端开发、预训练数据、AI搜索工程师等核心岗位。
    #DeepSeek 宣布将所有部门规模至少扩大一倍,广招服务端开发、预训练数据、AI搜索工程师等核心岗位。
    0 Comments ·0 Shares ·65 Views
  • 一家去年营收7.24亿元、还在亏47亿的公司,本周一市值冲破了1万亿港元。#智谱

    从1月8日116.2港元的发行价算起,五个多月涨了将近20倍。它成了第一家市值过万亿港元的中国独立大模型公司。

    万亿港元对应约7.24亿元的年收入,市销率落在1300到1600倍之间。
    同期 Anthropic 一级市场估值约9650亿美元、市销率20倍出头,
    OpenAI估值 8520 亿美元、市销率34倍左右,
    A 股里最贵的寒武纪也就 110 倍上下。

    瑞银:中国模型的 API 均价不到美国同类的 20%,训练成本不到 10%,但毛利率却和 Anthropic、OpenAI 基本持平,都在 20% 到 40% 之间。

    Artificial Analysis在其智能指数v4.1中将GLM-5.2评定为51分,领先MiniMax-M3(44分)、DeepSeek V4 Pro(44分)和Kimi K2.6(43分),同时将其置于GPT-5.5与Opus 4.8之间,成为迄今排名最高的开源模型。

    在最高难度的SWE-Marathon基准上,GLM-5.2得分13.0,Opus 4.8为26.0;视觉能力缺失也是当前短板。AI研究机构Proximal评价称,GLM-5.2是"第一个真正缩小了Anthropic/OpenAI与其他模型提供商之间巨大技术鸿沟的模型"。

    智谱将在7月8日解禁2568.16万股,对应当前解禁市值约为269.14亿港元。而变动前流通股仅约1735.08万股,占总股本比例不足4%。
    #赌场有千
    一家去年营收7.24亿元、还在亏47亿的公司,本周一市值冲破了1万亿港元。#智谱 从1月8日116.2港元的发行价算起,五个多月涨了将近20倍。它成了第一家市值过万亿港元的中国独立大模型公司。万亿港元对应约7.24亿元的年收入,市销率落在1300到1600倍之间。同期 Anthropic 一级市场估值约9650亿美元、市销率20倍出头,OpenAI估值 8520 亿美元、市销率34倍左右,A 股里最贵的寒武纪也就 110 倍上下。瑞银:中国模型的 API 均价不到美国同类的 20%,训练成本不到 10%,但毛利率却和 Anthropic、OpenAI 基本持平,都在 20% 到 40% 之间。Artificial Analysis在其智能指数v4.1中将GLM-5.2评定为51分,领先MiniMax-M3(44分)、DeepSeek V4 Pro(44分)和Kimi K2.6(43分),同时将其置于GPT-5.5与Opus 4.8之间,成为迄今排名最高的开源模型。在最高难度的SWE-Marathon基准上,GLM-5.2得分13.0,Opus 4.8为26.0;视觉能力缺失也是当前短板。AI研究机构Proximal评价称,GLM-5.2是"第一个真正缩小了Anthropic/OpenAI与其他模型提供商之间巨大技术鸿沟的模型"。智谱将在7月8日解禁2568.16万股,对应当前解禁市值约为269.14亿港元。而变动前流通股仅约1735.08万股,占总股本比例不足4%。#赌场有千
    0 Comments ·0 Shares ·289 Views
  • 深度求索(#DeepSeek )已完成首轮融资,以非传统的交易架构筹集逾 500 亿元人民币(约合 74 亿美元)。

    梁文锋个人本轮出资额最高,达 200 亿元人民币,其次是腾讯的 100 亿元。中国电池巨头宁德时代投资 50 亿元,电商企业京东、游戏发行商网易及风险投资机构 IDG 资本各出资 30 亿元。

    该架构要求投资者将资金注入由深度求索首席执行官梁文锋管理的有限合伙企业,而非直接投资深度求索本身,以此确保梁文锋对公司保持绝对控制权。

    知情人士还表示,该架构对所有投资者所持股份设定了五年锁定期,期间不得出售股权。
    深度求索(#DeepSeek )已完成首轮融资,以非传统的交易架构筹集逾 500 亿元人民币(约合 74 亿美元)。梁文锋个人本轮出资额最高,达 200 亿元人民币,其次是腾讯的 100 亿元。中国电池巨头宁德时代投资 50 亿元,电商企业京东、游戏发行商网易及风险投资机构 IDG 资本各出资 30 亿元。该架构要求投资者将资金注入由深度求索首席执行官梁文锋管理的有限合伙企业,而非直接投资深度求索本身,以此确保梁文锋对公司保持绝对控制权。知情人士还表示,该架构对所有投资者所持股份设定了五年锁定期,期间不得出售股权。
    0 Comments ·0 Shares ·129 Views
More Results
叙旧 https://v.xu9.net