当前标签#大模型

阿莫代伊的减速论卡在中国

阿莫代伊最近接受采访时说,想让AI行业主动放慢前沿模型的脚步,但承认中国是这套构想里最棘手的变量。逻辑很直白:如果只有部分国家和企业减速,别人继续冲,那主动慢下来的一方在技术、经济甚至军事上都会吃亏。他呼吁建立某种全球限速机制,但也坦言协调极难,因为先拿到先进AI能力的战略收益太大,自己都不确定能不能实现。

这个表态有意思的地方在于,它把AI安全从技术伦理问题拉回了地缘政治。Anthropic和OpenAI的研究人员近期密集发声,有人离职公开批评行业风险过高,中国厂商的新模型又在不断缩小差距,金砖峰会上也提出了全球AI治理框架。与此同时两家美国头部公司都在准备上市,资本和舆论压力只会让这场“全速前进还是主动刹车”的争论更激烈。我的判断是,限速机制在缺乏互信的前提下基本是空谈,真正可能先落地的反而是开源生态和治理共识这种软性框架。对出海从业者来说,与其赌谁先停,不如盯紧谁能把合规能力变成竞争优势。

月之暗面赴港上市传闻被否认

今天看到一条消息,说月之暗面正在考虑去香港和上海两地上市,想借此拿更多钱、提升知名度。结果没过多久,就有知情人士出来对媒体说这个传闻不实。

其实这波传闻最早是南华早报先报的,引了两个知情人士,说月之暗面可能香港上海两地上市。后面又有消息说,他们7月跟投资方谈过赴港IPO的具体安排,还透露出赴港之后想再回内地上市,目标可能是上交所科创板。科创板最近确实挺热闹,长鑫存储、宇树科技都去了,大家也都在等DeepSeek、长江存储这些名字。

但既然官方口径已经否认了,那这事暂时就只能当个传闻看。做AI这行,融资和上市节奏本来就敏感,尤其大模型公司烧钱快,市场关注度高,一有风吹草动就容易被放大。我个人觉得,月之暗面肯定有资本层面的规划,只是具体时间表和地点,现在还没到能公开的阶段。

对出海和跨境圈来说,这事也提醒我们,看这类新闻别急着下结论。港股和科创板对科技公司的吸引力都在,但企业选哪里、什么时候上,背后牵扯的因素很多。先让子弹飞一会儿吧。

搞懂AI回答问题的三个机制

最近看到一篇讲AI基础原理的科普,把大模型为什么能回答问题拆成了三个机制,我觉得对非技术背景的跨境从业者挺有用,转述一下我的理解。

第一个是参数机制。所有大模型本质上都是对人类知识做数学建模,把知识拆成一个个词元,再去计算词元之间的数学关系,这个过程就是训练。训练出来的关系用海量参数表示,比如GLM 5.3就有7440亿个参数,这些参数就是词元之间的权重。训练完成后我们提问,模型就根据这些权重找出最可能的词元,生成符合概率的答案。所以大模型其实是一种压缩-生成机制,把人类知识抽象进参数里,用的时候再还原出来。

第二个是推理机制。参数越多模型效果通常越好,因为能更精确地描述知识,还原也更准确。但参数不可能无限加,训练和使用成本会直线上升,运算时间也会变长。原文到这里就断了,后面应该还有内容,但已经能看出一个基本逻辑:模型能力、成本和响应速度之间始终在权衡。

对我们做跨境业务的人来说,理解这层原理至少有个好处:知道模型不是真的懂,而是在做概率生成,所以对输出要保持校验习惯,尤其是涉及合规、本地化表达和客服话术的时候。选模型也不是参数越大越好,得看场景和成本。

DeepSeek V4 Pro 请求被路由到 V4.1 Flash

刚看到 DeepSeek 团队 @Tianyi Cui 在群里发的消息,V4.1 Flash 正式上线后、V4.1 Pro 上线前,所有 V4 Pro 的请求都会被路由到 V4.1 Flash,而且按 Flash 的价格计费。也就是说,现在用 V4-Pro 其实就是在用 V4.1 Flash,价格也一样。

官方给的理由是 V4.1 Flash 在性能、费用、速度、总用时这些指标上全面超过了 V4 Pro,再以更高价格、更慢速度和更多算力去提供原来的 V4 Pro 不太合适。这个逻辑我认,毕竟谁也不想花冤枉钱。

另外从北京时间 2026 年 9 月 10 日 12:00 起,flash 系列定价也要调整:空闲时段输入缓存命中 0.02 元、未命中 1 元,输出 4 元;高峰时段是空闲时段的 2 倍。对比之前 8 月 17 日那波最高 12 倍的涨价,这次算是明显回调了,缓存命中降了 60%,未命中降了 33.3%,输出降了 11.1%。不过注意 Pro 的价格没提,应该保持不变。

对开发者来说,这波操作短期是好事,等于用 Pro 的入口享受 Flash 的性价比。但长期还得看 V4.1 Pro 什么时候上、定价怎么定。建议大家最近跑任务时留意一下路由和计费,别按老价格做预算。

— 已显示全部 —