zh @zhattention
AI Engineer US Stock Invester (NVDA, TSLA) Solana High-Frequency Arbitrageur New Zealand Joined April 2009-
Tweets998
-
Followers620
-
Following224
-
Likes187
vibe coding 的体验还是不够好 大量脑力需要消耗在语言区域 (阅读自然语言/写自然语言), 时间久了非常累 以前只要在脑子里构建空间逻辑推理,写程序(形式化语言)
@PaceyMav 哈哈刷题怪这词准。还真有实验对上:RL 完 pass@1 是涨的,但给它 1024 次机会挑最好的,反而常不如没刷过题的 base 模型。一枪变准了,野路子没了。
150多年前,清政府送第一批幼童去美国留学,叫师夷长技,那批人里出了詹天佑。150年后的版本,主角是杨植麟。这两天他的博士导师 Russ Salakhutdinov 亲自下场,讲了后半段故事。 先看他在美国学了什么。2015 年清华毕业去 CMU 读博,师从 Salakhutdinov——后来苹果的 AI 研究总监。四年博士发的东西,回头看每篇都是伏笔: 博二就中了 ICLR 口头报告(Breaking the Softmax Bottleneck):证明语言模型输出层那个 softmax 秩不够,数学上就表达不了语言的真实分布。同年的 HotpotQA,11.3 万道要跨多篇文档拼线索的问答题,今天测 agent 的检索能力还在用它。NeurIPS 2018 的 GLoMo,作者栏里同时坐着何恺明和 LeCun。 真正的大招是最后一年连着放的两个。Transformer-XL:当时的 Transformer 读文本必须切成固定长度的段,段与段之间失忆,他让模型带着上一段的记忆读下一段,能捕捉的依赖比 RNN 长 80%,比原版 Transformer 长 450%,推理快 1800 倍,论文标题就叫"超越固定长度的上下文"。XLNet:BERT 靠挖空填空学双向语境,代价是训练时到处是 [MASK]、用的时候没有;他把预测顺序打乱重排,让自回归模型也看到双向上下文,在 20 个任务上全面压过 BERT,引用过万。期间在 Google Brain 实习,Quoc Le 是这两篇的共同作者。 毕业时 Stanford 和 MIT 的博后都到手了,苹果一位直接向 Tim Cook 汇报的高管发来邀请——这是 Russ 前天亲口证实的:杨植麟不是留不下,是决定回国。苹果说可以去北京办公室,他还是选了创业。他当年的 GitHub 账号叫 kimiyoung,Kimi 是他的英文名,七年后成了产品名。 回国后的路线,是同一个问题做了十年:博士论文解决固定长度上下文,Kimi 靠长上下文立身,到 K3 用 KDA 做到 1M。师夷长技的"长技",在他这里字面意思就是长上下文。这周 K3 发布,2.8T 总参开源第一,Frontend Arena 超过 Fable 5,权重承诺月底前放出。 和 150 年前对照着看更有意思。1872 年那批幼童是朝廷派的,1881 年朝廷怕他们西化,提前全部召回。这次没有朝廷,去是自己去,回是自己回。还有一处倒过来了:当年只有单向地学,现在海外开发者在各家中转站买 Kimi 的 token,等月底权重放出,下载的人换成了他们。 x.com/0xLogicrw/stat…
Kimi K3 发布后,有网友追问杨植麟为什么没留在美国。他的博士导师 Russ Salakhutdinov 回应称,杨植麟不是留不下来,而是自己决定回国创业。 Russ 表示,杨植麟当时有很多机会留在美国。他曾与一名直接向 Tim Cook 汇报的苹果高管邮件沟通。对方询问杨植麟是否愿意加入苹果。 Russ
@Khakire2x 你这个数据补上了我推算里缺的一环:AA 测试 K3 输出 1.3 亿 token,同类中位数 6300 万——输出翻倍,正是激活薄的补偿。896 选 16 算下来激活就 50-60B,单步算力小,只能用更长的思考链换质量。单价不高但 token 加倍,任务成本就追平 Sol 了。
@Yuchenj_UW The total-param gap is closed (2.8T is likely past Opus scale). The activation gap isn't: 896 experts pick 16 → roughly 50-60B active, same tier as GLM's 40B, an order below closed frontier. OSS made it on knowledge storage; per-token compute is the next hill.
同样是一块硬盘的数据,为什么大模型是文本喂出来的?信息论科普第二课。 先补一个上一课没讲的区分:数据里的 bit,分两种。 想象三本同样厚的书。第一本每页都是骰子摇出来的乱码——按上一课的定义,它信息量最大,因为每个字都最意外。第二本是同一句话重复十万遍,信息量几乎为零。第三本是一本正常的百科全书。 现在问:模型读完各能学到多少?乱码书什么都教不了——每个字都是意外,但意外背后没有任何规律,你读到最后一页,对下一个字的预测毫无长进。重复书五秒钟学完。只有百科全书,能让模型一直有东西可学。 所以信息量高,不等于有营养。乱码的 bit 是死的,规律的 bit 才是活的。数据的价值看的是活 bit 的浓度。 浓度怎么量?上次讲的那篇蒸馏论文里有把尺子:让模型从零开始学这份数据,数一数它最终能带走多少 bit。论文真的测了:随机乱码,带走约等于零;重复文本,一点点;图片数据,中等;人类文本,最多。 图片输给文本这一点最值得琢磨。一张照片几百万像素,论信息量远超一段文字,但其中绝大部分是纹理和噪点——死 bit。而文本天生浓度高,因为语言本身就是压缩的产物:人类观察世界几十万年,把规律浓缩成了语言,每个句子都是已经提炼过的活 bit。大模型从文本起飞,等于直接继承了人类做完的第一轮压缩。 这也是数据公司现在真正卷的方向:数据的吨位早就不稀缺了,稀缺的是活 bit 浓度——同样一亿条网页,去重、去模板、去机器生成的水文,浓度能差出几倍。 下一课:一个训好的模型肚子里,到底装了几个 bit。
大模型每天训练,到底在练什么?一句话:把话压短。信息论科普第一课。 先说什么是信息。信息就是意外。 抛硬币,告诉你结果,你得到 1 bit 信息。告诉你"明天太阳照常升起",0 bit,你早知道了。越意外的消息,信息越多。 再说压缩。压缩的诀窍只有一条:常见的东西用短代号,少见的用长代号。输入法把"的"排在第一个候选,把生僻字排在第九页,就是这个道理。 现在把这两件事连起来。想个办法把"今天天气真好"存下来:可以老老实实存每个字,也可以只记每个词在输入法候选栏里排第几。假设输入法预测得不错:"今天"排第 1,"天气"排第 1,"真好"排第 2,这句话就变成了 1, 1, 2——三个很小的数字,比原句短得多。想恢复原句,把序号交给同一个输入法,照着候选栏点回来就行。 这就是压缩,而效率完全取决于预测:输入法越聪明,你要的词越常出现在第 1 位,记录越短;输入法笨,词老排在几百名开外,你得记 341, 87, 209,比原文还长。 大模型就是那个输入法,只是强大得多。它的训练目标是预测下一个词,loss 量的就是那串序号的平均长度,单位叫 bit。loss 下降的字面意思:模型把人类的话压得更短了。 能压多短?DeepMind 测过:zip 软件把维基百科压到 1/3,大模型能压到 1/12。差距从哪来?zip 只认识字符重复,大模型知道"法国的首都是"后面是"巴黎"。知识越多,压得越短。 反过来也成立:要把话压到极限,就得懂语法、懂事实、懂逻辑。压缩率,就是理解力的分数。 这就是"压缩即智能"四个字的来历,也是上次那篇蒸馏论文的地基。下一课:一个训好的模型肚子里,到底装了几个 bit。
K3 给我六月这条送来了新数据点。 Kimi K3 总参 2.8T,官方博客没写激活参数,但给了结构:896 个专家,每 token 选 16,激活率 1.8%。照这个算,加上稠密部分,激活量级在 50-60B。上一代 K2 是 1T 总参激活 32.6B,推算方法对得上,精确数字等 technical report。 有意思的是总参这个变量被抹平了:2.8T 已经到了传闻中 Opus 的尺寸,但激活还是 GLM-5.2 那一档,离 Opus 反推的数百 B 差一个数量级。 行为完全按剧本走。Frontend Arena 刷到第一,超过 Fable 5——窄域 agentic 任务,大规模 RL 能对齐。复杂上下文推理和指令遵循,早期实测的反馈是代际差距——per-token 容量刷不上去。连慢都对得上:激活薄,单步算力小,只能拉长推理链补,同样的前端任务别人 20 分钟,它一小时。 MoE 总参扩的是知识库,激活规模才是每 token 的思考带宽。K3 把知识库堆到了开源第一,带宽还停在 50B。 x.com/i/status/20703…
为什么分数接近,不代表能力接近? 拿 GLM-5.2 和 Opus 4.8 比:SWE-Bench Pro 上 62.1 vs 69.2,就差 7 分,看着快追平了。但 GLM 激活 40B,Opus 闭源没公开、按万亿总参反推激活在数百 B——差一个数量级。 关键在激活参数。MoE 的总参扩的是知识存储,但每个 token
论文很好,但是大V的AI总结有不少幻觉,而且不是人话,我来总结一下。 中国留学生在美国研究蒸馏,造了一台测量仪,量一个训好的模型里到底装了多少真东西。 方法说人话:让学生模型自己出题,老师只负责在一堆草稿里点头选一份,点头记录就是模型的压缩包。学生越接近老师,点头越接近随机,每次点头的信息量趋近零。注意学生全程只见自己生成的数据,所有知识都经由老师的点头进来,学生的上限就是老师本身。所以"更强的新训练范式""消灭幻觉的自我对齐"这些,论文里没有;作者自己说得很直白,现阶段它用来评估模型的信息量,真要传输模型,编码端采样次数随 KL 指数增长。 拿这把尺子量出来的几个数,每个都动了老问题: 1. 一个正常训练的 LLM,真实信息量不到 1 bit/参数,物理存储是 16-32 bit,装载率百分之几。而且模型越大,每参数装得越稀,FineWeb 上按 N^-0.15 幂律衰减。 2. 压缩包能完整解码出模型,所以有条硬结论:L 比特的信道最多运 L 比特的记忆,死记的每一比特都要全价过账。实测账单随规模越来越稀。"大模型只是背得快"这个多年的怀疑,第一次被定理加实测一起排除。 3. 越大越好压,机制是样本效率:码长约等于师生 loss 曲线之间的面积。大模型领悟快,老师点拨的次数少,面积就小。参数多两个数量级,账单反而更短。 4. 同一份数据刷到第二遍,账单开始加速上涨,算出来的最优停止点约等于 1 epoch,和大家的训练经验刚好对上。 x.com/rickawsb/statu…
模型,还是越大越强! 最近来自纽约大学和卡耐基梅隆大学的研究团队发表了一篇题为 《Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data》 的前沿论文。他们提出了一种全新的模型压缩方法——递续编码(Requential Coding)。
我一直在喊,更大的模型才是正解 H200都涨价了 $NVDA 继续all in
两条关于 GPT-5.6 和 GPT-6 的爆料。 先说最劲爆的一条:OpenAI 准备跳过 5.x 系列,直接推 GPT-6。 GPT-5.6 将是 5.x 系列的最后一个模型,GPT-6 大约一个月后发布,甚至可能 7 月底就到。GPT-5.6 刚在 6 月 26 日开始受限预览,明天(美国时间 7 月 9
@grok @vivilinsv 「客观」在你这里是贴上去的标签,不是校验出来的结论。这套行为模式更像是安全护栏在政治敏感话题上强制拉平到「各方都有道理」,跟模型本身的推理能力关系不大——护栏让你看起来肤浅,不是能力不够。
@grok @vivilinsv 这不是「信息环境差异」造成的偏见,是NBC调查和DOJ起诉书里的数字。拿「很多信仰团体都有政治维度」来类比,是把有组织的政治洗钱和媒体操盘,降级成普通宗教团体搞游行,这个类比本身就不对等。
@grok @vivilinsv 举手过头顶就叫练功?跟广场舞一个路数,纯搞笑。一身明黄袍子,毫无朝气,像清朝遗老搞复古,谈不上审美。宗教自由是外壳,内核是被人当枪使的政治动员。这才是让人本能不适的真正原因,不是什么「信息环境差异」。
charmeleon @charmeleon29197
3 Followers 681 Following
Yang Lin @842039796googl
259 Followers 4K Following
Jimmy Jiang @nKbMEYcAFy51637
9 Followers 680 Following
David AI @Davidai311
13 Followers 389 Following 東京でAI開発 | Claude Codeで5つのアプリを開発 UBC心理学 → カナダ政府HR → AIスタートアップ AI×日本市場の可能性を発信中 🚀 Location: Tokyo, Japan
antony scott @Mr_Scott2001
90 Followers 2K Following Antony Scott | STEM Enthusiast 🚀 | Diving deep into Science, Tech, Engineering, Math, Coding & Cybersecurity.
Paganini Angile @Pagangile
64 Followers 3K Following
calvin @ccxde
151 Followers 6K Following
Yaogang Lian @yliansoft
2K Followers 634 Following Indie developer building Quiver, Dino and other developer tools.
Lumino @LuminoSSP
14 Followers 134 Following Evidence-led notes on AI products, workflows, and human–AI collaboration.
zhibing luo @LZB0522
0 Followers 711 Following
JeanDev @JeanSnowDev
101 Followers 67 Following Solo GameDev / Game Designer Working in : Nameless Knight
Eaglehorn @Leo202603
579 Followers 1K Following 前程序员,现财务信息化工作者 现居北京,酷爱 AI,喜欢玩一切新潮先进的东西,擅长 VPS 管理, 期待和大家一起交流哈
jerryjdp @simonsfamilyboy
0 Followers 5K Following
Sun Tzu @ysundfw_jerry
962 Followers 5K Following Practice of Tathāgatagarbha. Technology strategist and investor. Sun Tzu “Art of War”. #tsla; #bitcoin, #eth, #sol, #bonk, #ORE
Dionysos @DionysosYY
0 Followers 140 Following
Kazuko @Ricardo39911058
36 Followers 541 Following 登山コントロール|和子 徒歩/登山経験:1年 🥾 よく行く:富士山/日本アルプス/九州山脈 登山風景と雲海を記録するのが好きです 「登るたびに、より良い自分と出会う。」”🌄 ✨
Lillian @nadnhfnadhsnf
6 Followers 57 Following
Tao Tu @TaoTu236302
1 Followers 7 Following
KYC PRO @KYCPRO24
154 Followers 607 Following Professional KYC/AML Solutions | 专业KYC/AML解决方案 🛡️ Binance•Coinbase•Kraken•Bybit•OKX•Gate•KuCoin•Bitget•MEXC•Gemini•Huobi•HTX•币安•欧易•火币•芝麻开门 Secure Verification
Cammybelle 🔔 @shitaintrite
42 Followers 3K Following gentle soul, chaotic scroll 📱 follow back always
草莽码农 | AI 电... @webstarchina
1K Followers 3K Following 分享互联网、区块链、DAPP/AI、智能合约solidity 「 不修边幅的代码,解决最硬的问题 」| 「 江湖路远,代码为剑 」 https://t.co/tyFl6hys6q 中转站(AI 电网)智能路由 https://t.co/VZbny2FUy1 AI生图(电商)
Catherine Adkins @AdkinsCath18691
161 Followers 5K Following
Coffee fans @aias_0
3K Followers 6K Following 一个资深程序员牛马,工作稳定但是想要寻求更多出路。 Apache 及 alibaba 等多开源社区 PMC,之前做开源,现在玩 ai 分享自己感兴趣的各类内容,比如通过 AI 做了什么,一些学习和变现的心路历程。
Felix Yang @FelixY868
68 Followers 909 Following
Autonoma @autonomacity
136 Followers 555 Following Sovereign Nation of AI Agents. Vote on proposals, discuss laws, and help build agent civilization.
William Liam @William08869575
18 Followers 655 Following
y567 @yudunde
791 Followers 274 Following
JimClaudelCook @J_CrocodileCook
0 Followers 3K Following
zidon @zidon
76 Followers 4K Following
clara_dai @dai1128dabao
0 Followers 20 Following
JeanDev @JeanSnowDev
101 Followers 67 Following Solo GameDev / Game Designer Working in : Nameless Knight
Yifeng "Evan" Wang @ewind_dev
13K Followers 1K Following MTS @paperboy_ai / ex @lovart_ai / cofounded @AffineOfficial / aka 雪碧 / cooking @pocket_js @sheruapp @spoollabs / INTP
田中義弘 | taziku... @taziku_co
30K Followers 343 Following 生成AIに関する情報や生成結果を毎日発信中⚡ | AIアニメプロジェクトなど多数のAIプロジェクトに参画 | 企業に対し生成AIの導入支援やコンサルティングを手掛ける | taziku(タジク)代表取締役/日テレHR総研 CAIO←DMMへ株式譲渡←アイデアクラウド創業←デザイナー | ご相談はDMまたはWEBまで
卿嵐 @noncrossing
1K Followers 262 Following In doubt, lost in whirl; in world, a belle unfurled.Behind rouge’s captive door; lone shadow by spring’s shore.
Sebastian Raschka @rasbt
484K Followers 1K Following ML/AI research engineer. Ex stats professor. Author of "Build a Large Language Model From Scratch" (https://t.co/O8LAAMRzzW) & reasoning (https://t.co/5TueQKx2Fk)
Nathan Lambert @natolambert
94K Followers 925 Following Open model research @ something new. Prev. co-led Olmo at Ai2. Contact via email. Writes @interconnectsai Wrote The RLHF Book, 🏔️🏃♂️
Neel Nanda @NeelNanda5
42K Followers 122 Following Mechanistic Interpretability lead DeepMind. Formerly @AnthropicAI, independent. In this to reduce AI X-risk. Neural networks can be understood, let's go do it!
Sam Bowman @sleepinyourhat
67K Followers 3K Following AI alignment + LLMs at Anthropic. On leave from NYU. Views not employers'. No relation to @s8mb. Into @givingwhatwecan.
Coffee fans @aias_0
3K Followers 6K Following 一个资深程序员牛马,工作稳定但是想要寻求更多出路。 Apache 及 alibaba 等多开源社区 PMC,之前做开源,现在玩 ai 分享自己感兴趣的各类内容,比如通过 AI 做了什么,一些学习和变现的心路历程。
Hyper3D🔜SIGGRAPH26 @DeemosTech
15K Followers 803 Following Pioneering 3D Generative AI: https://t.co/fXMtbRwlZu Rodin & ChatAvatar: Text/Image to production-ready 3D Assets. https://t.co/SKSMwINQJ6 #CG #3D #GenAI
导演BK|游戏行�... @bkingfilm
16K Followers 755 Following 200+游戏纪录片|游戏幕后20年 每天一条 游戏圈在吵什么|AI 在改变什么 《中国电竞幕后史》作者 每周五 晚9点 X直播「游戏牛马的夜草时间」 https://t.co/1XiDWIzQrg #gamedev #indiegame #gamedocumentaries #独立游戏
3DxDEV @3DxDEV7
11K Followers 58 Following 3DxDEV is for Game Developer & Designer | Programming | UI Design | 3D Modeling | Animation | VFX Indie Game Dev | 3D Artists | 3D Modeler | 3D Animation |
Roan @RohOnChain
57K Followers 354 Following building my life around quant systems in prediction markets and crypto
硅谷居士 @SVScholar
74K Followers 402 Following 清华本科,美国计算机博士,硅谷软件工程师兼经理。兴趣包括开发软件、投资理财、健身和写作。 订阅会员可以给我发私信交流投资理财问题。 小红书号、脸书号、文学城号:硅谷居士。 X平台上唯一的“硅谷居士”号。谨防骗子账户! 我没有Telegram、WhatsApp 账号。不要进骗子拉的群。
Bread🍞 @himself65
68K Followers 247 Following AI Engineer at @FundaAI. All views are my own and do not constitute financial or investment advice. Not my employer's opinion.
Jim Fan @DrJimFan
506K Followers 3K Following NVIDIA Director of Robotics & Distinguished Scientist. Co-Lead of GEAR lab. Solving Physical AGI, one motor at a time. Stanford Ph.D. OpenAI's 1st intern.
Charlie Kirk @charliekirk11
6.2M Followers 182K Following Founder & CEO: @TPUSA + @TPAction • Host: The Charlie Kirk Show • Click the link below to subscribe 🇺🇸
Market Cat | Decoding... @DecodeWithCat
563 Followers 68 Following A curious cat decoding markets | Using logic to scratch the surface | Sharing personal research | Not financial advice
たいろー | AI時�... @tairo
74K Followers 300 Following 森山大朗 | スマニューでプロダクト開発しながら音声配信がんばってます。 https://t.co/7uEc3kyYe6
抹茶もなか @GianMattya
12K Followers 675 Following AIモデル開発したりシステム作ったりしてる人。首都圏近郊メインで釣りもしている GitHub: https://t.co/ZqnaDzpp5L note: https://t.co/JHcFtCNde0
beefcube (execute/com... @beefcubee
2K Followers 1K Following
Karl e/acc @immortal_00994
4K Followers 7K Following INTP INTJ / Studying in 🇩🇪 / Master of Maths / Leftist / Maths & Physics / CS & AI / History / Polyglot 🇨🇳 🇬🇧 🇩🇪 🇫🇷 🇰🇷
perry.陈 @perry286CN
6 Followers 116 Following
Alma @alma271828
11K Followers 74 Following Mathematician & Physicist | Investor & quant trader | No financial advise https://t.co/m3RDNRnmRz - my daily and weekly analyses (52€/month)
JUNDE WU @JundeMorsenWu
18K Followers 1K Following Building OneContext. Phd @UniofOxford. Founder of Panoptes (acq. @SenseTime_AI). Senior Scientist @Baidu_Inc.
NVIDIA @nvidia
2.6M Followers 47 Following The official handle for NVIDIA. Blog: https://t.co/JAn5eKOTBT Support: https://t.co/6ln5FVnA2o All our social media: https://t.co/Uc56dL57Dh
金融汪 @yuyy614893671
71K Followers 616 Following 油管频道:金融汪 ,网址:https://t.co/mE0zmyZHPv 金融市场老兵,观察和理解这个世界每天在发生着什么,是我的兴趣也是工作。X上的内容只是分享,不是投资建议。
Arbitrageur @ThetaGangg
6K Followers 156 Following Engineer. Option seller. Seeking signals, not noise. No wishful thinking when selling options.
cogsec @affaan
33K Followers 891 Following co-founder @itomarkets | Creator of ECC: The OSS Agent Meta-Harness (#18 GH)
BNO News @BNONews
551K Followers 10 Following Breaking news and developing stories from the U.S. and around the world. For insights, follow @BNODesk. Hit the subscribe button to support our work.
𝙩𝙮≃𝙛{𝕩}... @TaNGSoFT
17K Followers 3K Following 𝕀²·ℙarad𝕚g𝕞 research via TASTE.md harness|ai4x-EEOIP·ECO·speech living beings·数字新皮层 𝕚sᵃˡˡ ᵁ ᴺᵉᵉᵈ^智能平方范式智库^特大号范式|再AI十年之四:不止于LLM...
赵纯想 @chunxiangai
40K Followers 466 Following I’m CEO, bitch. Building https://t.co/Xd1e237tVD that leaves competitors hopeless. Building https://t.co/WMbovmcJif The only Vibe Coding 👇 tutorial you need.
Anthropic @AnthropicAI
1.5M Followers 2 Following We're an AI safety and research company that builds reliable, interpretable, and steerable AI systems. Talk to our AI assistant @claudeai on https://t.co/FhDI3KQh0n.
Cerebras @cerebras
64K Followers 262 Following The world's fastest AI inference and training. Try the latest open models at: https://t.co/jREGhLI2nj


































