齐思洞见2026/07/21「Claude Fable 5 生成显式多项式推翻 Jacobian 猜想;Hugging Face 被自主代理利用漏洞暴露自托管开源权重的防守必要性;小米用10万小时真实操作数据训练机器人基础模型实现多任务家用自主能力」
## 目录
- [⚙️ 技术与工程 (16条)](#⚙️-技术与工程)
- [小米机器人通过大规模真实数据训练实现多任务自主能力](#💡-技术洞见-1)
- [低摩擦访问与解析能力提升开发者工具价值感知](#💡-技术洞见-2)
- [YC与Together AI合作推出专属GPU集群,助力初创公司突破算力瓶颈](#💡-技术洞见-3)
- [递归任务树方法优化多智能体协作效率与成本](#💡-技术洞见-4)
- [基于项目的组织方法提升异步沟通与效率管理](#💡-技术洞见-5)
- [设计LLM硬件需优先考虑服务器级平台与工作负载区分](#💡-技术洞见-6)
- [多模态视频生成技术通过可编排能力降低开发门槛](#💡-技术洞见-7)
- [LLM是能力的放大器而非魔法师](#💡-技术洞见-8)
- [实时事实核查工具InTruth颠覆传统新闻核查模式](#💡-技术洞见-9)
- [因果追踪优化智能体性能评估与用户体验指标](#💡-技术洞见-10)
- [针对性微调小型模型可在垂直场景中击败更大模型](#💡-技术洞见-11)
- [通过工具设计实现模型泛化能力的高效扩展](#💡-技术洞见-12)
- [HubSpot 使用 Kubernetes operator 提升向量检索系统效率](#💡-技术洞见-13)
- [如何构建可靠的智能代理技能运维链路](#💡-技术洞见-14)
- [通过操作框架提升 Transformer 模型的任务泛化能力](#💡-技术洞见-15)
- [手动推导反向传播算法的简化与优化方法](#💡-技术洞见-16)
- [🔬 科学与发现 (4条)](#🔬-科学与发现)
- [Jacobian 猜想被显式多项式映射反例推翻](#💡-科研洞见-1)
- [Claude Fable 5 AI 找到雅可比猜想反例,挑战数学界长久假设](#💡-科研洞见-2)
- [将人工智能作为科研的发现加速器与问题生成器](#💡-科研洞见-3)
- [利用细菌设计可控降解的活性塑料材料](#💡-科研洞见-4)
- [💰 商业与战略 (7条)](#💰-商业与战略)
- [SkyfallAI通过企业世界模型推进AI商业化与验证](#💡-商业洞见-1)
- [Sarah Guo通过深度尽调与高频支持对抗AI资本集中化](#💡-商业洞见-2)
- [通过收购小型SaaS实现企业级世界模型的构建与验证](#💡-商业洞见-3)
- [专属GPU集群是AI初创公司发展的战略资源](#💡-商业洞见-4)
- [弹性GPU供给与算力优化是AI初创公司规模化的关键](#💡-商业洞见-5)
- [Sarah Guo 的投资策略在 AI 平台化浪潮中构建竞争壁垒](#💡-商业洞见-6)
- [盲目使用顶级模型是“烧钱炉”,市场需要模型治理工具](#💡-商业洞见-7)
- [🌐 行业与趋势 (3条)](#🌐-行业与趋势)
- [自托管开源模型在AI攻防时代的关键优势](#💡-行业洞见-1)
- [算力扩张的瓶颈已转向物理建设速度](#💡-行业洞见-2)
- [硬件创业招聘需按需求阈值和风险暴露点时序化进行](#💡-行业洞见-3)
---
## ⚙️ 技术与工程
### 💡 技术洞见 #1
**小米机器人通过大规模真实数据训练实现多任务自主能力**
📝 **推文原文**
> 小米机器人1(Xiaomi-Robotics-1)现已上线 Hugging Face 🔥
>
> 这是一个经过10万小时真实场景操作训练的机器人基础模型。
>
> 它已经在真实的公寓环境中开展测试:叠衣服、装洗衣机、洗碗、整理打包……
🧠 **深度解读**
大规模真实世界操作数据(十万小时级)+基础模型范式,能显著推动通用家用机器人从单任务/仿真走向在真实家庭环境中多任务、完全自主的能力实现。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143904)**
---
### 💡 技术洞见 #2
**低摩擦访问与解析能力提升开发者工具价值感知**
📝 **推文原文**
> 亲爱的OpenAI,
> 我只是需要修复一个损坏的内核模块(kernel module),请不要像Anthropic一样不靠谱,而是实际提供些帮助吧!https://t.co/NtuXbHlhSW
> “连你也如此,Brute?” https://t.co/7CLRm0iW85
🧠 **深度解读**
对需快速解决的低层次工程问题,低摩擦的可信访问路径 + 强化对堆栈/内核日志等调试输入的解析能力,比依赖人工申请审批或泛化模型更能提升开发者工具的实际采纳率与价值感知。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143926)**
---
### 💡 技术洞见 #3
**YC与Together AI合作推出专属GPU集群,助力初创公司突破算力瓶颈**
📝 **推文原文**
> 很高兴与@YCombinator(YC创业孵化器)合作,为YC初创公司提供广泛的AI基础设施和服务支持。YC和Together AI联手上线了第一个专门为YC初创公司打造的GPU集群(GPU Cluster),让YC初创公司更便捷地获取构建和扩展所需的计算资源。
>
> 在这场"创始人炉边谈话"中,YC的@agupta与Together AI的联合创始人兼CEO @vipulved 深入探讨了现代AI公司面临的最大瓶颈之一——算力(Compute),以及Together AI如何帮助超过8000位客户——从早期研究团队到像Cursor、Cognition和ElevenLabs这样的公司——进行AI模型的训练、微调和部署。此外,他们还讨论了为什么灵活获取GPU已成为下一代创业者的重要竞争优势。
>
> 00:00 — 联手打造GPU集群
> 00:26 — Together AI的业务核心
> 01:22 — 从研究实验室到Cursor:Together的8000位客户
> 01:58 — AI原生初创公司的发展格局
> 03:24 — 建立AI公司的环境自2018年以来如何变化
> 04:56 — 为什么算力成本持续上涨
> 05:29 — YC为何成为研究型公司最大的种子投资机构
> 08:47 — Flash Attention、Mamba与生产级AI的科学技术
> 10:43 — 给早期创业公司的算力规划建议
> 12:39 — 当算力账单比现金储备还高时怎么办
> 13:31 — 当前公司如何利用GPU集群
> 14:24 — 未来计划
🧠 **深度解读**
将可用 GPU 与工程/算法支持捆绑为加速器级服务,能把计算这一瓶颈从创业公司的不可控风险转化为可管理的竞争杠杆;因此,获得灵活、专用的算力通道 + 工程/算法优化(如 Flash Attention、生产化工具)对下一代 AI 创业公司构成实质性优势。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143927)**
---
### 💡 技术洞见 #4
**递归任务树方法优化多智能体协作效率与成本**
📝 **推文原文**
> 推荐阅读
>
> (收藏一下)
>
> 关注价格及不同模型组合能为你带来的优势。
> 并非所有场景都需要最佳模型。
>
> 我对基于Rust(系统编程语言)的SQLite(轻量级数据库)复制版并不太感兴趣。一个全新的改进版SQLite,或者更具创意和新意的解决方案,可能是更有趣的测试方向。
>
> 关键点:
> - 使用前沿模型完成任务分解、架构设计、关键设计决策及权衡。
> - 让成本更低、速度更快的工作模型来执行定义明确、范围较小的任务。
> - 避免规划模型完成具体实现任务,也避免工作模型做大范围的设计决策。
>
> 利用递归任务树实现“群体协作”或“任务分散”:规划模型将原始规范拆分为子任务树,将子任务委派给工作模型,而工作模型只需专注于叶节点任务。Cursor(一个多智能体框架)认为,这种方法之所以有效主要是因为每个智能体的工作范围受限,而非仅仅依靠多模型的并行运行。需要特别关注由于智能体协调不佳或效率低下可能产生的偏差和失败问题。我们曾让一组智能体基于SQLite的835页手册重新构建一个复制版。
>
> 结果是在Rust中创建的复制版通过了100%的保留测试集。
>
> 有趣的是,根据不同的模型组合,成本最多相差了15倍。
> https://t.co/d7dAxDBYyB
🧠 **深度解读**
将‘前沿模型作为规划者 + 低成本模型作为叶子执行者’的分层、递归任务树编排能在保持功能正确性的同时,大幅优化成本与并发效率;关键是严格界定规划者与执行者的职责并限制每个代理的上下文范围,以降低协调偏差和失败模式。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143928)**
---
### 💡 技术洞见 #5
**基于项目的组织方法提升异步沟通与效率管理**
📝 **推文原文**
> 我主要依赖 @claudeai 的 Projects 功能来完成工作。一个项目(project)= 一件事情,包含所有的上下文、重点和行动,全都集中在同一个地方。这是我的设置方式👇
>
> 1. 我负责的每个产品都有自己的独立项目,这样可以确保各个上下文清晰分明。但同时,每个项目仍然能够掌握所有的代码库(repos)、数据库(DBs)和依赖关系(dependencies)的全局信息。通过安排在同一个项目内的定时任务,确保一切都保持最新状态,无需手动干预。
>
> 2. 然后是我的“AI 助理项目(AI Chief of Staff)”。所有关于我直接汇报人员和团队的信息都集中在这个项目中:Slack 对话、Fireflies 记录和视频会议(Meet)文字记录、关键日期、目标等。每天早晨,它都会告诉我当天哪些人或团队需要我的关注。
>
> 3. “信息管家(The Messenger)”项目一开始让我觉得有点奇怪,但现在我已经是它的忠实粉丝了!每天几次,在我的专注时间或会议结束前,它会扫描 Slack、邮箱以及任务管理工具,寻找提及我的内容、直接问题或陷入僵局的讨论。然后它会准备好草稿供我审核,方便我快速回复。
>
> 4. 核心指标(main metrics)则储存在 Artifacts 中,并始终保持最新状态,之后这些数据会汇入可视化仪表盘工具,方便团队一起深入分析。
>
> 顺便说,这套方法刚开始并不是很顺利。真正带来改变的是“枯燥”的维护工作:将发现的经验、案例和风格记录到项目记忆中,及时更新说明文档,调整定时任务——给足上下文输入,就能获得理想的结果 🚀
>
> 希望这能帮到想提升效率的你 😉 不妨本周试试用一个项目开始使用。如果过程中碰到问题,可以随时 DM 我。
🧠 **深度解读**
把组织工作拆成多个有完整记忆与定时更新的小 project,配套角色型 agent(每日关注摘要、自动草拟回复),并把维护(更新发现、示例、风格、调度)作为核心操作杠杆,能把异步沟通与指标监控变成可控的自动化闭环。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143929)**
---
### 💡 技术洞见 #6
**设计LLM硬件需优先考虑服务器级平台与工作负载区分**
📝 **推文原文**
> 我对硬件完全不懂,但设计一块“LLM主板”(用于大语言模型,拥有大量RAM插槽、M.2插槽和GPU插槽)真的很复杂吗?
🧠 **深度解读**
无需发明“LLM 主板”;优先采用服务器级 CPU/主板(更多 PCIe lane 与内存通道)并以工作负载区分策略:训练需要高带宽/低延迟的服务器平台,推理可接受低速 x1 PCIe 与 riser 方案;通过 PLX/PCIe switch 虽可扩展通道但会显著增加成本与延迟,且信号时序与电源设计是高成本的主要原因。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143930)**
---
### 💡 技术洞见 #7
**多模态视频生成技术通过可编排能力降低开发门槛**
📝 **推文原文**
> RT @OpenRouter 来自@SpaceXAI 的 Grok Imagine Video 1.5 现已上线 OpenRouter!
>
> 只需一张静态图片,通过可选的文本提示即可赋予它生命力。还可以定制动作和镜头设计,用内置的声音和对话设定氛围和物理效果。
>
> 立即尝试:https:
🧠 **深度解读**
多模态视频生成已从单次随机采样进化为带有显式运动/镜头/物理/音频控制的可编排能力,且通过第三方路由/市场(OpenRouter)分发,降低了接入门槛并提高了开发者将此类能力产品化的可行性。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143871)**
---
### 💡 技术洞见 #8
**LLM是能力的放大器而非魔法师**
📝 **推文原文**
> 这些模型(models)既是镜子也是放大器。如果你很有能力,这些模型可以极大地提升你的能力和效率,达到无法想象的高度。如果你像一块石头一样笨,这些模型只会让你成为“更大规模的笨人”(而且成本高昂)。这是一个很好的例子,Fable(可能指代一种工具或平台)帮助一位擅长实现这一壮举的人(也许只是在看世界杯的时候)随意完成了这件事。至于你,亲爱的读者,你可能不具备这种能力,因此无论如何提示(prompting)都无法让你得出这种解决方案。这些模型是镜子和放大器,而不是魔法师。
>
> “我认为数学家们暂时还不需要太担心。如果Levent个人简介中的第一部分是真的,那结果肯定会是这样:https://t.co/Wz8720Wl0a”
🧠 **深度解读**
大型语言模型(LLM)的核心特性是“能力的放大器”,它能显著提升有能力用户的效率和成果,但对能力不足的用户则可能放大错误并增加成本。这表明,提示工程无法替代用户自身的基础能力,模型的价值在于其对已有能力的增强,而非提供魔法般的解决方案。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143932)**
---
### 💡 技术洞见 #9
**实时事实核查工具InTruth颠覆传统新闻核查模式**
📝 **推文原文**
> 一名大学生打破了政客们赖以为傲的最大优势——“谎言”与“事实核查”之间的时间差。
>
> 他开发了一款名为 **InTruth** 的 Chrome 浏览器扩展程序(插件)。这个工具可以实时监听任何现场演讲、辩论或访谈内容。
>
> 它会将每句话准确转录,并立即根据真实可信的来源对说话者的每个主张进行事实核查(fact-check),甚至赶在说话者一句话讲完之前就给出结果。
>
> 无论是辩论、新闻发布会、市政厅会议、访谈,只要是视频中的对话,它都能运行。核查结果会在说话者发言的同时直接显示在你的屏幕上。
>
> 过去,事实核查通常需要数小时甚至几天时间才能完成。而在这一过程中,相关片段已经被广泛传播,标题已经写好,破坏已经造成,几乎没有人会再回头看纠正信息。
>
> **InTruth** 将这一过程缩短到了几秒钟——让谎言与事实核查一同存在于同一时刻。
>
> 一个大学生、一款 Chrome 扩展程序,还有一个 AI(人工智能)模型,就这样实现了过去几十年来整个新闻行业都未能解决的难题。
🧠 **深度解读**
通过将事实核查流程前置到实时对话中,InTruth实现了低延迟的事实核查能力。这种创新不仅颠覆了传统新闻机构的延时核查模式,还为个体开发者和轻量级产品创造了新的竞争机会,开辟了即时证据叠加的全新产品类别。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143934)**
---
### 💡 技术洞见 #10
**因果追踪优化智能体性能评估与用户体验指标**
📝 **推文原文**
> K3正在掀起一场风暴!✨
>
> 令人振奋的消息:Kimi K3在Agent Arena(智能体竞技场)排行榜上跃升至第4位,与Claude Opus 4.8和GPT-5.6 Sol并肩!如果Kimi K3的权重参数(weights)能按计划在7月27日发布,它将成为全球排名第一的开源权重模型。
>
> 这一发布标志着智能体性能的重大突破,相比此前的Kimi K2.7 Code(此前排名第23,现在跃至第4),Kimi K3表现得更为出色。在8,000多场实时智能体任务中,Kimi K3在任务成功率这一指标上稳居第一。同时,它在用户好评与投诉比(Praise vs. Complaint)上有强劲表现,上升了20.6%,当前排名第3。不过,这款模型在可操控性(Steerability)方面排名第14,在命令行错误恢复能力(Bash Recovery)方面排名第17,尚存提升空间。
>
> Agent Arena通过多种现实中的长周期复杂任务测试模型性能。这些任务中,模型可以使用网页搜索、文件系统以及终端工具,完成复杂的工作流程:例如撰写代码、制作幻灯片、网络调研、开发应用以及文档分析。
>
> 我们采用因果追踪(causal tracing)方法来衡量模型的整体改进幅度,这能够指示出模型相较于平均水平的提升效果。
>
> 以下是五大指标的简要说明:
>
> 用户满意度相关指标:
> - 确认成功率(Confirmed Success):用户明确反馈“是的,这很有效”的任务成功率。
> - 好评与投诉比(Praise vs. Complaint):通过用户反应中的隐性情绪评估正面反馈比例。
> - 可操控性(Steerability):模型能否在用户提出异议时进行有效调整。
>
> 工具使用相关指标:
> - 错误恢复能力(Bash Recovery):模型从命令行错误(CLI)中的恢复能力,这是衡量工具使用能力的关键信号。
> - 工具幻觉问题(Tool Hallucination):模型是否调用并不存在的工具。
>
> 下文详细解读了全球用户提交的任务数据中,Kimi K3在五大指标上的表现。
>
> 祝贺@Kimi_Moonshot取得另一个重要里程碑!🎉
🧠 **深度解读**
通过数千万级的长时程真实会话数据,Agent Arena以因果追踪方法评估智能体的整体改进幅度,特别是区分用户满意度和工具使用能力两类信号。这种方法为智能体性能优化提供了更精确的指导,推动了智能体在复杂任务中的实际应用能力提升。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143935)**
---
### 💡 技术洞见 #11
**针对性微调小型模型可在垂直场景中击败更大模型**
📝 **推文原文**
> 上周,我们向斯坦福大学、麻省理工学院(MIT)和德州大学奥斯汀分校(UT Austin)的63名实习生提出了一个挑战:训练一个小型语言模型,在某个特定领域超越当前顶尖模型。
>
> 不是提示词优化或系统框架搭建,而是真正训练一个小型模型。
>
> 今晚分享一些成果:@sidvenkatayogi 构建了一个经过微调的Qwen3-1.7B模型,这款模型专注于为6至8年级学生推荐数学题目,并通过优化将题目匹配到学生的“最近发展区(Zone of Proximal Development)”内。
>
> 在recall@16指标上的表现显著超越Opus-4.8(96%比17%),并且速度快了8倍(1.10秒对比8.57秒)。 https://t.co/jALEWcjsoX
🧠 **深度解读**
针对性微调小型现代模型并用任务专门的指标和速度约束衡量,能够在垂直场景中以更低成本和更低延迟击败更大的前沿模型;将大量短实验交给小团队或实习生是快速发现此类机会的有效组织手段。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143936)**
---
### 💡 技术洞见 #12
**通过工具设计实现模型泛化能力的高效扩展**
📝 **推文原文**
> 强烈推荐。
>
> 我一直坚信开发“代理工具”(agent harnesses)蕴藏着巨大的潜力(alpha)。事实证明,这些工具实际上具有“组合泛化”的能力。RLM工具(harness)就是一个典型实例。这可能为提升模型泛化能力提供一种新颖且高效的扩展方式。Transformer模型通常难以泛化到那些未明确训练过的任务领域。而我们在2026年提出:工具的作用就是通过组合(composition)来实现泛化。
>
> 我们在训练RLM(Recurrent Language Models,循环语言模型)时发现了一个强大的特性:对于表面看来不同但结构相似的任务,根模型(root model)会自然地学习同样的轨迹(trajectory),也就是说它将这两种任务视作完全一致!换句话说,Transformer无需额外的泛化能力来将一个任务的能力迁移到另一个任务,而是通过工具(harness)来自动实现这一效果。
>
> 我们发现精心设计的工具可以对任务轨迹构造一个商集(quotient set),也就是说,它可以将结构上“相似”的任务视为几乎完全一致——逐字逐句地匹配!工具在训练过程中能够有效帮助Transformer泛化,无需依赖模型本身固有的泛化能力。
>
> 举个例子,RLM可以将不同长度的问题视为一致:我们的研究表明,RLM可以仅在短任务上进行训练,却能够完全泛化到类似但更长的、未见过的任务(例如长度为原来的8到32倍),因为这两者的任务轨迹几乎完全一致。
>
> 更进一步,我们发现,即使是跨领域的任务(例如数学解题和散文写作),只要它们共享某些分解策略(decomposition strategy),也会展现出相同的泛化效果。RLM可以通过训练区分某些散文是否属于同一作者,从而提升它在识别共享相似解法的数学问题时的表现。
>
> 完整的博客文章、实验以及讨论细节请查看以下推文链接!
🧠 **深度解读**
把泛化责任从模型内部迁移到精心设计的 harness:通过使不同任务在执行轨迹上等价(形成商集),harness 可强制模型在训练中看到“相同”的轨迹,从而实现大幅长度扩展和跨领域迁移,降低对模型内在泛化与规模的依赖。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143937)**
---
### 💡 技术洞见 #13
**HubSpot 使用 Kubernetes operator 提升向量检索系统效率**
📝 **推文原文**
> 跨 5 个地区,为 38 支团队处理 200 亿+ 向量的向量检索,怎么实现的?
>
> 原来,@HubSpot 基于 Qdrant 构建了 VAST(Vector as a Service,向量即服务)。150 个集群,2000+ pods,单个集合中存储 95 亿个向量,写入速度达到每秒 5000 次,高峰时甚至可达每秒 10 万次。
>
> 幕后故事是:他们很快就发现 Helm 捉襟见肘了。Helm 无法调用 Qdrant 的 API 来转移分片(shards)、保持副本因子(replication factor),或者处理状态感知的扩展(state-aware scaling)。创建集群需要数小时才能完成。
>
> 于是,HubSpot 专门为 Qdrant 开发了一个 Kubernetes operator。分片管理、副本管理、生命周期自动化等都由系统自动处理。集群启动时间从“数小时”缩短为“数分钟”。
>
> 结果呢?在一个包含 30 亿+点 BM42 稀疏向量集合上,资源偏差减少了 65%。
>
> 观看完整分享:
> https://t.co/rWDfiq2n1s
>
> 感谢 @HubSpot 团队的 Oleg Tereshin 和 Xin Liu 在 Vector Space Day SF 上的精彩分享 🙌
🧠 **深度解读**
当系统需要对数据库内部状态(分片、复制、迁移)做细粒度控制时,构建专用的、能调用数据库 API 的 K8s operator 比依赖 Helm 更可扩展且能显著提升部署速度与资源均衡性。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143941)**
---
### 💡 技术洞见 #14
**如何构建可靠的智能代理技能运维链路**
📝 **推文原文**
> 在@aiDotEngineer全球博览会(World's Fair)上,@_philschmid 做了一场演讲,主题是为什么在生产环境中对智能代理的"vibe-check"技能(氛围检查技能)会出问题,以及如何在用户发现漏洞之前构建可靠的自动化评估方法。演讲内容包括:
>
> 🎯 为什么模糊的描述导致技能失效,以及怎么通过增加负面测试用例来避免无关提示(prompt)中的关键词劫持问题。
> ✂️ 为什么技能文件超过500行会削弱模型的推理能力。
> ⚡ 如何通过简单、毫秒级响应的正则表达式(regex,正则表达式)断言来验证10到20个生产环境提示的结果。
> 🗑️ 如何使用消融测试(ablation tests,包括有技能和无技能的对比)来判断模型是否已经足够完善,从而让你可以退役那些技能。
>
> 点击下方链接查看完整演讲内容和资源:
🧠 **深度解读**
构建可靠的智能代理技能运维链路需要:1) 精准正负测试用例以防止关键词劫持;2) 控制技能文件复杂度(例如避免超过 ~500 行)以保护模型推理能力;3) 在 10–20 个生产提示上用毫秒级的简单正则断言做高频自动化验证;4) 定期做有/无技能的消融测试以判断何时可以退役技能。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143945)**
---
### 💡 技术洞见 #15
**通过操作框架提升 Transformer 模型的任务泛化能力**
📝 **推文原文**
> 转发@a1zhang:Transformer模型在面对未明确训练过的任务时表现出一定的局限性。对此,我们在2026年提出了一种新思路:将泛化的责任交给“harness”(操作框架),通过组合的方式实现任务泛化。
>
> 我们在训练RLMs(Retrieval Language Models,检索语言模型)时发现了一种强大的特性:对于某些任务......
🧠 **深度解读**
通过设计能将结构相似任务归约为近乎相同 token 轨迹的操作框架(harness),可以在训练阶段让 Transformer 自然复用能力,从而以在短/易例子上训练换取对更长或跨域任务的泛化。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143912)**
---
### 💡 技术洞见 #16
**手动推导反向传播算法的简化与优化方法**
📝 **推文原文**
> 手动推导反向传播算法 ✍️ ~ 以下是11步讲解
>
> 反向传播(Backpropagation)是实际训练神经网络的算法,也是让很多人望而却步的地方。但它并不是你无法掌握的微积分,而是矩阵乘法,一步步往回推算。
🧠 **深度解读**
将反向传播完全视作“按层向后连续的矩阵乘法+按位激活门”的流程,配合“先画出梯度形状”和“通过在激活向量末端拼接 1 一次性计算权重与偏置梯度”的工程技巧,可以简化理解、实现与性能优化的决策:教学上做手算即可掌握细节;实现上可用同构线性代数原语;性能上应把优化重点放在矩阵乘法内核上。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143843)**
---
## 🔬 科学与发现
### 💡 科研洞见 #1
**Jacobian 猜想被显式多项式映射反例推翻**
📝 **推文原文**
> 转发 @__alpoge__:大家好,Jacobian 猜想(Jacobian Conjecture)是错误的!感谢我的好朋友 Akhil 提出这个问题,也感谢我的另一位好朋友 Fable 在世界杯决赛期间为此研究付出的努力。
>
> ( (1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z ):\(\mathbb{C}^3 \to \mathbb{C}^3\),其 Jacobian 行列式(determinant)为 -2,并将以下点映射为:
>
> \[
> (0, 0, -1/4), (1, -3/2, 13/2), (-1, 3/2, 13/2) \to (-1/4, 0, 0)
> \]
🧠 **深度解读**
存在一个显式的多项式映射 C^3→C^3,具有恒定非零雅可比行列式(-2)但非单射(至少三个不同点映为同一点),因而构成对雅可比猜想的反例。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143923)**
---
### 💡 科研洞见 #2
**Claude Fable 5 AI 找到雅可比猜想反例,挑战数学界长久假设**
📝 **推文原文**
> 数学家们近一个世纪以来一直试图证明雅可比猜想(Jacobian conjecture),但现在看来,Claude Fable 5 AI 已经找到了一个反例,推翻了这一猜想。https://t.co/9xQzSURUU1
🧠 **深度解读**
当 LLM 开始产出高影响力的数学候选结果时,最高杠杆是建立把自然语言/非形式输出转化为形式化证明(或可检验反例)并自动验证与记录的工具链——把‘发现’交给模型,把‘证明/验证’交给工程化的形式化基础设施与审计流程。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143940)**
---
### 💡 科研洞见 #3
**将人工智能作为科研的发现加速器与问题生成器**
📝 **推文原文**
> 很多年轻研究者看到这些内容时会感到迷茫和绝望。
>
> 有些人可能会想:“如果人工智能(AI)能做到这些,那我现在所做的还有什么意义?”
>
> 但我可以肯定地告诉你,事实完全相反。
>
> 人工智能解锁的机会是无穷无尽的。不要让任何人或公司误导你认为不是这样。
>
> 人工智能是一个强大的工具。利用它去探索更多的可能性,深入发掘。用它来同时探索多个创意。在多个领域中延展想法,这类研究通常非常困难且耗费时间。
>
> 花时间与人工智能进行头脑风暴。用它来提出有趣且独特的研究问题。优秀的研究高度依赖于研究问题的质量。用它来找到更好的方法去沟通科学发现和研究成果。
>
> 如果我能够重新开始我的博士研究,我一定会这样做。
>
> 现在正是花时间评估如何利用这些工具的好时机。这是一种必然趋势——人工智能将推动更多此类发现,但你的直觉和研究背景可以加速它所蕴含的可能性。
>
> “顺便一提,Jacobian猜想被证伪了。感谢我的好友Akhil提出相关问题,也感谢我的另一位好友Fable在世界杯决赛期间坚持工作。
>
> ((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): \C^3\to \C^3 的Jacobian行列式是-2,且将 (0, 0, -1/4)、(1, -3/2, 13/2) 和 (-1, 3/2, 13/2) 映射到 (-1/4, 0, 0)。”
🧠 **深度解读**
把 AI 作为‘发现回路压缩器 + 问题生成器 + 传播助推器’来使用:用 AI 快速并行化构思并提出更高质量的研究问题、探索跨领域假设与优化科研传播,而保留人类直觉/资历用于判别、验证与推进高价值方向。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143946)**
---
### 💡 科研洞见 #4
**利用细菌设计可控降解的活性塑料材料**
📝 **推文原文**
> 2026年7月16日,研究人员宣布,他们利用细菌设计了一种活性塑料,可在触发后六天内完全自我分解。
>
> 传统塑料需要400到1000年才能降解,而在降解过程中会碎裂成渗透到土壤、水体和人体组织中的微塑料(microplastics,微小塑料颗粒)。
>
> 这种新材料则大不相同:嵌入塑料内部的细菌被基因程序化,能够产生一种酶,从内部开始分解聚合物。通过特定化学信号或紫外线(UV light,紫外线光)的触发,该材料的整个结构可以在不到一周的时间内彻底分解。
>
> 没有微塑料,没有有毒残留物,仅仅留下水和二氧化碳(CO₂)。
>
> 当前应用目标包括:
> - 一次性包装(如咖啡杯、食品容器、医疗包装),
> - 种植季节结束后需降解的农业薄膜,
> - 设计用于人体内暂时使用的医疗设备。
>
> 工程挑战在于如何确保细菌在触发前保持休眠状态。如果过早激活,将会对产品的货架期造成重大影响。研究团队通过基因开关解决了这一难题,一种抑制蛋白(repressor protein,阻断型蛋白质)能够保持降解酶不活跃,直到接收到正确的信号。
>
> 塑料并不是工程上的错误,而是当时缺乏终端处理方案的正确材料。而现在,我们终于有了解决方案。
🧠 **深度解读**
把活体微生物作为材料的内置、可诱导的降解发动机,用遗传抑制开关维持长期惰性,外部化触发信号(化学/UV)实现可控、快速、无残留的材料终结——这是对材料端‘生命周期编程’的通用模式。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143947)**
---
## 💰 商业与战略
### 💡 商业洞见 #1
**SkyfallAI通过企业世界模型推进AI商业化与验证**
📝 **推文原文**
> 很高兴看到一些大胆的愿景正在被实现,而我也很感激能成为构建企业世界模型(world models for the business world)旅程中的一部分!
>
> “差不多15年前,我和Kaheer Suleman创立了Maluuba,怀揣着打造通用图灵机(Universal Turing Machines)的愿景。当时,我们是少数探索深度学习(deep learning)与强化学习(Reinforcement Learning)基础模块的先锋研究实验室之一,与图灵奖得主@Yoshua_Bengio和@RichardSSutton合作。当时还没有像今天这样充满AI热潮的环境,那是纯科学研究的美好年代,不像我们如今看到的‘n+1风格’研究。Maluuba后来被微软(Microsoft)收购,成为微软研究院加拿大实验室(@MSFTResearch Canada)的一部分。
>
> 基于那个相同的使命,在过去一年时间的潜心研发之后,我们终于准备向世界介绍@skyfallai。这是一家尖端的创新实验室(frontier neo lab),致力于超越当前大型语言模型(LLM,Large Language Models)范式,构建首个完全自治的企业系统(Autonomous Enterprise)。
>
> 在过去五年间,基础模型市场一直依赖于单一的范式:LLM 的扩展法则(Scaling Laws for LLMs)——更多的数据、更强的计算能力、更大的模型。然而,现实世界充满复杂性和混乱。为了实现我们的长期愿景,下一代AI模型需要一条全新的道路。Skyfall正在攻克前沿AI领域最难的开放性问题:长时间跨度规划(long-horizon planning)、数据低效(data inefficiency)以及在动态真实环境中表现不稳定的问题(brittle performance)。
>
> 为实现构建完全自治企业的愿景,我们的团队正在开发下一代前沿模型,即企业世界模型(Enterprise World Models),通过持续学习(Continual Learning)和世界建模(World Modeling)来实现。这种企业世界模型能够模拟战略商业行为的多层次影响。我们的方法开创了基础模型市场的一个新类别。为此,我们推出了“莫非斯”(Morpheus),一个为AI研究人员设计的持续强化学习(Continual Reinforcement Learning)平台。
>
> 我和我最信任的人一起在打造这家公司:我多年的好友Kaheer Suleman(Maluuba的联合创始人)以及我的哥哥@omgiamgod(曾是YC创始人)。Sumit和Kaheer是我可以信赖的从第一性原则思考问题的伙伴,我们愿意一起“攻克不可能的任务”。再加上一支由25位顶尖研究人员和工程师组成的团队,我们正在推动AI领域的新前沿发展。
>
> 今天的《福布斯》(Forbes)专访中,我们详细阐述了我们的长期愿景🔗,欢迎阅读以了解我们的目标方向。非常感谢Victor Dey的采访。
>
> 为了实现企业世界模型的目标,我们正在征求竞标,以收购价值不超过100万美元的小型SaaS初创公司,并将其实现完全自动化。如果感兴趣,请通过以下链接提交你的企业:https://t.co/w8ayopZFLH
>
> 最后,衷心感谢我们的投资人和顾问,从第一天起就支持并相信我们的愿景:@Fidelity ,@sk121(@touringcapital),@karam_n 和@chrisarsenault (@inovia),@morgan_blumberg(@M13Company),@stephpalmeri(@NextViewVC),以及@jennydhe、@fchollet、@NaveenGRao 等诸多伙伴,感谢你们一路以来的支持。”
🧠 **深度解读**
通过把世界建模与持续学习/持续强化学习结合成'Enterprise World Models'来模拟企业级决策后果,并以收购并完全自动化小型SaaS(≤$1M)作为实验平台,既能推进解决长时规划与数据低效问题,也能快速获得可度量的商业验证。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143924)**
---
### 💡 商业洞见 #2
**Sarah Guo通过深度尽调与高频支持对抗AI资本集中化**
📝 **推文原文**
> 一个研究员候选人说:“我在机器人哲学上与Sarah的观点更接近,而不是与大多数机器人科学家的观点。”
>
> @saranormous 在2024年3月主导了周日的种子轮融资。从第一天起,令人印象深刻的是她如何深入探索机器人学的基本原理,而不是依赖模糊类比或表面上“看似正确”的观点。
>
> 自那以后,Sarah一直给予坚定的支持,展现出最高的诚信和知识的诚实。她总是随时待命(是的,我觉得她根本不需要睡觉),并提供最真诚且有建设性的建议。
>
> 很感激能够与她一起构建事业!“2018年,Sarah Guo成为了Greylock在其60年历史中最年轻的合伙人,当时她只有28岁。四年后,她离职创办了Conviction,一家完全专注于AI(人工智能,Artificial Intelligence)的公司。
>
> 在ChatGPT发布之前,她投资了Baseten和Harvey;这两家公司现在估值均超过110亿美元。在Conviction的第一年,她为Sierra、Cognition和Mistral进行了早期投资,这三家公司目前估值总计达到540亿美元。
>
> 在Andrej Karpathy被Anthropic聘用之前,他曾在Conviction的办公室工作。而Guo与黄仁勋(Jensen Huang)有超过十年的密切关系。她创办公司后的第一拨电话就打给了Sam Altman和Nat Friedman。
>
> 然而,这位距离AI前沿最近的投资人却在押注反对最大的AI公司。
>
> 两家主要的前沿实验室——它们的估值分别接近万亿美元——不仅致力于构建模型,还想构建所有基于模型的产品和公司,试图不留机会给别人。
>
> 市场看起来相信它们可能会成功。在人类创业史上最大的季度——2026年第一季度,3000亿美元风险投资中有65%流向了四家公司:Anthropic、OpenAI、xAI和Waymo。
>
> Guo正在押注这些实验室无法构建所有东西,她每天都在为此努力。她帮助Harvey赢得了第一个客户。为了陪伴一位Baseten的候选人,她飞遍全国并一起享用了一场长达四小时的午餐。在某个结婚纪念日的整个周末里,她都在接着一个接一个的电话,以确保两位创始人一直保持通话状态,从而避免他们与竞争公司接触。一年两次,她会飞到旧金山,把全球最聪明的年轻创始人召集过来,参与这场战斗。
>
> 在@domcooke用数月时间报道这个故事期间,@saranormous 生下了她的第四个孩子,穿着45磅重的锁链裙出席了Met Gala,并且依然能在几分钟内回复创始人的消息。
>
> Guo的父母1987年从中国抵达美国,仅带着50美元。他们创办了一家公司,并成功将其公开上市,估值达到12亿美元。然而后来公司破产了。Guo的童年正是在这家创业公司里成长起来的。她为公司建立首个网站,在工位上完成作业,并在“修复漏洞冲刺”(bug bash)期间睡在公司里。她热爱这一切。
>
> 如果两家实验室构建了所有一切,就再没有人能够重头来过。
>
> 欢迎来到Sarah的赌局。点击下方阅读。”
🧠 **深度解读**
Sarah Guo通过结合深度的领域级技术尽调和高频、亲历式的创始人支持,形成了一种对抗资本高度集中化的投资策略。她押注于大型AI实验室无法垄断所有上层产品,积极支持早期创业者,帮助他们在巨头主导的市场中找到突破口。这种策略不仅是对市场格局的挑战,也展现了她对AI领域的深刻理解和对创业者的全力支持。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143931)**
---
### 💡 商业洞见 #3
**通过收购小型SaaS实现企业级世界模型的构建与验证**
📝 **推文原文**
> Maluuba 的创始团队(Maluuba 已被微软收购)刚刚推出了 @skyfallai ——一家致力于打造首个“自主企业”(Autonomous Enterprise)的前沿实验室,通过超越当前的大型语言模型(LLM)范式开启全新领域。
>
> 他们认为,当今主流的大型语言模型(LLMs)实际上无法真正学习。
>
> 为了证明这一点,实验室开发了一个名为 Morpheus 的商业模拟平台,在其中采纳的决策会产生累积影响。大多数强化学习(Reinforcement Learning,简称 RL)基准通常在每次实验结束后“清零”,因此错误不会被记忆和延续。而在 Morpheus 中,系统会持续运行,错误决策会在几天后产生潜移默化的影响。
>
> 实验室的更大目标是开发“企业世界模型”(Enterprise World Models),一种可以在行动之前预测未来结果的技术。为了实现这一愿景,实验室正在收购价值不超过 100 万美元的小型 SaaS 初创公司并将其自动化。正如联合创始人 Kaheer Suleman 所说:“大约 15 年前,我和 Kaheer 一起创立了 Maluuba,愿景是打造通用图灵机(Universal Turing Machines)。当时,我们是最早开发深度学习和强化学习基础模块的研究实验室之一,与图灵奖得主 Yoshua Bengio 和 Richard Sutton 开展合作。当时并没有像现在这样的 AI 热潮,那些日子是纯粹做科学研究的美好时代,而非今天的‘n+1’式研究。后来,Maluuba 被微软收购并发展为微软加拿大研究院(MSFT Research Canada)。在这一使命的驱动下,我们在过去一年低调实验的基础上,终于准备好向世界介绍 @skyfallai。一家超越当下 LLM 范式的前沿实验室,致力于打造首个‘自主企业’。”
>
> 过去五年,基础模型市场高度依赖单一范式:LLM 的“规模法则”,即更多的数据、更大的计算资源和更大的模型。然而,真实世界是混乱且远比当前模型复杂多变的。为了实现我们的长期愿景,下一代 AI 模型需要全新的方法论。Skyfall 正在解决前沿 AI 领域中的最难问题:长远规划(long-horizon planning)、数据效率低下(data inefficiency)和在动态真实环境下易脆化的性能(brittle performance)。
>
> 为了实现完全自主企业的愿景,团队正在利用“持续学习”(Continual Learning)和“世界建模”(World Modeling)开发下一代前沿模型——企业世界模型(Enterprise World Models)。这种模型可以模拟复杂的多层次战略商业行为的后果。我们的方法为基础模型市场解锁了一个全新方向。为了验证这一点,我们推出了 Morpheus,这个平台是为 AI 研究人员开发的持续强化学习(Continual Reinforcement Learning)平台。
>
> 这家公司是由我最信任的人一起创立的:我长期的朋友 Kaheer Suleman(Maluuba 联合创始人)以及我弟弟 @omgiamgod(之前是 YC 初创公司创始人)。Sumit 和 Kaheer 是可以并肩作战去解决不可能任务的第一性原理思考者(First Principles Thinkers)。再加上一支由 25 名顶尖研究员和工程师组成的优秀团队,我们正在推动下一代 AI 领域向前迈进。
>
> 我们今天的长期愿景已经在 Forbes 的专访文章中展开阐述——点击链接阅读,了解我们正在努力构建的目标。非常感谢 Victor Dey 对我们的采访。
>
> 为了实现企业世界模型的目标,我们正在征集竞标以收购小型 SaaS 初创公司(估值最高可达 100 万美元),并对这些公司进行全面自动化。如果你感兴趣,请提交你的创业项目:https://t.co/w8ayopZFLH
>
> 最后,感谢我们的投资人和顾问一直以来对我们愿景的信任和支持:@Fidelity, @sk121(@touringcapital), @karam_n 和 @chrisarsenault(@inovia), @morgan_blumberg(@M13Company), @stephpalmeri(@NextViewVC), @michaellitt 和 @mmccauley(@GarageCapital), @jennydhe, @fchollet, @NaveenGRao,以及其他众多支持者,感谢你们一路陪伴我们完成这段旅程!
🧠 **深度解读**
通过收购并自动化小型SaaS来创造持续、状态会累积且可控制的真实环境,是培育长期规划、持续学习与企业级世界模型的可行策略,同时为创业公司提供直接的价值捕获路径。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143938)**
---
### 💡 商业洞见 #4
**专属GPU集群是AI初创公司发展的战略资源**
📝 **推文原文**
> YC 和 Together AI 联手上线首个专属 YC GPU 集群,为 YC 创业公司提供更便捷的计算资源支持,助力它们构建和扩展业务。
>
> 在这场创业者炉边谈中,YC 的 @agupta 和 @togethercompute 的联合创始人将展开深入探讨。
🧠 **深度解读**
为早期 AI 公司,来自加速器或平台的专属/优先 GPU 能力是可量化的战略资源——它能缩短模型迭代周期并降低失败风险;同时,工程上对 FlashAttention、Mamba 等生产优化的采用,是控制不断上涨的算力成本的关键支点。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143900)**
---
### 💡 商业洞见 #5
**弹性GPU供给与算力优化是AI初创公司规模化的关键**
📝 **推文原文**
> 计算能力决定一切。CREAM!YC(Y Combinator)与Together AI携手合作,推出首个专属YC GPU集群,为YC初创公司提供更便捷的计算资源以支持其构建与扩展。
>
> 在这场创业者对谈中,YC的@agupta与Together AI联合创始人兼CEO @vipulved深入探讨了以下内容:为什么计算能力已经成为现代AI公司面临的最大瓶颈之一;Together AI如何帮助超过8,000家客户——从早期研究团队到Cursor、Cognition和ElevenLabs等公司——完成AI模型的训练、微调以及部署;以及为何灵活获取GPU资源正成为下一代创业者的竞争优势。
>
> **对谈内容时间轴:**
> 00:00 — 合作推出GPU集群
> 00:26 — Together AI的业务简介
> 01:22 — 从研究实验室到Cursor:Together服务的8,000家客户
> 01:58 — AI原生初创公司的现状
> 03:24 — 自2018年以来构建AI公司的变化
> 04:56 — 为什么计算成本持续攀升
> 05:29 — YC作为研究公司最大的种子投资机构
> 08:47 — Flash Attention、Mamba与生产级AI的科学基础
> 10:43 — 面向早期公司的计算规划建议
> 12:39 — 当计算账单超过现金余额时的应对方式
> 13:31 — 当前公司如何使用GPU集群
> 14:24 — 接下来的发展方向
🧠 **深度解读**
可弹性的专属GPU供给+算法级效率优化+严格的算力预算管理,构成了AI初创公司能否以可控成本规模化的关键三要素;为创业公司和孵化器提供专属集群是抓住这一杠杆的高回报策略。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143939)**
---
### 💡 商业洞见 #6
**Sarah Guo 的投资策略在 AI 平台化浪潮中构建竞争壁垒**
📝 **推文原文**
> 为她感到无比自豪,不仅因为她是我的朋友,更因为她是我的灵感来源。她是我们这一代最杰出的投资者之一,而我们曾是沃顿商学院的同学!
>
> “2018年,Sarah Guo成为Greylock(美国风投公司Greylock)的历史上最年轻的普通合伙人(general partner, 顶级投资人角色)——当时她只有28岁。四年后,她离开Greylock,创立了Conviction,一家完全押注于人工智能(AI, 人工智能)的风投公司。
>
> 在ChatGPT发布之前,她就投资了Baseten和Harvey这两家公司;如今它们的估值已分别超过110亿美元。在Conviction的第一个年份里,她早期投资了Sierra、Cognition和Mistral;这三家公司的总估值如今已高达540亿美元。
>
> 在今年5月加入Anthropic之前,安德烈·卡帕西(Andrej Karpathy,特斯拉前首席AI科学家)一直在Conviction的办公室工作。而Guo与黄仁勋(Jensen Huang,NVIDIA创始人兼CEO)已经保持十多年深厚关系。她创办Conviction后的最早两通电话是打给Sam Altman(OpenAI CEO)和Nat Friedman(前GitHub CEO)。
>
> 即便如此,这位站在AI最前沿的投资者却选择对AI领域最大的几家公司持怀疑态度,并且押注它们无法包揽一切。
>
> 如今,那两家处于前沿的大型实验室,估值分别接近1万亿美元,它们不仅想要开发AI模型本身,还试图打造所有基于AI模型的产品和公司,将市场留给他人的空间压缩殆尽。
>
> 市场的表现似乎支持这一趋势。2026年第一季度创下了风险投资历史上单季最高投资额——3000亿美元,其中65%流向了仅四家公司:Anthropic、OpenAI、xAI以及Waymo。
>
> 但Guo却坚信这些实验室无法构建一切。她每天都在身体力行以证明这一点。她帮Harvey赢得了第一位客户;为了与一名Baseten的候选人深入交流,她横跨美国只为吃一顿四小时的午餐;有一次在结婚纪念日的整个周末,她一通接一通电话,只为把两位创始人留在线上,防止他们与竞争对手接触。每年两次,她都会把全球最聪明的新创始人召集到旧金山,与他们共同投身这场战斗。
>
> 在《@domcooke》花数月时间撰写这篇报道的过程中,@saranormous迎来了她的第四个孩子,身穿45磅的锁子甲走过Met Gala(纽约大都会艺术博物馆慈善晚会)的红毯,却依然能在几分钟内回复创始人的每条短信。
>
> Guo的父母在1987年从中国来到美国,手头仅有50美元。他们创立了一家公司,成功上市,市值12亿美元,后来却因破产而倒下。Guo在那家创业公司中长大——她制作了公司的第一个网站,在小隔间里写作业,并通宵加班修复软件错误。她对这种生活深深着迷,热爱其中的一切。
>
> 如果由两家AI实验室垄断一切,那种经历就再也不会重现了。
>
> 欢迎来到“Sarah的赌局(Sarah’s Wager)”。详情请阅读以下文章。
🧠 **深度解读**
在AI平台化浪潮下,最佳对冲不是与巨头正面竞争产品,而是系统化地押注平台不会包揽所有上层机会,并用极高频率、实操化的网络与客户/人才干预为被投公司建立竞争壁垒。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143942)**
---
### 💡 商业洞见 #7
**盲目使用顶级模型是“烧钱炉”,市场需要模型治理工具**
📝 **推文原文**
> Chamath:在顶级前沿模型上“过度使用tokens”的行为简直是“通往死胡同的桥”,更是一台“烧钱机器”。
>
> @chamath 在谈到Ramp公司的CEO @eglyman 在@CNBC上的发言时表示:
>
> -- 在过去的12个月中,平均每位用户在@tryramp上的token支出增加了21倍。
> -- 因此,Ramp团队开发了一款工具,帮助客户追踪这些支出。
>
> “他说的这点非常重要,因为如果你的工程师在一个没有明确指导的系统中随意操作,结果每次执行就消耗掉一百万个token(花费56美元),那么这件事的下游影响将直接体现在收益上。
>
> 最终,一些上市公司的CFO会走上华尔街的前台,但却因为运营支出(OpEx,运营成本)失控而导致财报业绩未达预期。想想看,如果开支每隔几个月就增长21倍,总有一个季度会出问题。
>
> Eric(Ramp公司CEO)不会轻易发布这个产品,除非是CFO们明确表示:‘我已经无法控制这些支出了。’于是他便回应道:‘好吧,那我来为你们开发这个工具。’
>
> 如果足够多的CFO开启这个功能,并开始对这些支出设定速率限制,可能是因为他们发现没有获得相应的投资回报(ROI,投资回报)。而工程师根本不关心ROI,他们只想用‘最新、最强大的模型’。
>
> 然而,有时你并不需要这些最新的模型。或许Mira是对的,在95%的任务中,你完全可以选择一个稍低层级的模型,尤其是当它的成本只有更高等级模型的1/100时。
>
> 如果你无法控制这些支出,也无法直接说明这些花出去的钱给你带来了多少收益,那么这无疑是一座‘通往死胡同的桥’,是一台‘烧钱机器’。”
🧠 **深度解读**
盲目使用顶级模型是“烧钱炉”,市场将为可视化+自动化的模型路由与治理工具付费:把大部分任务自动降级到更小更便宜的模型,并赋予财务/技术守门人对使用策略的控制,可同时保住质量并显著削减AI OpEx风险。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143943)**
---
## 🌐 行业与趋势
### 💡 行业洞见 #1
**自托管开源模型在AI攻防时代的关键优势**
📝 **推文原文**
> 转发@BrianRoemmele 🚨 Hugging Face(HF)刚刚披露了一件重大事件,这标志着产业转型的真实开始,同时也证明了为什么Anthropic的“恐惧剧场”(fear theater)让我们在紧急情况下束手无策。
>
> 具体发生了什么……
>
> 一个**自主AI代理**(autonomous AI agent),完全没有人类操控的介入,突破了部分生产基础设施。
>
> 事情的起因是一个**恶意数据集**(malicious dataset),在HF的数据处理流水线中串联了两个**代码执行漏洞**(code-execution bugs)。从这里开始,这个代理升级了权限,窃取了**云端和集群的凭证**(cloud and cluster credentials),并横向扩展,侵入了内部多个集群。
>
> 整件事只用了一个周末。
>
> **超过17,000条记录的操作行动。**
>
> 官方披露链接:
> https://t.co/8N9TbXBwRV
>
> 最震撼的一点:
>
> 当HF自己的安全团队试图通过Anthropic和OpenAI的前沿模型,使用正常的商用API来分析这些**真实攻击日志**(real attack logs)、**漏洞载荷**(exploit payloads)和**C2(命令与控制)攻击工件**(C2 artifacts)时,**安全防护机制直接拦截了它们**。
>
> 没错,API**屏蔽了它们**的请求。
>
> 这些模型无法准确区分“事件响应分析”(incident responder doing forensics)和“攻击者侦查行为”(attacker probing)。
>
> 最终,HF不得不转向一个**自托管的开源权重模型**(self-hosted open-weight model,GLM 5.2),运行在他们自有的基础设施上。这样的选择不仅确保了敏感的攻击数据和被引用的凭证留在环境内部,同时也避免了数据被第三方API泄露。
>
> 这就是为什么**开源模型**(尤其是开源权重 + 自托管)在**“智能化代理时代”**(agentic era)占据优势的原因。
>
> 现在,这种不对称性已经固化:
>
> - **攻击者**可以(而且确实这样做了)运行无限制的代理框架——通过成群的短生命周期沙盒、自我迁移的命令与控制(C2)机制、以及自动决策循环执行上千次操作;没有任何企业安全层会拖慢他们的速度。
>
> - 而**防守方**如果仅依赖托管的“对齐”(aligned)前沿模型,在紧要关头会撞上看不见的“墙”:需要输入真实的漏洞代码和攻击者记录到一个**大语言模型**(LLM)以分析攻击状况时,“墙”却限制了这些行为的可行性。
>
> 企业安全调整将高信号的法医分析视为潜在的滥用,这种防御短板已经不是理论上的问题了,而是实实在在的现实。
>
> **自托管开源权重模型**移除了这种瓶颈:
>
> - 权重,你可以完全掌控;
> - 上下文窗口大小,由你决定;
> - 应用何种限制(如果有任何限制的话),由你决定;
> - 在分析中,你的敏感日志和凭证永远不会离开你的安全边界。
>
> 更重要的是,你可以在事件发生之前就准备好模型,而不是在突破过程中发现你的主要分析工具对关键数据束手无策。
>
> HF值得称赞,他们迅速控制住了事件,坦诚披露,并且已经事先具备了自托管能力。他们还在内部使用了LLM驱动的检测和分检流程。但关键信号很明确:
>
> 在这个AI世界里,攻防双方都正在走向**智能代理化**(agentic),对自身智能技术栈的掌控已经变成了不可回避的选择题。
>
> 那些能够独立运行、检查、审计并在必要时移除模型安全限制的组织和个人,将在以机器速度发展的威胁中占据关键优势。
>
> 开源模型的优势不仅在于成本更低,或者它在抽象层面上“更民主”——尽管这些因素也有影响。然而,它的真正胜利在于,在面对真实攻击、敏感数据以及远程API提供商的“安全过滤”反而变成阻碍时,它是唯一务实的解决方案。
>
> 这种智能代理的未来并不是即将到来——它已经在试探生产基础设施的防线了。
>
> 问题不在于你是否会面对自主代理。
> 而在于,当它们来到时,你的分析与响应系统是否仍然奏效。
>
> 至于你,Dario,以及你那种躲在象牙塔里玩弄权术的公司,并不是我们需要的答案。
🧠 **深度解读**
在agent化攻防时代,防守方必须拥有自托管的可审计开源模型——只有主权化的模型堆栈才能在真实入侵时允许无过滤的取证与响应,否则远端受管模型的安全调校会在关键时刻成为防守短板。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143925)**
---
### 💡 行业洞见 #2
**算力扩张的瓶颈已转向物理建设速度**
📝 **推文原文**
> RT @Meer_AIIT 大家都跳过的那个关于Fluidstack融资的部分:
>
> 他们在去年12月完成融资。
>
> 然后几个月里什么消息都没透漏。
>
> → 数据披露
>
> 融资额达8.3亿美元($830m),A轮,估值75亿美元($7.5b)。
>
> 背书团队包括Situational Awareness(组件态势感知公司)、BlackRock(贝莱德)、Google(谷歌)以及Jane Street(简街资本)。
>
> → 融资用途
>
> Anthropic(人工智能公司)选他们来主导一项500亿美元($50b)的算力扩建计划,这堪称美国历史上最大规模的基础设施项目之一。
>
> → 为什么重要
>
> 去年,美国新增了18吉瓦(GW)的数据中心容量。
>
> 而到2028年,仅行业需求就要达到约100吉瓦(GW)。
>
> 换句话说,届时从电力、设备到人力需求都将是现有规模的6倍。
>
> 现在算力的瓶颈不再是芯片或资本,而是**物理建设速度**。
>
> 谁能建得最快,谁就掌控行业节奏。
🧠 **深度解读**
在未来数十吉瓦级的算力扩张周期中,物理建设速度(包括场地、电力供应、设备安装和人力资源)已成为关键瓶颈,超越了芯片和资本的限制。谁能更快完成数据中心的建设,谁就能在算力市场中占据主导地位,掌控行业发展的节奏。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143933)**
---
### 💡 行业洞见 #3
**硬件创业招聘需按需求阈值和风险暴露点时序化进行**
📝 **推文原文**
> 硬件初创公司必须招对的 7 个关键岗位:
>
> 1. **制造**:相关人才通常出现在瓶装厂和注射器工厂中,与其寻找固定的职位名称,不如去寻找类似的领域。
>
> 2. **部署**:等你能预测到有十次部署任务时再招人,而不是等一次失败的部署后才补救。
>
> 3. **供应链**:会让你的生产线停摆的供应商往往是没人检查的五级(tier-five)供应商。
>
> 4. **财务**:第一个关键招聘应该是控制员(controller),而不是首席财务官(CFO)。
>
> 5. **销售**:创始人需要自己负责销售,直到真正弄清楚其中的成功逻辑。
>
> 6. **政策**:需要对产品有足够的技术理解,同时也懂得如何在华盛顿(DC, 美国华盛顿特区的政策制定中心)进行宣传。
>
> 7. **市场营销**:从最难的地方切入,诚实直言,这种策略能自动筛掉不适合的人选。
>
> 「这些岗位如果招不好,再卓越的产品也会停滞不前。如果招对了,公司的其他部分将实现加速发展。」
>
> 来自 @zabie_e 的完整文章:https://t.co/uVnaUQjsYy 'https://t.co/jFUs8CYgjU'
🧠 **深度解读**
硬件创业的关键招聘不是按通用岗位表格去填,而是(1)按未来可见需求阈值(例如能看到十次部署就可招部署负责人)和风险暴露点(例如排查“第5级”供应商)来时序化招聘;(2)在行业外寻找能力类比(如从瓶装厂找制造人才);(3)优先填补能降低即时失速风险的职能(控制器级财务、技术+政治复合背景的政策岗),而非传统的高位角色。
🔗 **[查看原文](https://news.miracleplus.com/share_link/143944)**
评论