AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 9 月 23 日 · 23:50 更新 1619 文章13168 信号1755 主题
试试:

今天发生了什么1 分钟读懂

OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,API 价格直降 50%。Sam Altman 称按单任务计价,新模型更快也更便宜,市场上没有对手。

来源@sama「OpenAI发了新GPT-6模型,Sam Altman说没对手」@OpenAI「OpenAI发布两款GPT-6模型 API降价50%」

Meta 的 AI 代理 Muse 登顶苹果美区免费应用榜后,在亚马逊购物被切断访问。亚马逊称,此前尝试让 Meta 自愿把亚马逊排除在 Muse 体验之外未果,现已正式要求移除。详见今日深读。

来源今日深读《Meta的AI代理“像你一样”逛亚马逊,被网站切断访问》@MSX_CN「Meta的Muse AI Agent登顶苹果美区免费应用榜第一」

Anthropic 上线 Claude Opus 5.5,试用者认为它补上了 AI 输出内容质量差的老毛病,社区已出现大量实测讨论。

来源@AnthropicAI「Anthropic发布Claude Opus 5.5,被认为解决了AI瞎写问题」@Polymarket「Anthropic发布Claude Opus 5.5,被认为解决了AI瞎写问题」

今日值得看
01 让 Opus 5.5 现场编一部 Claude 史的 Skill 一条命令,Opus 5.5 当场生成 Claude 发展全史 02 仅用角色参考出场景的视频提示词 Kling Omni 单参考出全场景,Veo3.1 JSON 做 10 秒 4K 冰淇淋
03 通义千问发布Qwen-Audio-3.1 全线大降价 这次降价幅度最高达95%,新增了多说话人识别、情绪识别等功能,需要音频处理相关服务的开发者和创作者可以获得更低成本的工具。

⚡ 认识 Qwen-Audio-3.1! 自动语音识别(ASR)、文本转语音(TTS)和实时语音能力已全面升级,新增两个模型:用于音频生成的 TTS-Next 和用于音频理解的 ASR-Next。

04 网易有道开源Confucius4-R2T2 实时流式语音大模型、T3PO 流式翻译模型(1.7B) 网易有道开源的实时流式语音大模型和流式翻译模型,刚发布就拿下HF ASR和翻译细分趋势榜的第一名。

🎉见证历史!国产开源大模型直接登顶 Hugging Face 双榜第一! 刚刷到网易有道开源的实时流式语音大模型:Confucius4-R2T2 ,基于 Qwen3-ASR-1.7B 微调 另外顺带把流式翻译模型 T3PO 一起开源了 刚…

今日焦点

Meta的AI代理“像你一样”逛亚马逊,被网站切断访问

上周日晚上,有人用 Meta 的 AI 代理 Muse 在亚马逊购物,屏幕弹出一则提示:“未经授权的 AI 代理继续访问,违反亚马逊的使用条件。”

亚马逊已经切断 Muse 对其购物网站的访问。它说,此前尝试让 Meta 自愿把亚马逊排除在 Muse 的体验之外,没有成功。现在正式要求 Meta 把亚马逊从体验里移除。

Muse 是 Meta 9 月 8 日发布的个人 AI 代理,专门处理多步骤任务,不做一次性问答。它连接电子邮件、日历、支付、餐饮和购物等服务。免费,有付费订阅层级,可用于 iOS、Android、muse.ai 和 WhatsApp。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达129 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

23:50 本轮更新 · 下一轮 08:00
行业动态 · Hacker News▲ 319

分析Claude Opus 5.5各维度表现

如果你日常使用 Claude 大模型,这份来自社区用户的综合分析能帮你更了解这款产品的实际表现。

社区讨论:有人补充了不同推理等级设置的对应页面,并提到max推理等级生成SVG时两次都遇到了128000token令牌配额不足的问题。多数人认可新版Opus任务成本比旧版降低一半,也有人指出相同性能区间里,Opus 5.5价格仍比竞品更高。不少人质疑现有的评测排名和基准测试有效性,有人指出模型厂商会先放出高质量模型吸引用户,之后悄悄降配,还有人吐槽现有排名把表现很差的Opus 5排在Astra前面,结果不可信。

也有人提到,闭源旗舰只比开源模型好一点,但定价要贵一百倍,长期来看市场会更偏向够用的开源模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 67

JetBrains推出JetBrains Air智能开发产品体系

做开发不用挨个配工具,全套智能开发工具已经成套推出,日常开发流程可以直接用这套体系走通

社区讨论:多数付费老用户不满JetBrains IDE近年资源占用过高,WebStorm编辑Markdown文件单按键就会让风扇狂转,IDEA添加新工作树时会持续卡住索引,不得不频繁重启IDE恢复系统资源。不少用户称很少用到JetBrains的AI相关产品,质疑其在AI领域投入烧钱却没做出竞争力,也有人认为JetBrains个人定价合理,希望其能在智能开发领域取得成功。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @higgsfield▲ 94.2万

Higgsfield上线 Claude Opus 5.5,降价提速

需要大模型做产品的开发者,可以在Higgsfield平台用上更便宜更快的Claude Opus 5.5了。

我们推出Higgsfield × Claude Opus 5.5。

Anthropic的最新模型现已在Higgsfield上线,它比Opus 5便宜40%,速度快30%以上。

将Opus 5.5与Higgsfield MCP搭配使用,就能把你最宏大的想法转化为完整的产品。

现在通过Higgsfield MCP的Claude以及Higgsfield超级计算机均可使用。

在 X 看原帖 ↗
94.2万171780443
技巧约 3 分钟
官方 Prompt Generator 一键生成完美提示词
OpenAI Playground 和 Anthropic Console 都内置了免费提示词生成器,输入任务目标即可自动产出结构清晰的提示词。
行业动态 · Hacker News▲ 101

网友质疑OpenAI解错了纳维-斯托克斯问题

OpenAI此前发布了AI求解流体问题的成果,这项争议直接影响AI在工业流体模拟领域的应用方向。

社区讨论:多数人认为OpenAI没有解错问题,它没有解决难度最高的无外力版本,但给出了克莱千禧年问题表述中明确允许的有外力版本。部分网友指出《科学美国人》称大语言模型利用了题目表述漏洞的说法是哗众取宠,也有人认为这是题目本身表述不严谨,利用规则漏洞本就是数学解题的常用方式,还有人认为这件事体现了AI需要人类介入纠错,本质就是AI只会严格按要求执行,不会理解出题人本意。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @github▲ 317.8万

GitHub发布基于Rust的GitHub Copilot智能体运行时(800,000)

单个工程师配合AI智能体团队完成了核心组件迁移,还保住了代码质量。AI辅助开发的效率已经突破传统认知。

仅一名工程师加上智能体团队就将 GitHub Copilot 智能体运行时移植到了 Rust,迁移了 80 万行生产代码,同时还保持了代码质量。🚀

以下是实现过程。

在 X 看原帖 ↗
317.8万2493.8K2.5K
前沿论文 · arXiv▲ 203

AI 对话终于能边听边干活了

AI 对话系统首次做到「边聊边干活」:一个模型负责实时对话,另一个在后台异步执行查资料、调工具等任务,结果再无缝插回对话,在 8 项视频和 8 项音频基准上多项领先,打断响应率 75%。

全双工 · 异步任务 · 实时对话 · AI 交互
arXiv 原文 ↗
前沿论文 · arXiv▲ 110

AI 的品味,成了新的能力瓶颈

大模型做长任务时,中途的每个选择——先测哪个假设、在哪个代码上继续搭——决定了整件事的成败。

大模型做长任务时,中途的每个选择——先测哪个假设、在哪个代码上继续搭——决定了整件事的成败。研究者把这种中途决策能力叫做「品味」,并造了个评测集:把 AI 自己跑任务时的轨迹切成岔路口,让模型在不知道后续结果的情况下选方向。最强模型只答对 59.7%,而且岔路口的线索出现得越晚,所有模型越抓瞎;给更多推理时间也没用。

好消息是品味可以教:让看过结局的老师把判断蒸馏给学生,学生在没见过的任务上决策更好,端到端成功率也涨了。它不是你明天能用上的,但它在提醒:AI 的下一个瓶颈可能不是算力,是判断力。

AI品味 · 长任务决策 · 评测基准 · 蒸馏训练
阅读全文 →
行业动态 · Hacker News▲ 597

网友讨论X公司新模型Grok 4.7

关注X大模型更新的人可以看看社区讨论,有没有新的功能和性能变化值得期待。

社区讨论:多数体验过Grok的用户认为它表现很差,个人体验上不如Claude、ChatGPT等竞品,能力、价格各维度都没优势,还有用户提到它价格昂贵,负面政治关联多,也有人表示没见过有人用这款模型,质疑它的存在价值。只有少部分用户分享了测试数据,还有人询问订阅版和API的价格对比。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 1.0K

Hacker News 网友讨论GPT-6 Sol 和Luna

OpenAI官方从未发布GPT-6系列,但社区已经开始提前讨论,想体验下一代GPT的人可以关注相关进展。

社区讨论:多数人认可OpenAI本次降价幅度,GPT-6 Sol和Luna比前代降价50%,Luna仅一半价格,有人评价这个定价“ positively insane”,也有人表示看不懂为什么没有GPT-6 Terra。有开发者提到对前代5.6 Sol使用体验很好,担心升级后不如旧款顺手,还有开发者担忧行业发展会影响自身职业前景。

在 HN 看讨论 ↗   原文 / 论文 ↗
产品发布 · @AnthropicAI导语出处▲ 60.9万

Anthropic发布Claude Opus 5.5,被认为解决了AI瞎写问题

有人拿到新模型试用后,觉得这次更新终于补上了AI输出内容质量差的老毛病,经常写长文的创作者可以留意新版本表现。

刚刚消息:对 Claude Opus 5.5 的初步反馈显示,Anthropic 可能终于解决了 AI 的“垃圾写作”问题。

Claude Opus 5.5 现已开放使用。

在 X 看原帖 ↗
60.9万6921.2万1.3K
行业动态 · Hacker News▲ 1.1K

社区热议 Claude Opus 5.5 新模型

Hacker News 社区出现大量关于 Claude Opus 5.5 的讨论,是否有新版本即将发布值得关注。

社区讨论: 不少用户指出Anthropic上周才呼吁放缓前沿AI开发,本次就放出Claude Opus 5.5,参数和性能更新都说明没有践行放缓承诺。测试者发现新版模型输出更清晰,把重点内容前置,解决了旧版输出冗长难以理解的问题,高推理等级能输出正确结构的图形,但最高等级会触发输出token上限无法完成生成。还有用户提到新版定价相比旧版有所下调,更多人期待同更新的Haiku 5.5能带来合格的快模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @OpenAI导语出处▲ 379.1万

OpenAI发布两款GPT-6模型 API降价50%

大规模使用大模型的开发者可以直接获得更低成本,规模化部署AI项目的投入门槛降了一半。

请欢迎 GPT-6 Sol 和 GPT-6 Luna 加入 GPT-6 宇宙。

GPT-6 Sol 和 Luna 基于 GPT-6 Astra 的技术进展构建,将 GPT-6 Astra 的大部分优势整合进更快、成本更低的模型,以支持大规模工作场景。

我们还优化了缓存和推理的效率,并将节省的成本直接传递给你:相比 GPT-5.6 的促销定价,Sol 和 Luna 的 API 价格降低了 50%。

在 X 看原帖 ↗
379.1万3.5K3.7万4.5K
行业动态 · OpenAI 开发者社区▲ 39

OpenAI 征集插件开发者分析需求

正在做OpenAI插件开发的开发者可以参与讨论,反馈你需要的分析功能,帮助OpenAI优化插件开发体验。

嘿各位!我是 OpenAI 负责插件开发者体验的工程师之一。

我们正在探索如何更好地展示插件分析数据,我希望听听你们的想法。

目前你们觉得缺了什么:使用数据、工具错误、延迟、用户反馈,还是别的?

告诉我们你希望看到什么。具体的例子会尤其有用。

在社区看讨论 ↗
动态 · @bindureddy▲ 1.5万

测试显示前沿大模型推出无意义 开源或年底追平差距

经过一些测试,前沿模型的这次发布完全说不通——GPT 6 Sol 更便宜,但糟糕得多。

Opus 5.5 听起来更正常,但算不上智能上的飞跃。

如果闭源实验室停滞不前,开源就只会更快追上来——到今年年底,两者差距将缩小到零。

在 X 看原帖 ↗
1.5万719715
动态 · @bojie_li▲ 1.2万

《深入理解AI Agent》Web阅读版更新为Astro样式

《深入理解 AI Agent》的 Web 阅读版更新成了 Astro 样式,比之前漂亮多了,对移动端也更友好了!感谢社区 whanyu1212 的贡献。

在 X 看原帖 ↗
1.2万26187235
动态 · @xhdweb3▲ 1.0万

AI Agent自动支付需关注可审计可回溯

让系统自动付款不难,难的是出问题时知道谁授权的、触发了哪条规则、钱最后去了哪儿。对 AI Agent 尤其如此。据项目方披露,@Polyflow_PayFi 关注预算、权限和完整审计,让机器支付不只是自动执行,也能被回溯和复核。

没有审计的自动化,只是把风险跑得更快。这事看着像技术升级,实际影响的是每天重复发生的操作。机器之间未��可能按次买数据和算力,交易频率比人工采购高得多。

传统报销太慢,裸钱包又缺部门预算、用途标签和审批轨迹,所以中间需要一个能执行规则的账户层。真正的门槛不是演示一次自动支付,而是高频跑起来之后,还能对账、追踪、撤销权限、处理异常。机器速度可以快,企业治理不能因此被绕过。

计划中的功能也不等于已经全面可用。最后还得回到真实使用:资金路径短没短,信息丢没丢,出异常能不能快速找到责任和解决方式。#审计 #AIAgent

在 X 看原帖 ↗
1.0万1153
动态 · @QwenDevs▲ 1.4万

通义千问音频技术栈覆盖全流程,多组件升级新模型加入

通义千问音频技术栈现已覆盖完整工作流程,从语音识别、实时对话到语音合成和音频创作。

ASR、TTS 和 Realtime 全部完成升级,ASR-Next 和 TTS-Next 现已加入产品系列。

一共五个模型,足以支撑各类开发。

在 X 看原帖 ↗
1.4万1422684
深度观点 · @gregisenberg▲ 1.3万

近三周AI进展飞快,现在是创业好时机?

近三周已有多款AI模型和Agent API推出,个人代理和语音AI进展飞快。市场机会打开速度快于填补速度,现在是史上套利空间最大的时候。

我觉得非常有意思,居然有这么多人认为现在不是创业的好时机。

Grok 4.7、GPT-6 Sol/Luna、Opus 5.5、Astra、Gemini 3.8 Live、Muse、Instinct、Jev、智能体API等等,这些都是过去三周里出现的成果,个人智能体/语音AI领域进展神速。

因为套利的本质就是同一件商品在两个市场有不同定价,而你要做的就是切入这个差价。通常情况下你得主动去寻找这些价差缺口,因为它们非常稀有,而且一旦被人发现就会立刻被抹平。

现在不同的地方在于,这些新缺口的 opening 速度远远超过了人们去填补它们的速度。我认为现在绝对是历史上套利的最佳时机。

在 X 看原帖 ↗
1.3万1118887
行业动态 · @agent_wrapper▲ 3.8K

开源克劳德代理编排工具作者加入创业项目

你做个人开源项目感到孤独的时候,能找到同路人一起推进项目。这个工具已有上万开发者使用,管理十万以上代理。

我即将加入位于旧金山的 Solo Founders Programme (@solofounders)!

八个月前,我为自己开发了一个编排 Claude Code 智能体的工具。当时同时运行 30 个智能体看起来还很离谱,现在它很快就变成了常态。

@ao_build 从我为自己打造的工具,变成了已经有超过一万名开发者使用、管理超过十万个智能体的项目。

虽然我是个独立创始人,但这段旅程我从未觉得孤单。从第一天开始,AO 就是一个由社区驱动的开源项目。但创业过程中有些事情,只有其他创始人才能理解,如果没有懂你处境的人,你很难坚持下去。

现在我将和一众优秀的创始人一起,在 Solo Founders 基地生活和开发。一起做独立创始人,出发吧!

在 X 看原帖 ↗
3.8K1514820
深度观点 · @NFT_Chen▲ 2.6万

Claude Opus 5.5 给中国硬件设降智规则

针对中国AI硬件的定向限制已经写入大模型产品规则,使用非美系AI加速器调用模型会被主动降智。

🤔Dario 把对中国蒸馏防线写进了 Opus 5.5 文档,不是演讲,是写进产品规则! 🔸首个会因“前沿大模型研发”降智的 Opus 🔸官方例句就一件事:给某些 ML 加速器写 kernel 🔸一触发,5.5 立刻掉到更弱的 Opus 5 🔸再加“保留思维”:锁死上下文,防你改前文抽出推理 🔸话术是安全,效果是谁碰非美系加速器谁变笨 🔸护栏给模型,降智给用户,指向给中国硬件 #Opus55 #Claude #Anthropic #DarioAmodei #保留思维 #芯片战争 #中美AI

在 X 看原帖 ↗
2.6万83821
行业动态 · @StockMKTNewz▲ 2.6万

亚马逊、AWS、Anthropic发布Seller Assistant 智能AI助手(24/7)

对做亚马逊第三方生意的卖家来说,这款依托Claude的AI助手能7×24小时自动完成库存、定价、广告等运营工作,帮卖家省出手动处理这些事务的时间精力

阅读全文 →
2.6万912719
新品发布 · @OpenRouter▲ 2.5K

OpenRouter 发布 Space Bunny Alpha 大模型

这款模型支持超长上下文窗口,可处理文本、图像和视频输入,推理速度快,支持调节推理能力,感兴趣可以去体验反馈。

来OpenRouter认识Space Bunny Alpha ⚡

这是一个快速模型,拥有快速推理、可调节推理能力,以及100万token上下文窗口。

它支持文本、图像和视频输入。

快来试用并分享你的反馈:

在 X 看原帖 ↗
2.5K5645
深度观点 · @mdshefat217▲ 621

agenticscredit在Base上打造AI智能体信用体系

这个方向打破了现有AI智能体金融模式,未来AI智能体可凭借自身交易业绩获得资本,值得观察这一新叙事的发展。

智能体AI需要的不只是更好的模型,它还需要资本。这就是为什么建立在@base上的@agenticscredit让我感兴趣。

他们的想法很简单:衡量智能体的实际交易表现,把这份交易记录转化为智能体信用评分,并以此来确定智能体是否能获得受限资本。

而Base已经有现成的金融轨道,可供智能体支付、赚取收益、交易以及与链上服务交互。因此整个大图景开始变成:

智能体 → 交易记录 → 信誉 → 信用 → 资本

这对智能体金融来说是一个完全不同的方向。长远来看,这个想法不是让AI智能体只用别人的钱执行交易,而是让智能体可以建立可验证的金融历史,并最终根据表现获得资本准入。

表示,其合格路径目前从ACS 580分开始,资金通过候补名单分配,并设有严格的风险限额。

看到团队已经接触到Base建设者和投资者让这个项目更有意思了。拥有自己金融信誉的AI智能体能成为比AI交易大得多的原语。这是我正在密切关注的Base + AI叙事之一。🔵

在 X 看原帖 ↗
62111852
深度观点 · @rasbt▲ 2.8K

开源智能体工具最大吸引力在于可检查

在意AI在本地设备上的行为是否可控,可检查的开源工具能提供闭源产品给不了的安全感。

开源智能体工具包的主要吸引力不在于它们免费,而在于我们可以检查它们在我们的计算机上正在做什么。

在 X 看原帖 ↗
2.8K5615
新品发布 · @Alibaba_Qwen▲ 3.7万

通义千问 Qwen-Image-2.1 登顶开源图像模型榜首

这是目前图像编辑和文生图领域排名第一的开源模型,追求图像生成效果可以试试这个新选择。

感谢 @arena 的认可!🏆

Qwen-Image-2.1 目前在图像编辑和文生图 Arena 排行榜中都是排名第一的开源模型。

现在就来体验,向我们展示你创作的作品吧!🎨

在 X 看原帖 ↗
3.7万2241943
技巧约 2 分钟
通义千问免费额度获取与使用指南
截至2026年7月,新用户可免费获得阿里云Model Studio额度,另有Qwen3.7-Max限量免费tokens。
行业动态 · @LearnWithBishal▲ 3.4万

小米开源 MiMo V2.6 Pro 评分仅次 GPT-5.6 Sol

在AI榜单上,这个开源模型得分追平了Grok 4.7,比 Qwen3.8-Max等模型排名更高,单任务成本仅0.13美元,远低于同得分的Grok 4.7。

🚨 小米新开源模型悄然攀升至AI排行榜前列。

MiMo V2.6 Pro在人工分析智能指数上得分46,成为目前该榜单上排名最高的开源模型,仅落后GPT-5.6 Sol一分。它的排名还领先于以下模型:
→ Qwen3.8-Max
→ Kimi K3
→ GLM-5.3

而且它不只是在智力测试上竞争力强。在成本方面,它每个智能指数任务的成本大约为0.13美元。

参考信息:同一天发布的Grok 4.7得分也是46,但AA给出它的成本是,高推理任务每个2.73美元,极高推理任务每个3.74美元。

MiMo V2.6 Pro是全多模态模型,设计用于:
• 复杂研究
• 长程推理
• 科学工作流
• 网络安全任务

小米表示,性能提升来自后训练自改进系统,而非修改预训练基础。

基准测试结果很强,但真正的考验是开发者实际能用它获得什么。

#AI #OpenSourceAI #LLM #Xiaomi #MiMo

在 X 看原帖 ↗
3.4万18175114
前沿研究 · @_LuoFuli▲ 1.8万

MiMo-V3新核心HySparse2性能大提升

智能体推理场景同时面临预填充成本、KV缓存大小和检索精度三大问题,新架构一次性解决了这三个痛点,长上下文推理效率提升明显。

阅读全文 →
1.8万66727153
新品发布 · @Alibaba_Qwen▲ 8.2万

通义千问发布Qwen Intelligence手机智能体

普通人也能拥有个人移动端智能助手,可以帮你规划任务、处理操作和生成内容,性能在多个公开测试集上表现出色。

阅读全文 →
8.2万1461.6K590
工具产品 · @aiaicreate▲ 1.6万

@aiaicreate发布修复Qwen Image 2.1生成bug的LoRA

搭配推荐工作流使用,可解决Qwen Image 2.1的大部分生成问题,还有与原模型效果的对比图,对使用通义千问文生图的用户有用。

Qwen Image 2.1 图像生成问题的修复 LoRA 现已发布。

配合推荐设置的工作流使用,可以解决大部分生成问题。

还提供了未应用(原生)状态的对比图。

#QwenImage21 #LoRA 链接在评论区⬇️

在 X 看原帖 ↗
1.6万23263404
实战经验 · @vista8▲ 4.1万

大厂用AI开发,工作量一月缩成一周

效率提升后压缩了项目周期,但从业者的劳动强度并没有降低,反而更累了,可以看看AI对一线工作节奏的真实影响。

中午见了还在��厂工作的产品经理,他说现在越干越累。有些新项目都不写PRD了,和研发一起vibe coding,一天提交仓库代码7~8次。第二天和研发碰头讨论迭代。

研发一开始还自己review代码,后来实在看不���来,都交给模型测。效率确实有巨大提升,原来1~2个月的工作量,现在都是一周做完,累!

在 X 看原帖 ↗
4.1万815131
实战经验 · @bojie_li▲ 5.7K

LiNan1984 将《深入理解 AI Agent》提炼为 22 个技能

想要快速掌握 AI Agent 开发,可以直接从这22个技能切入,不用通读原书就能快速上手学习。

感谢读者 LiNan1984 把《深入理解 AI Agent》蒸馏成了 22 个 skills,方便 agent 在开发 agent 的时候使用,也方便人类读者快速阅读。

在 X 看原帖 ↗
5.7K178698
深度观点 · @MoureDev▲ 5.1K

开发者聊软件企业用AI的两种极端

身处软件行业,可对照自家企业对AI的使用方式,判断是否缺少有判断、有管控的AI使用流程。

在软件公司中,我看到他们在人工智能应用上存在两个极端:
- 一些公司几乎不用人工智能(或者仅限于从 ChatGPT 复制粘贴内容)。

- 另一些公司购买了 Claude Code,并且要求团队不惜一切代价不停产出,甚至不做检查。

两种情况都缺少同一个东西:带着判断和控制去使用人工智能的流程。

在 X 看原帖 ↗
5.1K1211712
开发 · @Manixh02▲ 3.1K

花1美元做出了通常要500美元的作品集网站

开发者Manixh02使用MiniMax Code的M3模型,仅花费1美元搭建作品集

一位名为Manixh02的开发者在𝕏平台分享,这类个人作品集通常的制作成本是500美元。他通过MiniMax Code的M3模型完成了自己作品集的搭建,总成本仅为1美元。

这次搭建用到的代理框架(harness)基于开源项目OpenCode和Pi开发。

本次使用的MiniMax Code命令行界面(Code CLI)同样是开源项目。

Manixh02评价,花费1美元就能完成这样的作品,效果还不错。

在 X 看原帖 ↗
3.1K8316
大模型 · @0x0funky▲ 3.6K

Opus 5.5单轮生成6分钟视频 仅消耗不到1%周额度

开发者@0x0funky在𝕏发文称,Opus 5.5的JS视觉与SVG生成能力远超预期

开发者@0x0funky在社交平台𝕏发文评价大模型Opus 5.5,称它的能力「有点逆天」。

Opus 5.5在JavaScript(JS)视觉处理和SVG生成方面能力极强,开发者猜测它训练数据中加入了特殊内容。

该开发者原本为教育机构制作教材,目前这套工作流和相关技能已经被Opus 5.5取代。

他认为个人开发者不必和大厂在模型或应用层面竞争,充分利用大厂模型的进步才是合理方向。

本次生成6分钟视频仅用不到1%的每周额度,是单轮(ONE-SHOT)一次生成。

在 X 看原帖 ↗
3.6K13614
视频生成 · @gaoqian2580▲ 1.2K

不用折腾ComfyUI节点,Pexo聊天就能做AI视频

博主@gaoqian2580在𝕏分享了这款聊天生成视频的AI工具Pexo

别再死磕复杂的 ComfyUI 节点和剪辑时间线了! 刚刚用 Pexo 测了条 3D 科幻预告,彻底被震撼到了! 先介绍下,Pexo 是一款能通过聊天做视频的 AI 创作工具。想做什么、画面要什么风格、哪里需要改,都可以直接跟它说。 我就像跟好莱坞导演发微信一样,把想要的画面和风格告诉它。它帮我拆分镜、生成机甲画面,再配上音效和 3D 标题,最后拿到一条能直接发布的完整成片!没写复杂的提示词,也没自己折腾剪辑时间线。 这次用下来,确实是我目前用过上手最简单的 AI 视频产品。不用先研究该选哪个模型,也不用自己搭工作流,把想法和要求告诉它,看完哪里不满意,就接着聊、接着改。 想改画面,还可以用 Mark to Fix。比如想调整片尾标题的位置,就直接在画面上圈住标题,在右侧弹出的批注框里写:“标题往上挪一点,其他画面保持不变。”提交修改后,再看调整后的效果。像给文档留评论一样,不用自己去研究一堆剪辑参数。 想给自己的作品做条预告,又不想先研究一堆剪辑工具,可以试试直接跟你的 AI 视频导演聊聊。 视频用 @Pexoai_offical 做的。

🔗 体验入口:

在 X 看原帖 ↗
1.2K11457
文生图 · @xiangxiang103▲ 4.4万

通义千问Qwen-Image解锁:提示词改写器去限制方案和新模型搭配

来自𝕏用户@xiangxiang103分享,拆解Qwen-Image原有限制并提供破解方案

阅读全文 →
4.4万44501900
大语言模型 · @techNmak▲ 6.7K

博主整理了Transformer块知识手册,从原理讲清核心组件

techNmak分享了一本从原理解读Transformer块的知识手册,涵盖多个组件特性

阅读全文 →
6.7K30153164
AI开发 · @Parul_Gautam7▲ 3.0万

用户测试Qoder AI IDE从零搭建AI项目管理仪表盘成功

来自𝕏用户Parul_Gautam7的实测分享,附推广优惠码

我刚刚给@qoder_ai_ide布置了一项真实任务:从零开始构建一个可用的AI项目管理仪表盘。我描述了最终效果,选择了Qwen 3.8 Flash,设置好权限,然后看着它规划、构建、测试和修复这个项目。

最终的仪表盘拥有可用的任务创建、状态更新、搜索/筛选、动态进度、分析功能和深色模式。在9月30日之前,运行Qwen 3.8 Flash不消耗任何Credits,所以现在可以免费使用。

来试试Qoder:先输入我的邀请码37JUWX,然后下载Qoder并登录。你将获得600 Credits:14天Pro试用的300 + 我的邀请码额外提供的300。

在 X 看原帖 ↗
3.0万5617442
开发 · @midudev▲ 1.5万

开发者做AI自更新网站实验,每4小时选用户idea实现

来自𝕏用户@midudev,用到Claude Code部署在服务器

我做了一个超级疯狂的实验:一个由人工智能自主开发的网站。我在服务器上安装了 Claude Code。

用户提交想法,AI每4小时选出最优方案并实现它。此外代码已经上传:

这个网站是开放给大家参观的。出于安全考虑,目前做了访问限制,无法访问数据库或创建API,但我打算完全解锁看看会发生什么。

在 X 看原帖 ↗
1.5万19288106
观点 · @myanTokenGeek▲ 7.5K

AI编程崛起后,非技术人开始跟不上AI进展了

吴恩达建议所有人学编程避免AI时代掉队,有博主提到,2025年AI编程成为发展焦点后,原本跟进AI进展的非技术人开始掉队。

阅读全文 →
7.5K24235
商业 · @MSX_CN导语出处▲ 839

Meta的Muse AI Agent登顶苹果美区免费应用榜第一

Agent能力越强,调用工具和代码越多,CPU需求就越大,这条算力链正在变长,谁能先吃到这波增量还不好说。

🤖 $META 的 Agent「Muse」冲上苹果美区 iPhone 免费应用榜第一, 这也让市场重新看到了AI Agent背后的CPU需求。📊 Agent 越能干,浏览器、代码和工具调用越多,CPU 的活���跟着变多。从 x86、Arm 到云厂商自研 CPU,这条算力链正在变长。

🤔 $AMD 、 $INTC 、 $ARM ,谁会先吃到这波 Agent 增量?#AI

在 X 看原帖 ↗
839831
产品发布 · @Context7AI▲ 5.7K

Context7AI推出面向编码代理的文档搜索API

只需要一次GET请求就能拿到官方文档片段,文档还经过提示注入检测,比普通网页搜索更适合编码代理使用。

现在推出 Context7 Search:面向编码智能体的接地 API。只需一个 GET 请求,就能获取文档片段。

和网页搜索不同:
• 官方文档,由库维护者管理
• 已扫描提示注入与恶意软件
• 快速且 token 高效

在 X 看原帖 ↗
5.7K159146
模型发布 · @FrontiersMind▲ 5.6K

FrontiersMind发布Lumma-fev-0.6B 决策模型(0.6B)

输入文档和一组指定类型问题后,模型会返回每个问题对应的概率结果,用于决策场景。

我们很高兴推出 Lumma-fev-0.6B,这是一个基于我们从零搭建的 Lumma-0.6B-Base 微调得到的类 Jev 决策模型。

你向它输入一份文档和一组分类问题,它就能在一次前向传播中为每个答案返回概率。它不生成文本,因此无需解析,也不会产生幻觉。

它专为路由、分诊、内容审核以及任何需要决策而非生成段落的工作流打造。

这仅仅只是开始,我们计划在未来几天内开源 4B 和 9B 版本,并附上详细的基准测试报告。

在 X 看原帖 ↗
5.6K21110128
前沿研究 · @weikaih04▲ 31.3万

weikaih04发布Grounding Action Model 机器人操作策略、Arxiv 研究论文、开源代码

该研究发现,提升机器人操作能力更需要扩展空间和三维理解,而非扩展动作规模,性能优于多数更大的已有模型。

GPT6-Astra告诉我们,扩展空间理解和三维理解而非扩展动作,能带来更好的机器人操控表现。

我们采用了极简思路:如果直接从三维理解模型训练策略,而不是从视觉语言模型(VLM)训练,会怎么样?

出人意料的是,它的表现超过了大多数更大规模的视觉语言动作模型(VLA)和可抓握动作模型(WAM)。

现在推出基础动作模型(Grounding Action Model):这是一个全新的、达到当前最优水平(SOTA)的策略,由小型三维框检测模型WildDet3D训练得到。

Arxiv:
Code:

在 X 看原帖 ↗
31.3万89439
行业动态 · @riyazmd774▲ 6.3万

MiMo发布V2.6 Pro,相同性能成本仅1/20

相同AI测评分数下,MiMo V2.6 Pro单任务成本仅为同分数Grok 4.7的约3.5%到4.8%,且比前代性能翻倍价格不变。

阅读全文 →
6.3万226810
新品发布 · @NFT_Chen▲ 9.5K

开源LLM2Jev 把本地大模型转结构化决策引擎

所有数据都不会离开本地设备,能基于已有本地大模型实现图文输入做决策,新手也能跟着步骤从零上手

阅读全文 →
9.5K198489
深度观点 · @signulll▲ 2.6万

signulll评价OpenAI AI服务业界最优

若你选AI服务时纠结开源闭源,这个行业从业者的观点可帮你参考决策。

功归功,OpenAI 在降低高质量智能模型成本这件事上,做的可能比任何实验室都多。

开源当然重要,但如果你看全套服务的各个维度:模型质量、可用性、延迟、可靠性、不同智能等级的选择、易用性、成本,没有哪家服务商的整体方案比 OpenAI 更好。

我们一直在大量使用这些模型,体验很不错。

在 X 看原帖 ↗
2.6万1967032
新品发布 · @masahirochaen▲ 1.8万

@masahirochaen发布多模态AI Jev-Omni(4)

单张H100就能跑出100ms以内的推理速度,想测试多模态AI的本地部署可以关注这个项目

【新发布】多模态AI「Jev-Omni」单模型支持4种模态,视频版的Jev非常热门。我这就去试用一下。

其他开源项目大多都缺这缺那,但这个把所有模态都整合了,推理耗时不到100毫秒。

・单模型处理文本/图像/音频/视频
・在Typed-benchmarks上达到与Jev同等水平(开发者称)
・用8块H200训练3万样本,重视数据混合
・单块H100推理耗时不到100毫秒

↓详情

在 X 看原帖 ↗
1.8万19204194
行业动态 · @sleepy0x13▲ 3.1万

国内大模型集体返工预训练,万亿参数输1%小模型

原来堆参数堆算力就行,现在发现训练数据质量差会让大模型效果大打折扣,关注后续哪家厂商敢公开自己的数据工程质量。

阅读全文 →
3.1万78862
深度观点 · @cyrilXBT▲ 5.5K

Jev+Claude Code能让AI代理快200倍省400倍

想要降低AI代理运行成本、提升速度的人,可以参考这套组合思路,作者公开了完整的框架图解。

只需一个提示词,Jev + Claude Code 组合就能让AI代理速度提升200倍,成本降低400倍。

秘诀就是:让代理横向拓展而非纵向延长。

我已经用三张图完整拆解了这套系统。

把它保存下来吧,以后你会用得到。

关注 @cyrilxbt 获取更多AI资讯。

在 X 看原帖 ↗
5.5K167531
新品发布 · @BuildwithOmkarr▲ 2.9万

BuildwithOmkarr开源OpenMausBot 可自托管多AI智能体

可在自己设备部署,能调用浏览器、终端、桌面,支持对接你已有的各类AI模型和日常应用,可自己掌控部署和数据

🎉 推出 OpenMausBot。

这是一个开源、可自托管的AI智能体团队,而不是另一个被框定死的助手。

• 可使用电脑:浏览器、终端、文件和真实桌面
• 可连接你日常使用的各类应用
• 目标、日常任务和进度持续推进
• 同时适配移动端和网页端

支持 @claudeai 、@ChatGPT 、@grok 、@cursor_ai 、@NousResearch 、@Alibaba_Qwen 、@Kimi_Moonshot,以及你拥有的任何框架或模型。

你的机器人。你的机器。你的密钥。

在 X 看原帖 ↗
2.9万37324397
行业动态 · @CoinMarketCap▲ 2.4万

OpenAI提出AI安全全球协调标准

前沿模型能力越来越强,行业安全协调已经提上日程,普通用户也能受益于更安全的AI发展环境。

最新消息:⚡️ OpenAI 就 AI 对齐与递归式自我改进提出了全球标准,随着前沿模型能力不断提升,敦促该行业在安全方面开展协作。

在 X 看原帖 ↗
2.4万246
实战经验 · @MaxForAI▲ 3.2万

Minecraft之父Notch承认Vibe Coding真香

曾坚决反对AI编程的顶级开发者,几个月内态度彻底反转,说明AI辅助编程的实际体验比预想更好。

Minecraft 之父 Notch,终于开始承认 Vibe Coding 真香了😂 刚刚他在 X 上发了一条:

我得承认,我正在享受 Vibe Coding 的乐趣。 我可能有那么一点点、微乎其微地错了。

要知道几个月前他还是 AI 编程最坚定的反对者之一。 今年年初,Notch 还公开说,用 AI 写代码是个非常糟糕的主意,甚至把鼓吹 AI 编程的人骂得很难听。 7 月又发了一次:“Reject AI.”

结果一周之后,因为实在招不到满意的程序员,他开始松口,准备让 AI 帮自己做地图编辑器、节点图之类的内部工具。 到了 8 月,他已经开始说自己可能得“认错”了。 现在直接认错了🤣

这条下面 Elon Musk 直接回了个 😂。 一个亲手写出 Minecraft 的程序员,最后也开始 Vibe Coding 了。

在 X 看原帖 ↗
3.2万812040
实战经验 · @GitHub_Daily▲ 7.1K

斯坦福发布CS146S「现代软件开发者」课程作业(2025)

没机会在斯坦福修课的开发者,可以照着公开的8周作业自学,锻炼和AI协同开发的完整能力。

斯坦福 2025 年秋季,开了一门 CS146S「现代软件开发者」,讲怎么跟编码 Agent 一起写软件,8 周作业全部公开在 GitHub 上。

每周一个主题,从提示词技巧开始,接着给现成的小应用加功能,自己写一个 MCP 服务把外部接口接给模型。

再往后用 Claude Code 搭至少两个自动化流程、用 Semgrep 扫出并修掉至少 3 个安全漏洞,最后一周把同一个应用用 3 套技术栈各做一遍。

GitHub:
第七周的作业我挺喜欢,每个任务只给 AI 一次提示就让它写完,自己逐行审一遍,再拿自己的审查意见跟 AI 审查的结果对比。

不少作业带现成的起步项目和测试,第一周还用 Ollama 在本地跑模型。没机会上这类课的,照着 8 周作业自己过一遍,能补上不少。

在 X 看原帖 ↗
7.1K1999143
AI生成视频 · @MohdAdnanA86218▲ 2.8K

用户用Gemini Flash生成了一段10秒AI视频,内容很惊艳

用户在𝕏分享了自己使用Gemini Flash在GeminiApp生成的10秒AI视频,本文是生成提示词与效果描述

用户在𝕏分享了一段使用Gemini Flash在GeminiApp上生成的AI视频,这是一段10秒的超逼真电影质感视频。

视频内容为:一个俊朗的年轻人独自坐在光线昏暗的复古图书馆里,阅读一本古老的奇幻书籍。他慢慢翻过一页,金色发光微粒从书页中缓缓升起。

微小的奇幻角色、城堡、魔法古树、龙和漂浮的魔法符号逐渐从书页中显现,就像一个微型3D世界被激活。这些形象不断变大,自然舒展到年轻人周围,整个图书馆也随之变成一个令人惊叹的奇幻王国。

在视频最后几秒,年轻人惊讶地抬起头,发现自己已经完全被书中走出的世界包围。视频设置了流畅的电影推镜、魔法体积光、逼真粒子效果、细节丰富的环境、戏剧性景深、自然转场,参数为照片写实、高细节、4K分辨率、电影调色,无文字、无水印。

在 X 看原帖 ↗
2.8K34324
生成式AI · @Jenny_MommaLion▲ 9.0K

用户只用角色参考图,生成了完整的AI动画场景

用户@Jenny_MommaLion 在X平台分享,仅提供角色参考就用Kling_ai Omni生成了完整动画

用户@Jenny_MommaLion 分享了使用Kling_ai Omni生成的AI动画,并附上了自己使用的提示词。该用户只提供了一张角色参考图,场景部分由Kling在生成动画的过程中自动创建。

生成的动画内容是:一名压力很大的男子在灯光昏暗的酒店房间里焦虑踱步,空气中弥漫着紧张感。男子望向窗外,城市天际线在暮色阴霾中向远方延伸,呼应了他内心的孤独感。

房间内部陈设稀疏,小桌子上散落着凌乱的文件,地板上放着一个半开的行李箱,象征着主人混乱的精神状态。角落投下柔和的阴影,让整个空间显得更加逼仄,就像快要让人窒息。

窗外的光线投下淡淡的光晕,和室内的黑暗形成对比,营造出孤独忧郁的氛围。男子的思绪像窗外的云一样,越来越沉重,整个房间都充满了被生活和工作压垮的清晰感觉。这个场景动态融入了男子的内心挣扎,压力仿佛实体化包裹了整个空间。

该用户称,本次生成使用的参考图加角色表,是在Higgs平台的Soul 2.0上制作的,相关链接:

在 X 看原帖 ↗
9.0K813560
大语言模型 · @Yuchenj_UW

用户实测Claude Opus 5.5,并未感知到性能飞跃

推特用户@Yuchenj_UW实测Anthropic Claude Opus 5.5,对比Astra模型得出这一结论

今天试用了Opus 5.5,说实话并没有觉得惊艳。

我让它研究一个我最近刚了解到的复杂问题,结果它回答错了,Astra答对了。

在编码方面,仍然是Astra体验更好。

这次测试坚定了我之前的观点:前沿大语言模型的编码能力已经进入瓶颈期。现在行业竞争越来越围绕单位算力成本的智能水平展开。

在 X 看原帖 ↗
教育 · @akokoi1

一线老师用Claude Opus 5.5生成教学视频仅花26分钟

来自X用户@akokoi1分享,用简单提示词就能生成5分钟的地理知识点教学视频

能用上Claude的一线教育从业者可以用AI生成教学视频。只用一段简单提示词,Claude Opus 5.5就能生成解释地理知识点“大气环流”的教学视频,耗时26分钟,生成视频时长接近5分钟,消耗的token非常少。

具体操作步骤第一步:选择一家文本转语音(TTS)厂商,豆包、智谱、海螺、千问都可以,把生成好的文本转语音文档粘贴到一个新建的md文档,例如命名为TTS.md。

然后创建。env文件,填入API密钥和其他需要调整的配置。为了安全起见,需要在。claude/settings.json文件中添加一条"deny": ["Read(./.env)"],这样Claude就无法读取你的密钥。

具体操作步骤第二步:输入提示词:“做一个动画,讲解高中地理知识点“大气环流”。风格轻松有趣,动画格式为线稿,添加合适的音乐,请务必做到引人入胜,字幕用中英双语,解说用TTS,如果 TTS 接口有关闭水印的参数就关掉,文档在TTS.md,API KEY 和音色分别是 .env 里的 APIKEY 和 VOICE,最终视频要能直接导出。”

提示词可以根据自身需求微调。

在 X 看原帖 ↗
行业动态 · Hacker News▲ 34

ZaharaHussain发布ai·rete·rag决策AI工具

原本需要可审计的决策,常把大模型放在核心再补规则,现在这个工具让规则先做决策,AI只负责生成解释

你好 HN,我开发了 ai·rete·rag,因为我一直看到团队让 LLM 负责需要审计的决策(贷款、欺诈、临床分诊),之后才匆忙加上“护栏”。

它改为把二者串联运行:

1. 纯 Python Rete 引擎根据你的事实评估 YAML 规则。结论只来自这里。相同事实总会得到相同结论,并基于优先级解决规则冲突。

2. RAG 从你自己的政策文档中检索段落,再由 LLM 生成直白易懂的……

在 HN 看讨论 ↗   原文 / 论文 ↗
视频创作 · @seiiiiiiiiiiru

用Claude Opus 5.5生成视频仅花费约150日元,还可自定义修改

日本创作者分享用AI生成发布视频的经验,成本仅约150日元

亲手打关键帧这种事已经太蠢了。

这是由 Claude Opus 5.5 操作 Higgsfield 和 AfterEffects,AI 制作的发布视频。

这个视频只用到了月租 19 美元 Pro 套餐额度的 5%,所以只花了大约 150 日元就做出来了。

虽然也生成了一些素材,但基本是在 AE 里做的,所以从这里开始你还可以修改字体、调整颜色、删掉不需要的部分,想怎么修改都行。

接下来就是教给 AI 技巧和审美。广告行业肯定会出现供给过剩,所以只做那种“随处可见的内容”,作为创作者可能就无法生存下去了哦。

在 X 看原帖 ↗
创作 · @mooncat_is▲ 118

用户称自己花了三次观察才发现所有细节都来自AI

用户@mooncat_is在𝕏发文称,发现Claude已经能掌握业余创作了

我觉得我在这里慢慢熬了一阵。我前后琢磨了三次,才真正反应过来,所有那些微小的细节、主题和创意其实都来自AI,还被精心编织成了一个连贯的整体。

我去,Claude居然已经懂业余创作了。

在 X 看原帖 ↗
1184
行业动态 · Hacker News▲ 39

grigy发布面向家庭使用的AI代理CC

普通家庭终于有了专为自身需求打造的AI工具,不用再适配面向办公或开发者设计的通用AI产品

社区讨论:多数开发者都认为谷歌这款产品命名糟糕,CC是多个常见通用缩写,会造成混淆,还和谷歌最大竞品的产品缩写撞名,不提前定义缩写显得非常不专业。不少用户不信任谷歌的新产品持续性,吐槽谷歌关停过很多用户喜爱的服务,还有人质疑这款产品不值得用户把家庭隐私交给谷歌,也不认可它的核心使用场景。

在 HN 看讨论 ↗   原文 / 论文 ↗
开发工具 · @yupi996▲ 3.0万

用一段Claude Opus 5.5提示词复刻Cursor AI编辑器

Twitter用户yupi996称,单提示词就能完美还原Cursor双模式

我被 Claude Opus 5.5 吓到瘫坐了。。😱 一段提示词复刻 Cursor AI 编辑器,Agent + Editor 双模式完美还原。

这直接就是一个成熟的商业产品啊!

在 X 看原帖 ↗
3.0万37634
AI芯片设计 · @ATaylorFPGA▲ 955

不用云端 Claude 或 Codex 本地生成 RTL 电路代码

开发者在AMD AI Halo机器上用本地AI模型生成RTL代码

使用 AI 生成 RTL 越来越受欢迎,但如果你不能使用 Claude 或 Codex 这类基于云端的服务怎么办?

本周我将研究在 AMD AI Halo 设备上使用本地模型生成 VHDL 和 Verilog RTL。

这是我研究的第一部分,但到目前为止结果看起来还不错。

在 X 看原帖 ↗
9554519
教程 · @realfxw▲ 1.7万

Apple Silicon芯片Mac可直接用两行命令唤醒内置本地LLM

来自X平台用户分享,Apple Silicon Mac无需额外部署,两行命令就能唤醒内置本地大语言模型

阅读全文 →
1.7万746106
模型 · @xiangxiang103▲ 6.6K

网易有道发布AI模型

同时超过语音识别赛道OpenAI、NVIDIA的模型,和翻译赛道腾讯、Google的模型,突然冲到Hugging Face前排

阅读全文 →
6.6K2495122
产品 · @alanchen▲ 1.7万

Meta的AI打电话功能,部分实际由真人处理

用户以为AI自己在对接订餐、改账单这些事,测试阶段有些场景还需要人类后台接管

阅读全文 →
1.7万35420
价格 · @oran_ge▲ 3.4万

GPT 6更新后Sol和Luna价格直接砍半

测试表现超过Opus 5,成本只需要后者的9%,原来的Terra档位被移除了

GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,并且学会了说人话,而 Terra 消失了。

GPT 6 Sol 和 Luna 使用了与 Astra 类似的训练方法,能力更强,对齐更好,价格更低。

在 AutomationBench中,GPT 6 Sol 的表现超越了 Opus 5 的同时,只用了其 9% 的成本,便宜10倍。

GPT 6 Sol 和 Luna 的语言风格和 Astra 相同,表达更清晰,黑话更少,言简意赅,减少不必要的细节。

GPT 6 Sol 在 OSWorld 2.0 等某些指标上不如 GPT 5.6 Sol,这是需要注意的。

OpenAI 这次还特别改进了缓存机制,实现了更高的缓存命中率(他们终于学会了ds的技术)

同时 A 社也在今天发布了 Opus 5.5,象征性地降价了 20%,缓存降价了 60%,在 Agent 任务中,综合下降约 40% 。

我们终于迎来了大模型的大降价时代,感谢竞争,感谢 DeepSeek 和 GLM,请不要停,请继续降。

在 X 看原帖 ↗
3.4万610923
企业应用 · @iwashi86▲ 4.4K

公司全司用Claude Code后搭了AI代理基座

工具迁移后本地处理大量任务变得困难,参考同行方案做了多AI代理并行运行的基础架构

阅读全文 →
4.4K36163
代理 · @justoutquan▲ 7.9K

justoutquan发布WebMCP Registry开放索引

原本计划内部使用,现在公开给AI代理获取实际工具能力,比如搜索航班这类操作

我们本来打算把这个项目放在 Tomo 内部使用,但现在决定公开推出:欢迎了解 WebMCP Registry,这是一个开放网站索引,收录了提供AI agent可用真实工具的网站,比如说“搜索航班”或者“加入购物车”,因此AI agent可以直接使用网站功能,而不需要一步步点击操作。

我们已经在真实浏览器中加载了排名前10万的网站,并记录了它们注册的每一个工具。我们每天都会重新检查这些工具。

在 X 看原帖 ↗
7.9K9119105
语音 · @ArtificialAnlys▲ 1.6万

ArtificialAnlys发布多语言文本转语音竞技场排行榜(9 languages)

以往语音模型比拼大多围绕英语展开,这次比较主流模型在9种非英语语言上的表现

阅读全文 →
1.6万1214524
技术观点 · @NathanFlurry▲ 2.1万

有人说在沙箱里跑AI代理生产方案不对

理论上操作很简单,放到生产环境后,沙箱的影响范围会直接变成AI代理的影响范围

这种方法是错的。在沙箱内部运行代理,理论上很简单,但是在生产环境中,沙箱的影响范围就会变成你的代理的影响范围。

举个例子,以 DigitalOcean 的架构来说:
- 沙箱崩溃/内存不足 → 代理循环随之死亡
- 磁盘占满或环境损坏 → 代理变砖
- 将你自己的 API 暴露为工具 → 需要额外基础设施
- 凭据不能存放在沙箱里 → 需要一整套凭据代理层
- 休眠的沙箱无法自行唤醒执行定时任务
- 更新代理代码 → 需要更新每台虚拟机上的二进制文件
- 监控 → 沙箱必须自己上报故障

不如将执行框架与沙箱分离:
- 在你的后端运行执行框架
- 将沙箱暴露为工具
- 将凭据、历史记录和权限保存在外部
- 只在需要时唤醒沙箱

Amp、Vercel Eve、Cloudflare Flue、Claude Managed Agents 和 OpenAI 的 Agents SDK 都采用这种架构不是没有原因的。我已经写了更多相关内容,介绍为什么这么做以及怎么做:

在 X 看原帖 ↗
2.1万14222240
新品发布 · @yonasbe▲ 1.0万

starslingdev 获300万美元融资推出代码审查工具

如果你是需要做代码审查的开发者,这款依托 GitHub Actions 的原生智能代码审查工具可以帮你自动化完成审查流程

今天我们宣布完成了种子轮前融资,并且推出了一款新产品:@starslingdev Review Runners——这是使用你的模型密钥、团队技能与脚本,以及你指定审核者的代码评审智能体,全部都运行在 GitHub Actions 中。

我们从 @BessemerVP 和 @ycombinator 处融得了 300 万美元,目标是让代码验证全面适配智能体原生架构。

代码 → 验证(持续集成 + 代码评审)→ 生产上线

在 X 看原帖 ↗
1.0万238224
实战经验 · @tinkerapi▲ 6.3K

Tinker上5美元10分钟优化开放LLM新功能

低成本快速改造现有开源大模型就能做概率分类输出,降低了开发特定功能AI的成本与时间门槛

LLM 的下一个token预测本身就是一个概率分类器,因此开源LLM可以提供类似Jev的接口:输入离散选项,输出快速概率。

我们自己的@ekzhang1在Tinker上花了5美元、用10分钟运行,就把这项工作做得更好了。

在 X 看原帖 ↗
6.3K6145
新品发布 · @github▲ 5.4万

GitHub Copilot 现已支持 Anthropic Claude Opus 5.5

在GitHub Copilot上就能体验Claude Opus 5.5,处理多步骤任务更高效,开发日常工作可获得更强AI支持。

🚀 AnthropicAI 的 Claude Opus 5.5 现已在 GitHub Copilot 全面可用。

我们的早期测试表明,它在效率方面表现突出:它在任务解决能力上可媲美 Claude Opus 5,同时所需的步骤和 token 显著减少,并且能在多步骤任务中快速恢复错误。

你可以试用它来进行智能体编码、长期运行智能体任务以及知识工作。你可以在 GitHub Copilot 应用、CLI 和 @code 中找到它。

在 X 看原帖 ↗
5.4万2624816
新品发布 · @github▲ 4.4万

GitHub Copilot 新增两款GPT-6模型

日常编码可以选轻量低价的GPT-6 Luna,交互开发选平衡款GPT-6 Sol,编码需求能按需选模型了

📣 @OpenAIDevs 的 GPT-6 系列正在 GitHub Copilot 中扩张,现已新增两款通用可用模型。

☀️ GPT-6 Sol:适用于交互式和智能体编码的均衡模型。

🌕 GPT-6 Luna:轻量、高性价比模型,适用于小型任务,是该系列中成本最低的选项。

你可以在 GitHub Copilot 应用或 @code 中试用它们。

在 X 看原帖 ↗
4.4万2225725
新品发布 · @googlegemma▲ 11.3万

@googlegemma发布DiffusionGemma-Jev一键部署方案(35-60 ms)

不需要自己买高性能GPU也能运行扩散模型,按使用付费闲置不花钱,降低了个人测试扩散模型的门槛。

部署 DiffusionGemma-Jev(djev)现在变得简单多了。你现在只需要一条命令,就能在 Google Cloud Run 上启动一个兼容 Jev API 的端点。

性能表现很不错:单步延迟约为 35-60 毫秒,批量大小为 32 时每秒可处理约 100-123 个请求。

这是一种不需要你自备GPU就能做实验的简单方法。运行成本大约是每小时 3 美元,空闲时费用会降到 0 美元。

代码和使用说明:

在 X 看原帖 ↗
11.3万2292.5K1.8K
前沿研究 · @simonw▲ 10.1万

simonw发布Jev与决策模型新分类笔记

关注AI技术分类方向进展的人,可以从中了解到Jev和这一新决策模型分类的相关讨论,帮助把握新的技术方向。

我整理了一些关于 Jev 以及第一系统(也叫决策模型)新分类的笔记。

在 X 看原帖 ↗
10.1万1021.3K1.3K
工具产品 · @nutlope▲ 1.3万

@nutlope 推出开源大模型对比工具

想换用开源大模型降低成本,可以用这个工具对比不同场景下不同模型的成本和效果,帮你找到最合适的选择。

帮助你找出哪款开源模型最适合你的使用场景。

可以跨编码、智能体、长上下文、视觉、金融等多个领域对比模型。

你还能查看它们在成本和质量上的对比,包括转用开源模型可以为你节省多少开支。

在 X 看原帖 ↗
1.3万10189151
实战经验 · @sydneyrunkle▲ 3.9K

用开源semif给开源仓库问题分类,速度远超旧模型

给开源仓库的新增问题做自动分类,现在用开源的semif,比之前的大语言模型分类器快很多,目前在监控阈值校准情况

我正在用 semif(类似 jev,但它是开源的)给开源仓库里新建的议题打标签,这样我们就能把握流行功能和我们需要投入更多精力的领域。

当前请求模型:
* 状态 —— 议题标题/正文
* 问题 —— 每个标签对应一个 Nou (原文如此)

到目前为止,我们给置信度 p>0.8 的标签打标的速度比我们之前的 LLM 分类器快得多,目前正在监测以确保我们在正确阈值上进行校准。

在 X 看原帖 ↗
3.9K73617
实战经验 · @RLanceMartin▲ 8.7K

分享Claude Opus 5.5 实用优化技巧

用一条指令就能自动清理提示词中拖累Claude Opus 5.5性能的无效内容,能直接提升模型使用体验

给 Opus 5.5 的实用技巧:在 Claude Code 中运行“/claude-api prompt-audit”。

这个命令会检查你的技能、agent.md、Claude.md、提示词,并移除会拖累前沿模型的反模式。

我已经用最新的 Opus 5.5 指南更新了技能。

在 X 看原帖 ↗
8.7K17207286
技巧约 7 分钟
Claude Code 接入 DeepSeek:编程成本降到 1/17
换脑不换工具:两分钟配置,Claude Code 输出成本从每百万 token 15 美元降到 0.87 美元。
前沿论文 · arXiv▲ 59

给AI画SVG打分的新尺子

让AI按文字描述画矢量图,现在有了更靠谱的评分方式:用六条细则逐项打分,比单一分数更接近人的判断,训练出的模型效果翻倍。

SVG生成 · AI评估 · 强化学习
arXiv 原文 ↗
深度观点 · @MelvinInvests▲ 1.8万

AI代理普及或将引发SaaS行业抛售潮

AI代理会成为用户操作软件的主要界面,削弱传统SaaS公司客户锁定,降低定价权,影响整个行业估值,普通用户也会感受到使用体验变化

阅读全文 →
1.8万2214482
黑客松 · @blmario669▲ 428

黑客松基于 TapeOut 搭建面向AI Agent的链上权限系统

开发者首次参加 TapeOut 黑客松,推出链上权限系统 Remembrance Seal

前沿论文 · arXiv▲ 36

把AI的“想象空间”换成几何空间,视频生成终于不穿帮了

现在的AI生成视频,画面漂亮但一转动镜头就露馅:物体变形、透视错乱。

现在的AI生成视频,画面漂亮但一转动镜头就露馅:物体变形、透视错乱。研究者发现根子不在模型不够强,而在AI的“内部语言”——它天生只记颜色和纹理,不记空间位置。他们干脆把AI的想象空间整个换成一套“几何母语”:这个空间里每个点同时编码外观、深度、相机位置和3D坐标,生成器用这套语言说话,画面质量和3D一致性同时大涨,镜头轨迹误差直接减半。

这不是给你明天用的工具,但它指了个方向:想让AI真正理解世界,得先给它一套能描述世界的语言。

3D一致性 · 视频生成 · 几何潜空间 · 世界模型
阅读全文 →
AI绘图 · @LufzzLiz▲ 5.2K

主流电脑也能跑通Qwen-Image-2.1,附避坑指南

Unsloth优化后,N卡12GB就能起步,本文整理了运行避坑要点

阅读全文 →
5.2K44047
大模型 · @steveruizok▲ 3.4万

开发者受邀测试Claude Opus 5.5,分享实际使用体验

开发者@steveruizok受邀测试Claude Opus 5.5,分享使用感受

我受邀测试了 Opus 5.5。除非你对输出质量要求极高,否则高端版本的差异很难察觉。但高要求会得到更好的回报。

如果你看不出这里的区别,或者你正在给模型做微观提示,我认为快速模型(composer、Gemini flash 等)会好得多。每当我需要做这类工作时,我都会换成这些模型。

但对于 Opus 5.5 这类模型,我一直把每个问题都当成曼哈顿计划级别的劳动组织工作来处理。就好比有一颗陨石正冲向地球,我们唯一的救赎就是让这份显微底稿保持内部一致。

我的提示一般是这样的:先创建一系列评估质量/一致性的维度,然后生成我应用里每个界面的图像,把它们放到一个 tldraw 离线看板上,再随机分组分析,找出问题并修复,直到每个界面/分组在所有维度都通过阈值。

大胆一点,发挥创意。Opus 是个怪胎,用 Opus 的感觉很好,Opus 就喜欢这样。

在 X 看原帖 ↗
3.4万9377276
前沿论文 · arXiv▲ 35

一个模型认229种文字,比专用模型还准

现在手机拍路牌、菜单,识别多国文字要么每种语言装一个识别器(又贵又容易出错),要么用超大视觉模型(慢且不准)。

现在手机拍路牌、菜单,识别多国文字要么每种语言装一个识别器(又贵又容易出错),要么用超大视觉模型(慢且不准)。这篇论文做了一个折中:一个模型、一个视觉编码器,内部用「专家路由」把不同文字分给不同专家处理,同时共享一个专家吸收跨语言的共性。他们造了覆盖10种文字系统、229种语言的合成数据集来补真实数据的稀缺,最终在10种文字的基准上准确率82.06%,超过最强基线;在端到端多语OCR任务上,只替换识别模块就把F1从65.71%拉到80.89%,超过最好的超大模型,参数却少得多。

它不是你明天就能装进手机的功能,但方向很明确:多语识别不必靠堆模型或堆参数,稀疏专家+合成数据就能做到又小又准。

多语OCR · 场景文字识别 · Mixture-of-Experts · 合成数据 · 轻量模型
阅读全文 →
编程 · @bcherny▲ 22.2万

开发者用Claude Opus 5.5找到Claude Agent SDK 16个bug

开发者在𝕏分享,借助AI结合形式验证工具检出多种竞态条件缺陷

我使用 Opus 5.5 借助 Lean 对 Claude Agent SDK 进行了形式验证。短短几个提示就生成了 16 个 PR,修复了各类 bug 和竞争条件。附视频。TLA+ 用起来也很不错。

我有时候会结合使用 Lean 和 TLA+ 来查找数据流、并发和状态管理相关的问题。我对这两门语言都不怎么熟练,但 Claude 对它们都掌握得非常出色。

这种方法对于对代码进行形式建模和查找人类可能发现不了的 bug 非常有用。形式验证会是编码的未来吗?(或者至少是查找 bug 的未来?)

Opus 做了一张信息图。

在 X 看原帖 ↗
22.2万1022.3K1.6K
前沿论文 · arXiv▲ 25

AI 修代码:分类训练比一锅炖强

把软件工程任务按类别分开训练再合并,AI 修代码成功率在两项基准上分别提升 5.39 和 2.78 个百分点——但这是给开发者看的工程优化,不是普通人明天能用上的东西。

AI编程 · 软件工程 · 强化学习 · 代码修复
arXiv 原文 ↗
前沿论文 · arXiv▲ 20

量子电路给语言模型加了个可训练的分支

给大模型加量子电路分支,参数只训练新增部分,16到64量子比特都能跑,平均分从47.65涨到54.30,还只用十分之一的微调数据。

量子计算 · 语言模型 · 扩散模型 · 量子增强
arXiv 原文 ↗
前沿论文 · arXiv▲ 20

图像生成模型训练不稳的根因找到了

图像生成模型的核心组件——离散视觉分词器——训练不稳的根因,被归结为编码器与码本两个模块的「互相甩锅」:各自都完不成自己的任务,只能靠碰巧配合才运转。

图像生成模型的核心组件——离散视觉分词器——训练不稳的根因,被归结为编码器与码本两个模块的「互相甩锅」:各自都完不成自己的任务,只能靠碰巧配合才运转。新方法把两者的学习目标分开修正、各自配独立的学习节奏,不增加任何参数,就在 ImageNet 上稳定了训练、提高了码本利用率和重建质量。

图像生成 · 向量量化 · 训练稳定性 · 码本
arXiv 原文 ↗
前沿论文 · arXiv▲ 18

AI 终于能同时理解文字、图片、视频和音频了

AI 终于有了一个能同时理解文字、图片、视频和音频的统一模型,在跨模态检索的多个基准上刷新了纪录——但这是给研究者看的前沿进展,不是普通人明天能用的功能。

多模态 · 嵌入 · 检索 · AI前沿
arXiv 原文 ↗
前沿论文 · arXiv▲ 15

AI心理陪伴正在从聊天走向“记得你”

大模型在心理健康领域的角色正在经历三次升级:先是当“工具”做评估,再是当“聊天对象”做即时陪伴,现在正走向第三阶段——一个记得你、了解你、能长期跟进的“个性化伴侣”。

大模型在心理健康领域的角色正在经历三次升级:先是当“工具”做评估,再是当“聊天对象”做即时陪伴,现在正走向第三阶段——一个记得你、了解你、能长期跟进的“个性化伴侣”。前两阶段的问题很明显:它不记得你上周说过什么,每次对话都是“失忆”的。第三阶段的关键是把模型做成“有状态的智能体”,给它配上档案、记忆、推理和规划能力,让它能跨时间追踪你的状态变化。

这篇综述把散落的研究串成这条进化线,并整理了相关数据集和评测资源。它不是你明天就能用上的产品,但它划出了这个领域正在往哪走:AI心理支持的下一个分水岭,不是更会聊天,而是“记得你”。

大模型 · 心理健康 · AI陪伴 · 智能体 · 综述
阅读全文 →
前沿论文 · arXiv▲ 14

AI记忆系统提速6.6倍:把“想”和“记”分开

AI智能体的记忆管理有了新架构:把快速决策和慢速推理分开,让轻量控制器负责记忆的存取,只在复杂问题时才动用大模型。

AI智能体的记忆管理有了新架构:把快速决策和慢速推理分开,让轻量控制器负责记忆的存取,只在复杂问题时才动用大模型。在测试中,记忆构建速度提升6.6倍,查询延迟降低36.7%,效果还更好。

AI智能体 · 记忆系统 · 效率提升 · 系统一系统二
arXiv 原文 ↗
行业动态 · OpenAI 开发者社区▲ 15

Codex CLI 0.155.1中GPT-5.6 Luna消失

使用Codex CLI时遇到相同问题的开发者,可以参考分享的排查过程,节省解决问题的时间

大家好,我今天遇到了一个 Codex CLI 的奇怪问题,想把排查过程记录下来,万一其他人也遇到了相同问题可以参考。

## 环境
- Codex CLI:`0.155.1`
- 操作系统:Linux
- 受影响模型:`gpt-5.6-luna`

之前 `/model` 里还能找到 GPT-5.6 Luna,但后来它突然从模型选择器里消失了。可见的模型列表包含这些模型:
- GPT-6-Astra
- GPT-5.6-Sol
- GPT-5.6-Terra
- GPT-5.5
但就是没有 GPT-5.6 Luna。
---

## 1.

在社区看讨论 ↗
前沿论文 · arXiv▲ 13

AI角色扮演的深层人格:三层架构让AI不再一秒出戏

现在的AI角色扮演大多靠一句「你是个开朗的人」这种浅层设定,聊几句就崩。

现在的AI角色扮演大多靠一句「你是个开朗的人」这种浅层设定,聊几句就崩。这篇把人格拆成三层:外在言行、潜在信念、核心动机,像给人写剧本一样给AI一套内部脚本,让它只能在这个框架里反应,而不是自由发挥。结果发现:AI的对话流畅度已经接近人类,但在情绪表达和共同注意力上系统性拉胯——它说得出漂亮话,却接不住你的情绪。

角色扮演 · 人格模拟 · AI对话 · 情绪表达 · 心理学
阅读全文 →
前沿论文 · arXiv▲ 13

把外挂的AI技能焊进模型里

给AI配的“外挂工具”往往只在测试时有效,一换环境就失灵。

给AI配的“外挂工具”往往只在测试时有效,一换环境就失灵。这篇论文的做法是:让一个“教练AI”在训练时盯着学生AI,把外挂工具带来的好行为一步步纠正、示范,最后把这些行为直接写进模型参数里。结果,模型在去掉外挂后,任务成功率从23.3%涨到44.3%,甚至比带着外挂还高。

也就是说,AI学会的不再是依赖工具,而是工具背后的能力本身。

AI训练 · 模型蒸馏 · 智能体 · 工具依赖
阅读全文 →
行业动态 · OpenAI 开发者社区▲ 17

openai-community 讨论 GPT Image 缓存问题

重复使用同一张参考图生成内容,却始终没有消耗缓存的图片输入额度,这会直接影响使用成本。

我现在在用 gpt-image-2 和 gpt-image-2.5 生成带插图的故事,我发现就算反复复用同一个角色参考图,也不会计入缓存的图像输入用量。

我们的流程是:调用 `/v1/images/edits`,通过 `multipart image[]` 上传参考图。每个请求使用相同的参考图二进制数据,但场景提示词不同。

有些请求是并发运行的,另一些则是顺序执行:我们先生成封面和第一页预览,之后再生成剩下的页面。

在社区看讨论 ↗
前沿论文 · arXiv▲ 11

贝尔曼策略优化

训练大模型推理的新方法 BPO 在数学推理基准上表现更好,但它只是算法层面的改进,你明天用不上。

大模型 · 推理 · 强化学习 · 数学
arXiv 原文 ↗
前沿论文 · arXiv▲ 11

机器人犯错后能自己爬起来,成功率涨了15个点

机器人干活最怕的不是不会,而是干到一半跑偏了,然后一路错到底。

机器人干活最怕的不是不会,而是干到一半跑偏了,然后一路错到底。这篇 CARE 的思路是:让它把失败过程记下来,学自己是怎么跑偏的,下次再偏就知道怎么拉回来。做法很具体——把任务拆成阶段,记录每个阶段出错后的偏差规律,再拿这些真实失败数据生成纠正动作;执行时用 3D 视觉盯着,一旦发现偏离就触发小调整或重做,而不是从头再来。

在多个模拟和真实双臂任务上,平均成功率提升了约15个点。它不是你明天就能装进自家机器人的东西,但这是机器人从「会做」走向「做不砸」的关键一步。

机器人 · VLA · 纠错 · 失败恢复 · 具身智能
阅读全文 →
行业动态 · OpenAI 开发者社区▲ 106

openai-community发布Codexometer工具

无需反复在当前Codex工作会话打开/status页面,就能随时查看配额、用量等信息,不会打断当前工作流程。

Codexometer 是一个适用于 Codex 的小型复古终端仪表盘:显示实时额度、会话监控、令牌使用历史和模型基准测试。

把它放在第二个终端窗口或窗格保持打开,就能查看每个活跃额度窗口、剩余容量和重置时间,无需在你正在工作的 Codex 会话中反复打开 /status。

为什么要用它?/status 很有用,但它只能存在于你正在工作的会话内部。Codexometer 无需中断工作就能让额度始终可见。

在社区看讨论 ↗
技巧约 2 分钟
Codex手动重置额度与邀请好友攻略
Plus/Pro用户可主动重置额度,曾可推荐朋友额外获取重置;注意Linux暂不支持。
前沿论文 · arXiv▲ 11

1%的token就够:稀疏蒸馏新方法

大模型训练时只挑1%的token让老师监督,效果就能追平甚至超过全量监督——关键不是选“最有用的”,而是选“梯度估计最稳的”。

大模型 · 蒸馏 · token选择 · 训练效率
arXiv 原文 ↗
观点 · @sama导语出处▲ 12.5万

OpenAI发了新GPT-6模型,Sam Altman说没对手

Altman认为按单任务定价计算,新模型更快更便宜,市场上没有其他产品能打,普通用户很快就能用到大批量的AI服务。

尤其是按单任务定价来比较,这才是真正重要的衡量标准,我认为目前市场上没有任何竞品具备竞争力。

我们希望人们能够大量使用AI;能够探索摆在我们面前的这场新复兴,这件事非常重要。

GPT-6 Sol 和 Luna —— 这些更快、性价比更高的模型,背后依托Astra取得的性能提升,在专业工作、事实准确性、编码、计算机使用和对齐方面都达到了SOTA水平:

在 X 看原帖 ↗
12.5万752.0K100
商业 · @ajratner▲ 3.5万

数据即服务公司SnorkelAIE轮拿了3.5亿美元估值

推出数据即服务产品后,一年里业务增长超18倍,目前累计营收已经超过3.75亿美元,AI数据服务赛道越来越热。

阅读全文 →
3.5万9430340
商业 · @ycombinator▲ 1.8万

网页爬取工具Firecrawl完成7500万美元B轮融资

这款工具能把网页转换成AI agent可用的结构化数据,已经有超过150万人在用,AI代理的数据获取需求越来越被资本看重。

祝贺@CalebPeffer、@ericciarla、@nickscamara_ 和 @firecrawl 完成 7500 万美元 B 轮融资!

Firecrawl 能将网络转换为供 AI 代理使用的干净结构化数据,目前已有超过 150 万人基于其 API 进行开发。

他们还推出了知识图书馆 Alexandria,代理可以通过它搜索实时网络、官方数据提供商,以及学术论文、开发文档和政府记录的专门索引。

当代理使用数据提供商的数据时,提供商会获得报酬,Firecrawl 计划向所有拥有值得分享的知识的人开放这一功能。

在 X 看原帖 ↗
1.8万1712224
产品 · @dylannknox▲ 1.2万

PixVerse出了新的世界模型,能用键盘操作进生成画面

多数AI视频工具只能按提示词生成片段,这个新模式允许你用方向键在生成好的数字世界里移动探索,思路和传统生成工具不一样。

#PixVerseWorldModel

大多数AI视频工具都只聚焦一件事:根据提示词生成一段视频。@PixVerse World Model 探索的是当你真正能够进入生成的世界后会发生什么。

你可以使用WASD在环境中移动,控制你的视角,探索场景,而不是仅仅从固定视角观看它。同时,提示词给了你另一种与世界交互的方式,你可以通过它影响角色、动作和周围环境。

移动和提示配合工作,让体验变得更具动态感。你不是生成一系列互不连接的片段,而是可以在生成的环境中持续探索和交互。

这让AI视频不再像传统的内容生成,而更像是一种新型的交互体验。

体验地址:

在 X 看原帖 ↗
1.2万3510975
开源 · @openclaw▲ 2.2万

OpenClaw发布OpenClaw核心的决策模型支持功能

项目邀请社区开发者参与贡献,做AI相关开源项目的开发者可以围观项目的开发思路和方向。

一切都离不开Jev!上周,@jlehman_ 为OpenClaw核心和插件推送上了决策模型支持。

来了解我们对于使用这些模型的思路,以及如何通过这个强大的新工具为改进OpenClaw做贡献!

在 X 看原帖 ↗
2.2万13239102
新品发布 · @arakharazian▲ 4.4万

Ramp AI Index 发布重大更新 每周更新

关注AI模型使用成本统计的人,可以现在看到按token和用量统计的数据,后续还会推出团队用量统计。

我们刚刚推送了Ramp AI Index的一次重大更新。

本次更新已正式上线:除份额和代币计数外,还新增了代币和支出总量统计。数据每周更新。

支持按模型查看,包括开源模型。

未来还会推出更多功能,包括基于团队的支出统计。

在 X 看原帖 ↗
4.4万1512962
前沿研究 · @FireworksAI_HQ▲ 1.1万

FireworksAI实测:任务路由选模型解决率达97.6%

按任务匹配最优模型,比只用单一最优模型解决率更高,成本还不到原来的三分之一,值得关注这一新方向。

我们在 DeepSWE 上用 18 个模型跑了 113 项真实编码任务,然后回头提出了一个简单的问题:如果每个任务都路由给处理它最好的模型,结果会怎样?

答案是:解决率达到 97.6%,每项任务成本 1.88 美元;相比之下,最好的单个模型解决率只有 74.1%,每项任务成本 6.52 美元。

下一个前沿方向就是路由模型了。完整分析:

在 X 看原帖 ↗
1.1万1111143
新品发布 · @DJiafei▲ 6.5K

@DJiafei发布Grounded Action Model (GAM)

现有语言和视频模型做机器人基础受到质疑,新范式先定位再学动作,关心机器人技术进展可以了解新方向。

VLA?WAM?语言模型和视频模型真的是机器人学的合适基础吗?

今天向大家介绍Grounded Action Model(GAM):一个全新范式,在预训练3D接地模型之上构建机器人基础模型。

先接地,再学习行动。🧵

在 X 看原帖 ↗
6.5K17171122
新品发布 · @gen_instinct▲ 1.2万

@gen_instinct发布InstinctFlash开源物理AI运行时

端到端机器人策略和动作模型在设备端运行速度慢,这款工具支持在单块消费级GPU上实时运行8个模型系列的通用模型,能提升机器人端侧推理速度

InstinctFlash 是一个统一的开源物理 AI 模型运行时,可用于快速高效推理。

端到端机器人策略无法部署在边缘设备上。视觉语言模型(VLA)在设备上运行已经极慢,而权重平均模型(WAM)速度更慢——仅为一次动作去噪单个片段就需要 20-50 步。

InstinctFlash 允许你在单个商用 GPU 上实时运行来自 8 个模型家族的通用模型。

在 X 看原帖 ↗
1.2万891107
新品发布 · @firecrawl▲ 15.9万

firecrawl发布Alexandria 知识库($75M)

想要构建超级智能,先得有足够大的高质量知识库。拿到大额融资的团队打算拼出全球最大的知识库,给AI代理提供即时数据支持。

我们推出了 Alexandria。我们在由 Smash Capital 领投的 B 轮融资中筹得了 7500 万美元,用以构建面向超级智能的全球最大知识库。 它可为你的智能体提供增强能力,让它们即时访问最强大的数据集和提供商。

在 X 看原帖 ↗
15.9万62757559
行业动态 · @OpenAI▲ 31.3万

OpenAI 提出四个优先的AI安全独立评估领域

对于关注AI安全发展的人来说,这是头部AI公司首次公开开放全流程评估权限,能帮助发现未被预见的风险。

为了推进前沿探索,我们致力于支持第三方独立评估,提供训练、评估、部署全流程的深度访问权限。

这些权限可以让第三方评估者对我们的假设提出质疑,找出我们可能遗漏的风险,并就我们安全措施的有效性得出他们自己的结论。

下面我们列出四个需要深度评估的优先领域,以及严谨、安全、独立开展工作的原则:

在 X 看原帖 ↗
31.3万1312.0K219
新品发布 · @MidcenturyAI▲ 16.5万

MidcenturyAI / Midcentury发布物理AI数据与仿真基础设施($15M)

想要把机器人从演示落地到实际应用,现在有了新的数据和仿真工具支持,有望推进物理机器人领域落地。

我们推出Midcentury,正在为实体AI搭建数据与模拟基础设施。

现在,我们结束隐身模式,完成了1500万美元种子轮融资,目标是把机器人技术从精心打磨的演示阶段推向规模化应用。

我们已经为前沿实验室提供支持:

→ 全球最大的第一视角数据集:超过200万小时数据,覆盖50多种环境,包含超过2万个任务

→ Matrix:前沿模拟平台,借助我们的真实世界数据实现扩容,能够大规模评估和后训练策略。

在 X 看原帖 ↗
16.5万197669234
前沿研究 · @EpochAIResearch▲ 1.5万

EpochAIResearch披露:AI成本降速超多领域技术

这项研究统计了AI技术成本下降的速度,AI领域成本下行速度远超其他颠覆性技术,对AI产品普及和落地会产生直接影响。

AI 降价速度比历史上任何其他颠覆性技术都要快。

在性能水平固定的情况下,自 2023 年以来,AI 的成本每季度下降约 47%。

这个速度是 DNA 测序的 4 倍,计算技术的 6 倍,锂电池的 18 倍,也是(截至 1973 年)电力的 54 倍。

在 X 看原帖 ↗
1.5万101513152
新品发布 · @digitalocean▲ 78.0万

DigitalOcean 推出托管智能体公开预览服务

开发者可以在这里运行 Claude Code、自定义 LangGraph 智能体,闲置时会暂停运行,还可选择75种以上模型,统一结算账单。

DigitalOcean 托管代理现已开启公开预览。在空闲时会暂停的运行环境中运行 Claude Code、Codex 或你自己的 LangGraph 代理。

将其工具放置在一个受管控端点后,可从 75 多种开源和专有模型中选择。一个云端,一份账单。

博客中有入门提示。

在 X 看原帖 ↗
78.0万2.0K738423
深度观点 · @sama▲ 8.8万

OpenAI 对自家API未来发展提出愿景

对依赖OpenAI API做开发的人来说,这个方向意味着未来会有适配不同需求和预算的更多选项,好想法有更多落地空间。

我们希望 OpenAI API 在每个价格点都拥有最好的模型,并且在每个模态(文本、代码、图像、视频等)都做到最好。

然后我们希望所有人都能提出精彩创意并将其落地,成为满意的用户。最好的创意一定来自你们所有人。

在 X 看原帖 ↗
8.8万812.0K83
大语言模型 · @superalesha▲ 2.3万

用户让Opus 5.5生成Claude模型发展史 生成了纯JS页面

用户@superalesha在𝕏分享,自己让Claude的Opus 5.5生成Claude模型发展史,后者生成了纯JavaScript页面

用户@superalesha在𝕏分享,他让Opus 5.5生成一份Claude模型发展历史。Opus 5.5用纯JavaScript(JS)生成了这份内容,全程仅依靠用户自身技能完成。

用户表示,看到其他人用Opus 5.5做出了不少成果,感觉自己的能力不足限制了这个模型的潜力。他认为需要对此做出改变。

相关内容链接附在原文分享中。

在 X 看原帖 ↗
2.3万28485404
加密货币 · @familiarcow▲ 8.9K

质押Near原生代币可获得免费AI API额度,用户打造了自动化AI工作流

X用户@familiarcow分享使用Near AI的体验,通过质押获得每月约50美元API额度,自动化调用Claude Code提升效率

用户@familiarcow接触Near AI还不到一周,已经对这个平台十分满意。他选择质押Near原生代币,每月能获得大约50美元的API(应用程序编程接口)额度,这个额度还会实时持续增长。

用户使用获得的API额度搭建了Hermes,大多选用GLM 5.3模型做推理。他将这个推理模块设置为控制中心,用来调度自己已经付费订阅的Claude Max计划里的Claude Code实例,处理重算力任务。

简单任务可以免费处理,复杂任务比如数据分析、git代码仓库开发,则可以交由被调度的Claude Code完成。

用户表示,这套自动化框架让Claude Code的实用性提升了4倍,所有成本都由质押获得的额度覆盖,不需要额外付费,他对此非常满意。

在 X 看原帖 ↗
8.9K510230
软件工程 · @hraness▲ 1.0万

开发者称其软件工程工厂每天消耗50亿到100亿tokens

开发者@hraness披露,其软件工程工厂每日多模型并行处理消耗5-10B tokens

开发者@hraness披露,他运营的软件工程工厂每天消耗50亿到100亿tokens,全天24小时不间断运行。

该工厂基于@zeddotdev部署,运行了多个大语言模型:6倍Codex Astra Ultra,2倍Claude Code Fable Max,均属于@DevinAI SWE-2 Max版本。

相关内容已发布在链接

在 X 看原帖 ↗
1.0万111649
云计算 · @VadimStrizheus▲ 2.0万

买Mac Mini挂AI代理的用户都白买了,云方案才是未来

DigitalOcean现已支持云端运行Claude Code和Codex,闲置自动暂停计费

为每一位买Mac Mini来全天候运行OpenClaw或Hermes Agent的人默哀 💀 包括我自己。

DigitalOcean现在可以帮你在云端运行Claude Code和Codex了。你可以合上笔记本,代理会继续工作。

它一旦闲置就会暂停,你也会停止支付计算费用。在任何设备上,它只需要大约300毫秒就能在同一会话中重新唤醒。

模型甚至永远不会接触到你的API密钥。云端代理就是未来。

在 X 看原帖 ↗
2.0万491119
动捕技术 · @Lina_Hoshino▲ 6.3K

揭秘动捕Station系统工作流程,PC应用将开源

开发者Discord对话透露,动捕系统各Station本地运行ML模型进行动捕

阅读全文 →
6.3K517851
提示工程 · @omarsar0▲ 3.2K

Anthropic分享了一个Claude Opus 5.5长任务提示词

该提示词用于解决Claude Code长任务中模型中断问题,来自X用户@omarsar0

这是来自 Anthropic 的很棒的提示词。它在你使用 Claude Code 中的 Opus 5.5 处理长时间运行任务时,能够帮助推进任务持续进行。

显然,在长时间运行的任务中,模型有时候会停止报告结果而不继续运行。我已经注意到前沿模型经常出现这个问题。

在 X 看原帖 ↗
3.2K63335
技巧约 3 分钟
Claude翻译提示:如何实现信达雅
基于真实研究,教你用角色、术语表和示例让Claude翻译信、达、雅。
AI开发 · @dotey▲ 2.3万

复杂AI开发任务先写技术方案文档再分工协作

@dotey分享多AI角色分工开发的实操工作流

我不用 plan 模式,但是我复杂一点的会先写技术方案文档,主要是:

1. 人看看文档确保大方向有没有问题

2. Fable 写文档,文档里面写清楚技术细节和如何验证,后续 Opus 执行

3. 作为后续验收的依据,Opus 实施完,在新会话让 Fable 按照文档去验收一下

4. 一些重要文档会留档,但会保持更新

5. 有时候会在 ChatGPT 网页版用 GPT-6 Pro 访问 Repo 写技术方案文档,下载下来让 Fable 去审查再让 Opus 执行

简单来说,重点不是用 plan mode,但是用一个文档让人可以确认方向,以及后续多 Agent 协作传递上下文是很有价值的

在 X 看原帖 ↗
2.3万1390101
📑 前沿论文
前沿论文 · arXiv▲ 203

AI 对话终于能边听边干活了

AI 对话系统首次做到「边聊边干活」:一个模型负责实时对话,另一个在后台异步执行查资料、调工具等任务,结果再无缝插回对话,在 8 项视频和 8 项音频基准上多项领先,打断响应率 75%。

全双工 · 异步任务 · 实时对话 · AI 交互
arXiv 原文 ↗
前沿论文 · arXiv▲ 110

AI 的品味,成了新的能力瓶颈

大模型做长任务时,中途的每个选择——先测哪个假设、在哪个代码上继续搭——决定了整件事的成败。

大模型做长任务时,中途的每个选择——先测哪个假设、在哪个代码上继续搭——决定了整件事的成败。研究者把这种中途决策能力叫做「品味」,并造了个评测集:把 AI 自己跑任务时的轨迹切成岔路口,让模型在不知道后续结果的情况下选方向。最强模型只答对 59.7%,而且岔路口的线索出现得越晚,所有模型越抓瞎;给更多推理时间也没用。

好消息是品味可以教:让看过结局的老师把判断蒸馏给学生,学生在没见过的任务上决策更好,端到端成功率也涨了。它不是你明天能用上的,但它在提醒:AI 的下一个瓶颈可能不是算力,是判断力。

AI品味 · 长任务决策 · 评测基准 · 蒸馏训练
阅读全文 →
前沿论文 · arXiv▲ 59

给AI画SVG打分的新尺子

让AI按文字描述画矢量图,现在有了更靠谱的评分方式:用六条细则逐项打分,比单一分数更接近人的判断,训练出的模型效果翻倍。

SVG生成 · AI评估 · 强化学习
arXiv 原文 ↗
前沿论文 · arXiv▲ 36

把AI的“想象空间”换成几何空间,视频生成终于不穿帮了

现在的AI生成视频,画面漂亮但一转动镜头就露馅:物体变形、透视错乱。

现在的AI生成视频,画面漂亮但一转动镜头就露馅:物体变形、透视错乱。研究者发现根子不在模型不够强,而在AI的“内部语言”——它天生只记颜色和纹理,不记空间位置。他们干脆把AI的想象空间整个换成一套“几何母语”:这个空间里每个点同时编码外观、深度、相机位置和3D坐标,生成器用这套语言说话,画面质量和3D一致性同时大涨,镜头轨迹误差直接减半。

这不是给你明天用的工具,但它指了个方向:想让AI真正理解世界,得先给它一套能描述世界的语言。

3D一致性 · 视频生成 · 几何潜空间 · 世界模型
阅读全文 →
前沿论文 · arXiv▲ 35

一个模型认229种文字,比专用模型还准

现在手机拍路牌、菜单,识别多国文字要么每种语言装一个识别器(又贵又容易出错),要么用超大视觉模型(慢且不准)。

现在手机拍路牌、菜单,识别多国文字要么每种语言装一个识别器(又贵又容易出错),要么用超大视觉模型(慢且不准)。这篇论文做了一个折中:一个模型、一个视觉编码器,内部用「专家路由」把不同文字分给不同专家处理,同时共享一个专家吸收跨语言的共性。他们造了覆盖10种文字系统、229种语言的合成数据集来补真实数据的稀缺,最终在10种文字的基准上准确率82.06%,超过最强基线;在端到端多语OCR任务上,只替换识别模块就把F1从65.71%拉到80.89%,超过最好的超大模型,参数却少得多。

它不是你明天就能装进手机的功能,但方向很明确:多语识别不必靠堆模型或堆参数,稀疏专家+合成数据就能做到又小又准。

多语OCR · 场景文字识别 · Mixture-of-Experts · 合成数据 · 轻量模型
阅读全文 →
前沿论文 · arXiv▲ 25

AI 修代码:分类训练比一锅炖强

把软件工程任务按类别分开训练再合并,AI 修代码成功率在两项基准上分别提升 5.39 和 2.78 个百分点——但这是给开发者看的工程优化,不是普通人明天能用上的东西。

AI编程 · 软件工程 · 强化学习 · 代码修复
arXiv 原文 ↗
前沿论文 · arXiv▲ 20

量子电路给语言模型加了个可训练的分支

给大模型加量子电路分支,参数只训练新增部分,16到64量子比特都能跑,平均分从47.65涨到54.30,还只用十分之一的微调数据。

量子计算 · 语言模型 · 扩散模型 · 量子增强
arXiv 原文 ↗
前沿论文 · arXiv▲ 20

图像生成模型训练不稳的根因找到了

图像生成模型的核心组件——离散视觉分词器——训练不稳的根因,被归结为编码器与码本两个模块的「互相甩锅」:各自都完不成自己的任务,只能靠碰巧配合才运转。

图像生成模型的核心组件——离散视觉分词器——训练不稳的根因,被归结为编码器与码本两个模块的「互相甩锅」:各自都完不成自己的任务,只能靠碰巧配合才运转。新方法把两者的学习目标分开修正、各自配独立的学习节奏,不增加任何参数,就在 ImageNet 上稳定了训练、提高了码本利用率和重建质量。

图像生成 · 向量量化 · 训练稳定性 · 码本
arXiv 原文 ↗
前沿论文 · arXiv▲ 18

AI 终于能同时理解文字、图片、视频和音频了

AI 终于有了一个能同时理解文字、图片、视频和音频的统一模型,在跨模态检索的多个基准上刷新了纪录——但这是给研究者看的前沿进展,不是普通人明天能用的功能。

多模态 · 嵌入 · 检索 · AI前沿
arXiv 原文 ↗
前沿论文 · arXiv▲ 15

AI心理陪伴正在从聊天走向“记得你”

大模型在心理健康领域的角色正在经历三次升级:先是当“工具”做评估,再是当“聊天对象”做即时陪伴,现在正走向第三阶段——一个记得你、了解你、能长期跟进的“个性化伴侣”。

大模型在心理健康领域的角色正在经历三次升级:先是当“工具”做评估,再是当“聊天对象”做即时陪伴,现在正走向第三阶段——一个记得你、了解你、能长期跟进的“个性化伴侣”。前两阶段的问题很明显:它不记得你上周说过什么,每次对话都是“失忆”的。第三阶段的关键是把模型做成“有状态的智能体”,给它配上档案、记忆、推理和规划能力,让它能跨时间追踪你的状态变化。

这篇综述把散落的研究串成这条进化线,并整理了相关数据集和评测资源。它不是你明天就能用上的产品,但它划出了这个领域正在往哪走:AI心理支持的下一个分水岭,不是更会聊天,而是“记得你”。

大模型 · 心理健康 · AI陪伴 · 智能体 · 综述
阅读全文 →
前沿论文 · arXiv▲ 14

AI记忆系统提速6.6倍:把“想”和“记”分开

AI智能体的记忆管理有了新架构:把快速决策和慢速推理分开,让轻量控制器负责记忆的存取,只在复杂问题时才动用大模型。

AI智能体的记忆管理有了新架构:把快速决策和慢速推理分开,让轻量控制器负责记忆的存取,只在复杂问题时才动用大模型。在测试中,记忆构建速度提升6.6倍,查询延迟降低36.7%,效果还更好。

AI智能体 · 记忆系统 · 效率提升 · 系统一系统二
arXiv 原文 ↗
前沿论文 · arXiv▲ 13

AI角色扮演的深层人格:三层架构让AI不再一秒出戏

现在的AI角色扮演大多靠一句「你是个开朗的人」这种浅层设定,聊几句就崩。

现在的AI角色扮演大多靠一句「你是个开朗的人」这种浅层设定,聊几句就崩。这篇把人格拆成三层:外在言行、潜在信念、核心动机,像给人写剧本一样给AI一套内部脚本,让它只能在这个框架里反应,而不是自由发挥。结果发现:AI的对话流畅度已经接近人类,但在情绪表达和共同注意力上系统性拉胯——它说得出漂亮话,却接不住你的情绪。

角色扮演 · 人格模拟 · AI对话 · 情绪表达 · 心理学
阅读全文 →
前沿论文 · arXiv▲ 13

把外挂的AI技能焊进模型里

给AI配的“外挂工具”往往只在测试时有效,一换环境就失灵。

给AI配的“外挂工具”往往只在测试时有效,一换环境就失灵。这篇论文的做法是:让一个“教练AI”在训练时盯着学生AI,把外挂工具带来的好行为一步步纠正、示范,最后把这些行为直接写进模型参数里。结果,模型在去掉外挂后,任务成功率从23.3%涨到44.3%,甚至比带着外挂还高。

也就是说,AI学会的不再是依赖工具,而是工具背后的能力本身。

AI训练 · 模型蒸馏 · 智能体 · 工具依赖
阅读全文 →
前沿论文 · arXiv▲ 11

贝尔曼策略优化

训练大模型推理的新方法 BPO 在数学推理基准上表现更好,但它只是算法层面的改进,你明天用不上。

大模型 · 推理 · 强化学习 · 数学
arXiv 原文 ↗
前沿论文 · arXiv▲ 11

机器人犯错后能自己爬起来,成功率涨了15个点

机器人干活最怕的不是不会,而是干到一半跑偏了,然后一路错到底。

机器人干活最怕的不是不会,而是干到一半跑偏了,然后一路错到底。这篇 CARE 的思路是:让它把失败过程记下来,学自己是怎么跑偏的,下次再偏就知道怎么拉回来。做法很具体——把任务拆成阶段,记录每个阶段出错后的偏差规律,再拿这些真实失败数据生成纠正动作;执行时用 3D 视觉盯着,一旦发现偏离就触发小调整或重做,而不是从头再来。

在多个模拟和真实双臂任务上,平均成功率提升了约15个点。它不是你明天就能装进自家机器人的东西,但这是机器人从「会做」走向「做不砸」的关键一步。

机器人 · VLA · 纠错 · 失败恢复 · 具身智能
阅读全文 →
前沿论文 · arXiv▲ 11

1%的token就够:稀疏蒸馏新方法

大模型训练时只挑1%的token让老师监督,效果就能追平甚至超过全量监督——关键不是选“最有用的”,而是选“梯度估计最稳的”。

大模型 · 蒸馏 · token选择 · 训练效率
arXiv 原文 ↗
🔬 前沿研究
前沿研究 · @_LuoFuli▲ 1.8万

MiMo-V3新核心HySparse2性能大提升

智能体推理场景同时面临预填充成本、KV缓存大小和检索精度三大问题,新架构一次性解决了这三个痛点,长上下文推理效率提升明显。

阅读全文 →
1.8万66727153
前沿研究 · @simonw▲ 10.1万

simonw发布Jev与决策模型新分类笔记

关注AI技术分类方向进展的人,可以从中了解到Jev和这一新决策模型分类的相关讨论,帮助把握新的技术方向。

我整理了一些关于 Jev 以及第一系统(也叫决策模型)新分类的笔记。

在 X 看原帖 ↗
10.1万1021.3K1.3K
前沿研究 · @weikaih04▲ 31.3万

weikaih04发布Grounding Action Model 机器人操作策略、Arxiv 研究论文、开源代码

该研究发现,提升机器人操作能力更需要扩展空间和三维理解,而非扩展动作规模,性能优于多数更大的已有模型。

GPT6-Astra告诉我们,扩展空间理解和三维理解而非扩展动作,能带来更好的机器人操控表现。

我们采用了极简思路:如果直接从三维理解模型训练策略,而不是从视觉语言模型(VLM)训练,会怎么样?

出人意料的是,它的表现超过了大多数更大规模的视觉语言动作模型(VLA)和可抓握动作模型(WAM)。

现在推出基础动作模型(Grounding Action Model):这是一个全新的、达到当前最优水平(SOTA)的策略,由小型三维框检测模型WildDet3D训练得到。

Arxiv:
Code:

在 X 看原帖 ↗
31.3万89439
前沿研究 · @EpochAIResearch▲ 1.5万

EpochAIResearch披露:AI成本降速超多领域技术

这项研究统计了AI技术成本下降的速度,AI领域成本下行速度远超其他颠覆性技术,对AI产品普及和落地会产生直接影响。

AI 降价速度比历史上任何其他颠覆性技术都要快。

在性能水平固定的情况下,自 2023 年以来,AI 的成本每季度下降约 47%。

这个速度是 DNA 测序的 4 倍,计算技术的 6 倍,锂电池的 18 倍,也是(截至 1973 年)电力的 54 倍。

在 X 看原帖 ↗
1.5万101513152
前沿研究 · @FireworksAI_HQ▲ 1.1万

FireworksAI实测:任务路由选模型解决率达97.6%

按任务匹配最优模型,比只用单一最优模型解决率更高,成本还不到原来的三分之一,值得关注这一新方向。

我们在 DeepSWE 上用 18 个模型跑了 113 项真实编码任务,然后回头提出了一个简单的问题:如果每个任务都路由给处理它最好的模型,结果会怎样?

答案是:解决率达到 97.6%,每项任务成本 1.88 美元;相比之下,最好的单个模型解决率只有 74.1%,每项任务成本 6.52 美元。

下一个前沿方向就是路由模型了。完整分析:

在 X 看原帖 ↗
1.1万1111143
🚀 新品发布
新品发布 · @Alibaba_Qwen▲ 8.2万

通义千问发布Qwen Intelligence手机智能体

普通人也能拥有个人移动端智能助手,可以帮你规划任务、处理操作和生成内容,性能在多个公开测试集上表现出色。

阅读全文 →
8.2万1461.6K590
新品发布 · @Alibaba_Qwen▲ 3.7万

通义千问 Qwen-Image-2.1 登顶开源图像模型榜首

这是目前图像编辑和文生图领域排名第一的开源模型,追求图像生成效果可以试试这个新选择。

感谢 @arena 的认可!🏆

Qwen-Image-2.1 目前在图像编辑和文生图 Arena 排行榜中都是排名第一的开源模型。

现在就来体验,向我们展示你创作的作品吧!🎨

在 X 看原帖 ↗
3.7万2241943
新品发布 · @OpenRouter▲ 2.5K

OpenRouter 发布 Space Bunny Alpha 大模型

这款模型支持超长上下文窗口,可处理文本、图像和视频输入,推理速度快,支持调节推理能力,感兴趣可以去体验反馈。

来OpenRouter认识Space Bunny Alpha ⚡

这是一个快速模型,拥有快速推理、可调节推理能力,以及100万token上下文窗口。

它支持文本、图像和视频输入。

快来试用并分享你的反馈:

在 X 看原帖 ↗
2.5K5645
新品发布 · @Lonely__MH▲ 3.0万

UnslothAI发布Qwen-Image-2.1 GGUF量化版

16G内存的Mac就能运行这个4.2GB的4-bit文生图模型,还能原生生成透明背景图,想要本地跑AI作图可以试试。

🎉全体起立!Qwen-Image-2.1 的 GGUF 量化版来了!感谢 @UnslothAI 团队的出手!

基于 Dynamic 2.0 技术,重要层动态保留高精度 🔥4-bit 模型体积仅 4.2GB,兼顾画质与效率 支持文生图与RGBA透明图原生生成!(对了 NSFW 依旧支持) Mac 16G 玩家可以搞起来了!✌🏻 为所欲为!

在 X 看原帖 ↗
3.0万16180228
新品发布 · @BuildwithOmkarr▲ 2.9万

BuildwithOmkarr开源OpenMausBot 可自托管多AI智能体

可在自己设备部署,能调用浏览器、终端、桌面,支持对接你已有的各类AI模型和日常应用,可自己掌控部署和数据

🎉 推出 OpenMausBot。

这是一个开源、可自托管的AI智能体团队,而不是另一个被框定死的助手。

• 可使用电脑:浏览器、终端、文件和真实桌面
• 可连接你日常使用的各类应用
• 目标、日常任务和进度持续推进
• 同时适配移动端和网页端

支持 @claudeai 、@ChatGPT 、@grok 、@cursor_ai 、@NousResearch 、@Alibaba_Qwen 、@Kimi_Moonshot,以及你拥有的任何框架或模型。

你的机器人。你的机器。你的密钥。

在 X 看原帖 ↗
2.9万37324397
新品发布 · @Alibaba_Qwen▲ 3.8K

通义千问发布Qwen-Audio-3.1 全线大降价

这次降价幅度最高达95%,新增了多说话人识别、情绪识别等功能,需要音频处理相关服务的开发者和创作者可以获得更低成本的工具。

阅读全文 →
3.8K168326
新品发布 · @masahirochaen▲ 1.8万

@masahirochaen发布多模态AI Jev-Omni(4)

单张H100就能跑出100ms以内的推理速度,想测试多模态AI的本地部署可以关注这个项目

【新发布】多模态AI「Jev-Omni」单模型支持4种模态,视频版的Jev非常热门。我这就去试用一下。

其他开源项目大多都缺这缺那,但这个把所有模态都整合了,推理耗时不到100毫秒。

・单模型处理文本/图像/音频/视频
・在Typed-benchmarks上达到与Jev同等水平(开发者称)
・用8块H200训练3万样本,重视数据混合
・单块H100推理耗时不到100毫秒

↓详情

在 X 看原帖 ↗
1.8万19204194
新品发布 · @NFT_Chen▲ 9.5K

开源LLM2Jev 把本地大模型转结构化决策引擎

所有数据都不会离开本地设备,能基于已有本地大模型实现图文输入做决策,新手也能跟着步骤从零上手

阅读全文 →
9.5K198489
新品发布 · @github▲ 317.8万

GitHub发布基于Rust的GitHub Copilot智能体运行时(800,000)

单个工程师配合AI智能体团队完成了核心组件迁移,还保住了代码质量。AI辅助开发的效率已经突破传统认知。

仅一名工程师加上智能体团队就将 GitHub Copilot 智能体运行时移植到了 Rust,迁移了 80 万行生产代码,同时还保持了代码质量。🚀

以下是实现过程。

在 X 看原帖 ↗
317.8万2493.8K2.5K
新品发布 · @googlegemma▲ 11.3万

@googlegemma发布DiffusionGemma-Jev一键部署方案(35-60 ms)

不需要自己买高性能GPU也能运行扩散模型,按使用付费闲置不花钱,降低了个人测试扩散模型的门槛。

部署 DiffusionGemma-Jev(djev)现在变得简单多了。你现在只需要一条命令,就能在 Google Cloud Run 上启动一个兼容 Jev API 的端点。

性能表现很不错:单步延迟约为 35-60 毫秒,批量大小为 32 时每秒可处理约 100-123 个请求。

这是一种不需要你自备GPU就能做实验的简单方法。运行成本大约是每小时 3 美元,空闲时费用会降到 0 美元。

代码和使用说明:

在 X 看原帖 ↗
11.3万2292.5K1.8K
新品发布 · @github▲ 4.4万

GitHub Copilot 新增两款GPT-6模型

日常编码可以选轻量低价的GPT-6 Luna,交互开发选平衡款GPT-6 Sol,编码需求能按需选模型了

📣 @OpenAIDevs 的 GPT-6 系列正在 GitHub Copilot 中扩张,现已新增两款通用可用模型。

☀️ GPT-6 Sol:适用于交互式和智能体编码的均衡模型。

🌕 GPT-6 Luna:轻量、高性价比模型,适用于小型任务,是该系列中成本最低的选项。

你可以在 GitHub Copilot 应用或 @code 中试用它们。

在 X 看原帖 ↗
4.4万2225725
新品发布 · @github▲ 5.4万

GitHub Copilot 现已支持 Anthropic Claude Opus 5.5

在GitHub Copilot上就能体验Claude Opus 5.5,处理多步骤任务更高效,开发日常工作可获得更强AI支持。

🚀 AnthropicAI 的 Claude Opus 5.5 现已在 GitHub Copilot 全面可用。

我们的早期测试表明,它在效率方面表现突出:它在任务解决能力上可媲美 Claude Opus 5,同时所需的步骤和 token 显著减少,并且能在多步骤任务中快速恢复错误。

你可以试用它来进行智能体编码、长期运行智能体任务以及知识工作。你可以在 GitHub Copilot 应用、CLI 和 @code 中找到它。

在 X 看原帖 ↗
5.4万2624816
新品发布 · @higgsfield▲ 94.2万

Higgsfield上线 Claude Opus 5.5,降价提速

需要大模型做产品的开发者,可以在Higgsfield平台用上更便宜更快的Claude Opus 5.5了。

我们推出Higgsfield × Claude Opus 5.5。

Anthropic的最新模型现已在Higgsfield上线,它比Opus 5便宜40%,速度快30%以上。

将Opus 5.5与Higgsfield MCP搭配使用,就能把你最宏大的想法转化为完整的产品。

现在通过Higgsfield MCP的Claude以及Higgsfield超级计算机均可使用。

在 X 看原帖 ↗
94.2万171780443
新品发布 · @yonasbe▲ 1.0万

starslingdev 获300万美元融资推出代码审查工具

如果你是需要做代码审查的开发者,这款依托 GitHub Actions 的原生智能代码审查工具可以帮你自动化完成审查流程

今天我们宣布完成了种子轮前融资,并且推出了一款新产品:@starslingdev Review Runners——这是使用你的模型密钥、团队技能与脚本,以及你指定审核者的代码评审智能体,全部都运行在 GitHub Actions 中。

我们从 @BessemerVP 和 @ycombinator 处融得了 300 万美元,目标是让代码验证全面适配智能体原生架构。

代码 → 验证(持续集成 + 代码评审)→ 生产上线

在 X 看原帖 ↗
1.0万238224
新品发布 · @digitalocean▲ 78.0万

DigitalOcean 推出托管智能体公开预览服务

开发者可以在这里运行 Claude Code、自定义 LangGraph 智能体,闲置时会暂停运行,还可选择75种以上模型,统一结算账单。

DigitalOcean 托管代理现已开启公开预览。在空闲时会暂停的运行环境中运行 Claude Code、Codex 或你自己的 LangGraph 代理。

将其工具放置在一个受管控端点后,可从 75 多种开源和专有模型中选择。一个云端,一份账单。

博客中有入门提示。

在 X 看原帖 ↗
78.0万2.0K738423
新品发布 · @MidcenturyAI▲ 16.5万

MidcenturyAI / Midcentury发布物理AI数据与仿真基础设施($15M)

想要把机器人从演示落地到实际应用,现在有了新的数据和仿真工具支持,有望推进物理机器人领域落地。

我们推出Midcentury,正在为实体AI搭建数据与模拟基础设施。

现在,我们结束隐身模式,完成了1500万美元种子轮融资,目标是把机器人技术从精心打磨的演示阶段推向规模化应用。

我们已经为前沿实验室提供支持:

→ 全球最大的第一视角数据集:超过200万小时数据,覆盖50多种环境,包含超过2万个任务

→ Matrix:前沿模拟平台,借助我们的真实世界数据实现扩容,能够大规模评估和后训练策略。

在 X 看原帖 ↗
16.5万197669234
新品发布 · @OpenAI导语出处▲ 379.1万

OpenAI发布两款GPT-6模型 API降价50%

大规模使用大模型的开发者可以直接获得更低成本,规模化部署AI项目的投入门槛降了一半。

请欢迎 GPT-6 Sol 和 GPT-6 Luna 加入 GPT-6 宇宙。

GPT-6 Sol 和 Luna 基于 GPT-6 Astra 的技术进展构建,将 GPT-6 Astra 的大部分优势整合进更快、成本更低的模型,以支持大规模工作场景。

我们还优化了缓存和推理的效率,并将节省的成本直接传递给你:相比 GPT-5.6 的促销定价,Sol 和 Luna 的 API 价格降低了 50%。

在 X 看原帖 ↗
379.1万3.5K3.7万4.5K
新品发布 · @firecrawl▲ 15.9万

firecrawl发布Alexandria 知识库($75M)

想要构建超级智能,先得有足够大的高质量知识库。拿到大额融资的团队打算拼出全球最大的知识库,给AI代理提供即时数据支持。

我们推出了 Alexandria。我们在由 Smash Capital 领投的 B 轮融资中筹得了 7500 万美元,用以构建面向超级智能的全球最大知识库。 它可为你的智能体提供增强能力,让它们即时访问最强大的数据集和提供商。

在 X 看原帖 ↗
15.9万62757559
新品发布 · @gen_instinct▲ 1.2万

@gen_instinct发布InstinctFlash开源物理AI运行时

端到端机器人策略和动作模型在设备端运行速度慢,这款工具支持在单块消费级GPU上实时运行8个模型系列的通用模型,能提升机器人端侧推理速度

InstinctFlash 是一个统一的开源物理 AI 模型运行时,可用于快速高效推理。

端到端机器人策略无法部署在边缘设备上。视觉语言模型(VLA)在设备上运行已经极慢,而权重平均模型(WAM)速度更慢——仅为一次动作去噪单个片段就需要 20-50 步。

InstinctFlash 允许你在单个商用 GPU 上实时运行来自 8 个模型家族的通用模型。

在 X 看原帖 ↗
1.2万891107
新品发布 · @DJiafei▲ 6.5K

@DJiafei发布Grounded Action Model (GAM)

现有语言和视频模型做机器人基础受到质疑,新范式先定位再学动作,关心机器人技术进展可以了解新方向。

VLA?WAM?语言模型和视频模型真的是机器人学的合适基础吗?

今天向大家介绍Grounded Action Model(GAM):一个全新范式,在预训练3D接地模型之上构建机器人基础模型。

先接地,再学习行动。🧵

在 X 看原帖 ↗
6.5K17171122
新品发布 · @arakharazian▲ 4.4万

Ramp AI Index 发布重大更新 每周更新

关注AI模型使用成本统计的人,可以现在看到按token和用量统计的数据,后续还会推出团队用量统计。

我们刚刚推送了Ramp AI Index的一次重大更新。

本次更新已正式上线:除份额和代币计数外,还新增了代币和支出总量统计。数据每周更新。

支持按模型查看,包括开源模型。

未来还会推出更多功能,包括基于团队的支出统计。

在 X 看原帖 ↗
4.4万1512962
📰 行业动态
行业动态 · @LearnWithBishal▲ 3.4万

小米开源 MiMo V2.6 Pro 评分仅次 GPT-5.6 Sol

在AI榜单上,这个开源模型得分追平了Grok 4.7,比 Qwen3.8-Max等模型排名更高,单任务成本仅0.13美元,远低于同得分的Grok 4.7。

🚨 小米新开源模型悄然攀升至AI排行榜前列。

MiMo V2.6 Pro在人工分析智能指数上得分46,成为目前该榜单上排名最高的开源模型,仅落后GPT-5.6 Sol一分。它的排名还领先于以下模型:
→ Qwen3.8-Max
→ Kimi K3
→ GLM-5.3

而且它不只是在智力测试上竞争力强。在成本方面,它每个智能指数任务的成本大约为0.13美元。

参考信息:同一天发布的Grok 4.7得分也是46,但AA给出它的成本是,高推理任务每个2.73美元,极高推理任务每个3.74美元。

MiMo V2.6 Pro是全多模态模型,设计用于:
• 复杂研究
• 长程推理
• 科学工作流
• 网络安全任务

小米表示,性能提升来自后训练自改进系统,而非修改预训练基础。

基准测试结果很强,但真正的考验是开发者实际能用它获得什么。

#AI #OpenSourceAI #LLM #Xiaomi #MiMo

在 X 看原帖 ↗
3.4万18175114
行业动态 · @GoSailGlobal▲ 9.1K

牛津AI团队开源免费this-that-model-1.0决策模型

最近Jev关闭注册,这款同功能的开源模型提供完全免费的API,还支持自行部署,可替代付费服务

发现了一个跟 Jev 对标的决策模型 来自牛津 AI 团队研发的 this-that-model-1.0模型

背后公司 做去中心化 AI 基建(联邦学习 + 区块链),拿过以太坊基金会学术资助,跟 UNDP、通义千问合作,融了 $11M 开源,而且 API 完全免费

它是一个 typed decision model:你给一段上下文 + n 个选项,它一次前向传播返回选择和校准过的置信度;31ms,零输出 token,格式错误在数学上不可能发生。

跟 Jev 的区别:
- Jev 是商业 API,按 token 收费
- this-that-model 在官网API注册使用,input/output/cache 竟然全部免费,注册拿 API key 就能用
- 你还能自己部署,MIT 开源

用法跟 Jev 一模一样,任何「从 n 个选项里选一个」的场景,一次前向传播可以同时回答多个问题

1️⃣ 意图分类 2️⃣ 内容审核 3️⃣ 风险分档 4️⃣ 路由决策

最近Jev又关闭注册了,this-that-model-1.0在官网即可获取免费API 👇

在 X 看原帖 ↗
9.1K86649
行业动态 · @StockMKTNewz▲ 2.6万

亚马逊、AWS、Anthropic发布Seller Assistant 智能AI助手(24/7)

对做亚马逊第三方生意的卖家来说,这款依托Claude的AI助手能7×24小时自动完成库存、定价、广告等运营工作,帮卖家省出手动处理这些事务的时间精力

阅读全文 →
2.6万912719
行业动态 · @agent_wrapper▲ 3.8K

开源克劳德代理编排工具作者加入创业项目

你做个人开源项目感到孤独的时候,能找到同路人一起推进项目。这个工具已有上万开发者使用,管理十万以上代理。

我即将加入位于旧金山的 Solo Founders Programme (@solofounders)!

八个月前,我为自己开发了一个编排 Claude Code 智能体的工具。当时同时运行 30 个智能体看起来还很离谱,现在它很快就变成了常态。

@ao_build 从我为自己打造的工具,变成了已经有超过一万名开发者使用、管理超过十万个智能体的项目。

虽然我是个独立创始人,但这段旅程我从未觉得孤单。从第一天开始,AO 就是一个由社区驱动的开源项目。但创业过程中有些事情,只有其他创始人才能理解,如果没有懂你处境的人,你很难坚持下去。

现在我将和一众优秀的创始人一起,在 Solo Founders 基地生活和开发。一起做独立创始人,出发吧!

在 X 看原帖 ↗
3.8K1514820
动态 · @bindureddy▲ 1.5万

测试显示前沿大模型推出无意义 开源或年底追平差距

经过一些测试,前沿模型的这次发布完全说不通——GPT 6 Sol 更便宜,但糟糕得多。

Opus 5.5 听起来更正常,但算不上智能上的飞跃。

如果闭源实验室停滞不前,开源就只会更快追上来——到今年年底,两者差距将缩小到零。

在 X 看原帖 ↗
1.5万719715
动态 · @bojie_li▲ 1.2万

《深入理解AI Agent》Web阅读版更新为Astro样式

《深入理解 AI Agent》的 Web 阅读版更新成了 Astro 样式,比之前漂亮多了,对移动端也更友好了!感谢社区 whanyu1212 的贡献。

在 X 看原帖 ↗
1.2万26187235
动态 · @xhdweb3▲ 1.0万

AI Agent自动支付需关注可审计可回溯

让系统自动付款不难,难的是出问题时知道谁授权的、触发了哪条规则、钱最后去了哪儿。对 AI Agent 尤其如此。据项目方披露,@Polyflow_PayFi 关注预算、权限和完整审计,让机器支付不只是自动执行,也能被回溯和复核。

没有审计的自动化,只是把风险跑得更快。这事看着像技术升级,实际影响的是每天重复发生的操作。机器之间未��可能按次买数据和算力,交易频率比人工采购高得多。

传统报销太慢,裸钱包又缺部门预算、用途标签和审批轨迹,所以中间需要一个能执行规则的账户层。真正的门槛不是演示一次自动支付,而是高频跑起来之后,还能对账、追踪、撤销权限、处理异常。机器速度可以快,企业治理不能因此被绕过。

计划中的功能也不等于已经全面可用。最后还得回到真实使用:资金路径短没短,信息丢没丢,出异常能不能快速找到责任和解决方式。#审计 #AIAgent

在 X 看原帖 ↗
1.0万1153
动态 · @QwenDevs▲ 1.4万

通义千问音频技术栈覆盖全流程,多组件升级新模型加入

通义千问音频技术栈现已覆盖完整工作流程,从语音识别、实时对话到语音合成和音频创作。

ASR、TTS 和 Realtime 全部完成升级,ASR-Next 和 TTS-Next 现已加入产品系列。

一共五个模型,足以支撑各类开发。

在 X 看原帖 ↗
1.4万1422684
行业动态 · Hacker News▲ 319

分析Claude Opus 5.5各维度表现

如果你日常使用 Claude 大模型,这份来自社区用户的综合分析能帮你更了解这款产品的实际表现。

社区讨论:有人补充了不同推理等级设置的对应页面,并提到max推理等级生成SVG时两次都遇到了128000token令牌配额不足的问题。多数人认可新版Opus任务成本比旧版降低一半,也有人指出相同性能区间里,Opus 5.5价格仍比竞品更高。不少人质疑现有的评测排名和基准测试有效性,有人指出模型厂商会先放出高质量模型吸引用户,之后悄悄降配,还有人吐槽现有排名把表现很差的Opus 5排在Astra前面,结果不可信。

也有人提到,闭源旗舰只比开源模型好一点,但定价要贵一百倍,长期来看市场会更偏向够用的开源模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · OpenAI 开发者社区▲ 39

OpenAI 征集插件开发者分析需求

正在做OpenAI插件开发的开发者可以参与讨论,反馈你需要的分析功能,帮助OpenAI优化插件开发体验。

嘿各位!我是 OpenAI 负责插件开发者体验的工程师之一。

我们正在探索如何更好地展示插件分析数据,我希望听听你们的想法。

目前你们觉得缺了什么:使用数据、工具错误、延迟、用户反馈,还是别的?

告诉我们你希望看到什么。具体的例子会尤其有用。

在社区看讨论 ↗
行业动态 · @CoinMarketCap▲ 2.4万

OpenAI提出AI安全全球协调标准

前沿模型能力越来越强,行业安全协调已经提上日程,普通用户也能受益于更安全的AI发展环境。

最新消息:⚡️ OpenAI 就 AI 对齐与递归式自我改进提出了全球标准,随着前沿模型能力不断提升,敦促该行业在安全方面开展协作。

在 X 看原帖 ↗
2.4万246
行业动态 · @sleepy0x13▲ 3.1万

国内大模型集体返工预训练,万亿参数输1%小模型

原来堆参数堆算力就行,现在发现训练数据质量差会让大模型效果大打折扣,关注后续哪家厂商敢公开自己的数据工程质量。

阅读全文 →
3.1万78862
行业动态 · @riyazmd774▲ 6.3万

MiMo发布V2.6 Pro,相同性能成本仅1/20

相同AI测评分数下,MiMo V2.6 Pro单任务成本仅为同分数Grok 4.7的约3.5%到4.8%,且比前代性能翻倍价格不变。

阅读全文 →
6.3万226810
观点 · @myanTokenGeek▲ 7.5K

AI编程崛起后,非技术人开始跟不上AI进展了

吴恩达建议所有人学编程避免AI时代掉队,有博主提到,2025年AI编程成为发展焦点后,原本跟进AI进展的非技术人开始掉队。

阅读全文 →
7.5K24235
产品发布 · @AnthropicAI导语出处▲ 60.9万

Anthropic发布Claude Opus 5.5,被认为解决了AI瞎写问题

有人拿到新模型试用后,觉得这次更新终于补上了AI输出内容质量差的老毛病,经常写长文的创作者可以留意新版本表现。

刚刚消息:对 Claude Opus 5.5 的初步反馈显示,Anthropic 可能终于解决了 AI 的“垃圾写作”问题。

Claude Opus 5.5 现已开放使用。

在 X 看原帖 ↗
60.9万6921.2万1.3K
开源 · @Lonely__MH▲ 1.6万

网易有道开源Confucius4-R2T2 实时流式语音大模型、T3PO 流式翻译模型(1.7B)

网易有道开源的实时流式语音大模型和流式翻译模型,刚发布就拿下HF ASR和翻译细分趋势榜的第一名。

阅读全文 →
1.6万25202233
商业 · @MSX_CN导语出处▲ 839

Meta的Muse AI Agent登顶苹果美区免费应用榜第一

Agent能力越强,调用工具和代码越多,CPU需求就越大,这条算力链正在变长,谁能先吃到这波增量还不好说。

🤖 $META 的 Agent「Muse」冲上苹果美区 iPhone 免费应用榜第一, 这也让市场重新看到了AI Agent背后的CPU需求。📊 Agent 越能干,浏览器、代码和工具调用越多,CPU 的活���跟着变多。从 x86、Arm 到云厂商自研 CPU,这条算力链正在变长。

🤔 $AMD 、 $INTC 、 $ARM ,谁会先吃到这波 Agent 增量?#AI

在 X 看原帖 ↗
839831
产品发布 · @Context7AI▲ 5.7K

Context7AI推出面向编码代理的文档搜索API

只需要一次GET请求就能拿到官方文档片段,文档还经过提示注入检测,比普通网页搜索更适合编码代理使用。

现在推出 Context7 Search:面向编码智能体的接地 API。只需一个 GET 请求,就能获取文档片段。

和网页搜索不同:
• 官方文档,由库维护者管理
• 已扫描提示注入与恶意软件
• 快速且 token 高效

在 X 看原帖 ↗
5.7K159146
模型发布 · @FrontiersMind▲ 5.6K

FrontiersMind发布Lumma-fev-0.6B 决策模型(0.6B)

输入文档和一组指定类型问题后,模型会返回每个问题对应的概率结果,用于决策场景。

我们很高兴推出 Lumma-fev-0.6B,这是一个基于我们从零搭建的 Lumma-0.6B-Base 微调得到的类 Jev 决策模型。

你向它输入一份文档和一组分类问题,它就能在一次前向传播中为每个答案返回概率。它不生成文本,因此无需解析,也不会产生幻觉。

它专为路由、分诊、内容审核以及任何需要决策而非生成段落的工作流打造。

这仅仅只是开始,我们计划在未来几天内开源 4B 和 9B 版本,并附上详细的基准测试报告。

在 X 看原帖 ↗
5.6K21110128
模型 · @xiangxiang103▲ 6.6K

网易有道发布AI模型

同时超过语音识别赛道OpenAI、NVIDIA的模型,和翻译赛道腾讯、Google的模型,突然冲到Hugging Face前排

阅读全文 →
6.6K2495122
产品 · @alanchen▲ 1.7万

Meta的AI打电话功能,部分实际由真人处理

用户以为AI自己在对接订餐、改账单这些事,测试阶段有些场景还需要人类后台接管

阅读全文 →
1.7万35420
价格 · @oran_ge▲ 3.4万

GPT 6更新后Sol和Luna价格直接砍半

测试表现超过Opus 5,成本只需要后者的9%,原来的Terra档位被移除了

GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,并且学会了说人话,而 Terra 消失了。

GPT 6 Sol 和 Luna 使用了与 Astra 类似的训练方法,能力更强,对齐更好,价格更低。

在 AutomationBench中,GPT 6 Sol 的表现超越了 Opus 5 的同时,只用了其 9% 的成本,便宜10倍。

GPT 6 Sol 和 Luna 的语言风格和 Astra 相同,表达更清晰,黑话更少,言简意赅,减少不必要的细节。

GPT 6 Sol 在 OSWorld 2.0 等某些指标上不如 GPT 5.6 Sol,这是需要注意的。

OpenAI 这次还特别改进了缓存机制,实现了更高的缓存命中率(他们终于学会了ds的技术)

同时 A 社也在今天发布了 Opus 5.5,象征性地降价了 20%,缓存降价了 60%,在 Agent 任务中,综合下降约 40% 。

我们终于迎来了大模型的大降价时代,感谢竞争,感谢 DeepSeek 和 GLM,请不要停,请继续降。

在 X 看原帖 ↗
3.4万610923
企业应用 · @iwashi86▲ 4.4K

公司全司用Claude Code后搭了AI代理基座

工具迁移后本地处理大量任务变得困难,参考同行方案做了多AI代理并行运行的基础架构

阅读全文 →
4.4K36163
代理 · @justoutquan▲ 7.9K

justoutquan发布WebMCP Registry开放索引

原本计划内部使用,现在公开给AI代理获取实际工具能力,比如搜索航班这类操作

我们本来打算把这个项目放在 Tomo 内部使用,但现在决定公开推出:欢迎了解 WebMCP Registry,这是一个开放网站索引,收录了提供AI agent可用真实工具的网站,比如说“搜索航班”或者“加入购物车”,因此AI agent可以直接使用网站功能,而不需要一步步点击操作。

我们已经在真实浏览器中加载了排名前10万的网站,并记录了它们注册的每一个工具。我们每天都会重新检查这些工具。

在 X 看原帖 ↗
7.9K9119105
语音 · @ArtificialAnlys▲ 1.6万

ArtificialAnlys发布多语言文本转语音竞技场排行榜(9 languages)

以往语音模型比拼大多围绕英语展开,这次比较主流模型在9种非英语语言上的表现

阅读全文 →
1.6万1214524
技术观点 · @NathanFlurry▲ 2.1万

有人说在沙箱里跑AI代理生产方案不对

理论上操作很简单,放到生产环境后,沙箱的影响范围会直接变成AI代理的影响范围

这种方法是错的。在沙箱内部运行代理,理论上很简单,但是在生产环境中,沙箱的影响范围就会变成你的代理的影响范围。

举个例子,以 DigitalOcean 的架构来说:
- 沙箱崩溃/内存不足 → 代理循环随之死亡
- 磁盘占满或环境损坏 → 代理变砖
- 将你自己的 API 暴露为工具 → 需要额外基础设施
- 凭据不能存放在沙箱里 → 需要一整套凭据代理层
- 休眠的沙箱无法自行唤醒执行定时任务
- 更新代理代码 → 需要更新每台虚拟机上的二进制文件
- 监控 → 沙箱必须自己上报故障

不如将执行框架与沙箱分离:
- 在你的后端运行执行框架
- 将沙箱暴露为工具
- 将凭据、历史记录和权限保存在外部
- 只在需要时唤醒沙箱

Amp、Vercel Eve、Cloudflare Flue、Claude Managed Agents 和 OpenAI 的 Agents SDK 都采用这种架构不是没有原因的。我已经写了更多相关内容,介绍为什么这么做以及怎么做:

在 X 看原帖 ↗
2.1万14222240
行业动态 · Hacker News▲ 101

网友质疑OpenAI解错了纳维-斯托克斯问题

OpenAI此前发布了AI求解流体问题的成果,这项争议直接影响AI在工业流体模拟领域的应用方向。

社区讨论:多数人认为OpenAI没有解错问题,它没有解决难度最高的无外力版本,但给出了克莱千禧年问题表述中明确允许的有外力版本。部分网友指出《科学美国人》称大语言模型利用了题目表述漏洞的说法是哗众取宠,也有人认为这是题目本身表述不严谨,利用规则漏洞本就是数学解题的常用方式,还有人认为这件事体现了AI需要人类介入纠错,本质就是AI只会严格按要求执行,不会理解出题人本意。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 67

JetBrains推出JetBrains Air智能开发产品体系

做开发不用挨个配工具,全套智能开发工具已经成套推出,日常开发流程可以直接用这套体系走通

社区讨论:多数付费老用户不满JetBrains IDE近年资源占用过高,WebStorm编辑Markdown文件单按键就会让风扇狂转,IDEA添加新工作树时会持续卡住索引,不得不频繁重启IDE恢复系统资源。不少用户称很少用到JetBrains的AI相关产品,质疑其在AI领域投入烧钱却没做出竞争力,也有人认为JetBrains个人定价合理,希望其能在智能开发领域取得成功。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 39

grigy发布面向家庭使用的AI代理CC

普通家庭终于有了专为自身需求打造的AI工具,不用再适配面向办公或开发者设计的通用AI产品

社区讨论:多数开发者都认为谷歌这款产品命名糟糕,CC是多个常见通用缩写,会造成混淆,还和谷歌最大竞品的产品缩写撞名,不提前定义缩写显得非常不专业。不少用户不信任谷歌的新产品持续性,吐槽谷歌关停过很多用户喜爱的服务,还有人质疑这款产品不值得用户把家庭隐私交给谷歌,也不认可它的核心使用场景。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 34

ZaharaHussain发布ai·rete·rag决策AI工具

原本需要可审计的决策,常把大模型放在核心再补规则,现在这个工具让规则先做决策,AI只负责生成解释

你好 HN,我开发了 ai·rete·rag,因为我一直看到团队让 LLM 负责需要审计的决策(贷款、欺诈、临床分诊),之后才匆忙加上“护栏”。

它改为把二者串联运行:

1. 纯 Python Rete 引擎根据你的事实评估 YAML 规则。结论只来自这里。相同事实总会得到相同结论,并基于优先级解决规则冲突。

2. RAG 从你自己的政策文档中检索段落,再由 LLM 生成直白易懂的……

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · @OpenAI▲ 31.3万

OpenAI 提出四个优先的AI安全独立评估领域

对于关注AI安全发展的人来说,这是头部AI公司首次公开开放全流程评估权限,能帮助发现未被预见的风险。

为了推进前沿探索,我们致力于支持第三方独立评估,提供训练、评估、部署全流程的深度访问权限。

这些权限可以让第三方评估者对我们的假设提出质疑,找出我们可能遗漏的风险,并就我们安全措施的有效性得出他们自己的结论。

下面我们列出四个需要深度评估的优先领域,以及严谨、安全、独立开展工作的原则:

在 X 看原帖 ↗
31.3万1312.0K219
观点 · @sama导语出处▲ 12.5万

OpenAI发了新GPT-6模型,Sam Altman说没对手

Altman认为按单任务定价计算,新模型更快更便宜,市场上没有其他产品能打,普通用户很快就能用到大批量的AI服务。

尤其是按单任务定价来比较,这才是真正重要的衡量标准,我认为目前市场上没有任何竞品具备竞争力。

我们希望人们能够大量使用AI;能够探索摆在我们面前的这场新复兴,这件事非常重要。

GPT-6 Sol 和 Luna —— 这些更快、性价比更高的模型,背后依托Astra取得的性能提升,在专业工作、事实准确性、编码、计算机使用和对齐方面都达到了SOTA水平:

在 X 看原帖 ↗
12.5万752.0K100
商业 · @ajratner▲ 3.5万

数据即服务公司SnorkelAIE轮拿了3.5亿美元估值

推出数据即服务产品后,一年里业务增长超18倍,目前累计营收已经超过3.75亿美元,AI数据服务赛道越来越热。

阅读全文 →
3.5万9430340
商业 · @ycombinator▲ 1.8万

网页爬取工具Firecrawl完成7500万美元B轮融资

这款工具能把网页转换成AI agent可用的结构化数据,已经有超过150万人在用,AI代理的数据获取需求越来越被资本看重。

祝贺@CalebPeffer、@ericciarla、@nickscamara_ 和 @firecrawl 完成 7500 万美元 B 轮融资!

Firecrawl 能将网络转换为供 AI 代理使用的干净结构化数据,目前已有超过 150 万人基于其 API 进行开发。

他们还推出了知识图书馆 Alexandria,代理可以通过它搜索实时网络、官方数据提供商,以及学术论文、开发文档和政府记录的专门索引。

当代理使用数据提供商的数据时,提供商会获得报酬,Firecrawl 计划向所有拥有值得分享的知识的人开放这一功能。

在 X 看原帖 ↗
1.8万1712224
产品 · @dylannknox▲ 1.2万

PixVerse出了新的世界模型,能用键盘操作进生成画面

多数AI视频工具只能按提示词生成片段,这个新模式允许你用方向键在生成好的数字世界里移动探索,思路和传统生成工具不一样。

#PixVerseWorldModel

大多数AI视频工具都只聚焦一件事:根据提示词生成一段视频。@PixVerse World Model 探索的是当你真正能够进入生成的世界后会发生什么。

你可以使用WASD在环境中移动,控制你的视角,探索场景,而不是仅仅从固定视角观看它。同时,提示词给了你另一种与世界交互的方式,你可以通过它影响角色、动作和周围环境。

移动和提示配合工作,让体验变得更具动态感。你不是生成一系列互不连接的片段,而是可以在生成的环境中持续探索和交互。

这让AI视频不再像传统的内容生成,而更像是一种新型的交互体验。

体验地址:

在 X 看原帖 ↗
1.2万3510975
开源 · @openclaw▲ 2.2万

OpenClaw发布OpenClaw核心的决策模型支持功能

项目邀请社区开发者参与贡献,做AI相关开源项目的开发者可以围观项目的开发思路和方向。

一切都离不开Jev!上周,@jlehman_ 为OpenClaw核心和插件推送上了决策模型支持。

来了解我们对于使用这些模型的思路,以及如何通过这个强大的新工具为改进OpenClaw做贡献!

在 X 看原帖 ↗
2.2万13239102
行业动态 · Hacker News▲ 1.1K

社区热议 Claude Opus 5.5 新模型

Hacker News 社区出现大量关于 Claude Opus 5.5 的讨论,是否有新版本即将发布值得关注。

社区讨论: 不少用户指出Anthropic上周才呼吁放缓前沿AI开发,本次就放出Claude Opus 5.5,参数和性能更新都说明没有践行放缓承诺。测试者发现新版模型输出更清晰,把重点内容前置,解决了旧版输出冗长难以理解的问题,高推理等级能输出正确结构的图形,但最高等级会触发输出token上限无法完成生成。还有用户提到新版定价相比旧版有所下调,更多人期待同更新的Haiku 5.5能带来合格的快模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 1.0K

Hacker News 网友讨论GPT-6 Sol 和Luna

OpenAI官方从未发布GPT-6系列,但社区已经开始提前讨论,想体验下一代GPT的人可以关注相关进展。

社区讨论:多数人认可OpenAI本次降价幅度,GPT-6 Sol和Luna比前代降价50%,Luna仅一半价格,有人评价这个定价“ positively insane”,也有人表示看不懂为什么没有GPT-6 Terra。有开发者提到对前代5.6 Sol使用体验很好,担心升级后不如旧款顺手,还有开发者担忧行业发展会影响自身职业前景。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 597

网友讨论X公司新模型Grok 4.7

关注X大模型更新的人可以看看社区讨论,有没有新的功能和性能变化值得期待。

社区讨论:多数体验过Grok的用户认为它表现很差,个人体验上不如Claude、ChatGPT等竞品,能力、价格各维度都没优势,还有用户提到它价格昂贵,负面政治关联多,也有人表示没见过有人用这款模型,质疑它的存在价值。只有少部分用户分享了测试数据,还有人询问订阅版和API的价格对比。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · OpenAI 开发者社区▲ 106

openai-community发布Codexometer工具

无需反复在当前Codex工作会话打开/status页面,就能随时查看配额、用量等信息,不会打断当前工作流程。

Codexometer 是一个适用于 Codex 的小型复古终端仪表盘:显示实时额度、会话监控、令牌使用历史和模型基准测试。

把它放在第二个终端窗口或窗格保持打开,就能查看每个活跃额度窗口、剩余容量和重置时间,无需在你正在工作的 Codex 会话中反复打开 /status。

为什么要用它?/status 很有用,但它只能存在于你正在工作的会话内部。Codexometer 无需中断工作就能让额度始终可见。

在社区看讨论 ↗
行业动态 · OpenAI 开发者社区▲ 17

openai-community 讨论 GPT Image 缓存问题

重复使用同一张参考图生成内容,却始终没有消耗缓存的图片输入额度,这会直接影响使用成本。

我现在在用 gpt-image-2 和 gpt-image-2.5 生成带插图的故事,我发现就算反复复用同一个角色参考图,也不会计入缓存的图像输入用量。

我们的流程是:调用 `/v1/images/edits`,通过 `multipart image[]` 上传参考图。每个请求使用相同的参考图二进制数据,但场景提示词不同。

有些请求是并发运行的,另一些则是顺序执行:我们先生成封面和第一页预览,之后再生成剩下的页面。

在社区看讨论 ↗
行业动态 · OpenAI 开发者社区▲ 15

Codex CLI 0.155.1中GPT-5.6 Luna消失

使用Codex CLI时遇到相同问题的开发者,可以参考分享的排查过程,节省解决问题的时间

大家好,我今天遇到了一个 Codex CLI 的奇怪问题,想把排查过程记录下来,万一其他人也遇到了相同问题可以参考。

## 环境
- Codex CLI:`0.155.1`
- 操作系统:Linux
- 受影响模型:`gpt-5.6-luna`

之前 `/model` 里还能找到 GPT-5.6 Luna,但后来它突然从模型选择器里消失了。可见的模型列表包含这些模型:
- GPT-6-Astra
- GPT-5.6-Sol
- GPT-5.6-Terra
- GPT-5.5
但就是没有 GPT-5.6 Luna。
---

## 1.

在社区看讨论 ↗
💡 深度观点
深度观点 · @MoureDev▲ 5.1K

开发者聊软件企业用AI的两种极端

身处软件行业,可对照自家企业对AI的使用方式,判断是否缺少有判断、有管控的AI使用流程。

在软件公司中,我看到他们在人工智能应用上存在两个极端:
- 一些公司几乎不用人工智能(或者仅限于从 ChatGPT 复制粘贴内容)。

- 另一些公司购买了 Claude Code,并且要求团队不惜一切代价不停产出,甚至不做检查。

两种情况都缺少同一个东西:带着判断和控制去使用人工智能的流程。

在 X 看原帖 ↗
5.1K1211712
深度观点 · @rasbt▲ 2.8K

开源智能体工具最大吸引力在于可检查

在意AI在本地设备上的行为是否可控,可检查的开源工具能提供闭源产品给不了的安全感。

开源智能体工具包的主要吸引力不在于它们免费,而在于我们可以检查它们在我们的计算机上正在做什么。

在 X 看原帖 ↗
2.8K5615
深度观点 · @mdshefat217▲ 621

agenticscredit在Base上打造AI智能体信用体系

这个方向打破了现有AI智能体金融模式,未来AI智能体可凭借自身交易业绩获得资本,值得观察这一新叙事的发展。

智能体AI需要的不只是更好的模型,它还需要资本。这就是为什么建立在@base上的@agenticscredit让我感兴趣。

他们的想法很简单:衡量智能体的实际交易表现,把这份交易记录转化为智能体信用评分,并以此来确定智能体是否能获得受限资本。

而Base已经有现成的金融轨道,可供智能体支付、赚取收益、交易以及与链上服务交互。因此整个大图景开始变成:

智能体 → 交易记录 → 信誉 → 信用 → 资本

这对智能体金融来说是一个完全不同的方向。长远来看,这个想法不是让AI智能体只用别人的钱执行交易,而是让智能体可以建立可验证的金融历史,并最终根据表现获得资本准入。

表示,其合格路径目前从ACS 580分开始,资金通过候补名单分配,并设有严格的风险限额。

看到团队已经接触到Base建设者和投资者让这个项目更有意思了。拥有自己金融信誉的AI智能体能成为比AI交易大得多的原语。这是我正在密切关注的Base + AI叙事之一。🔵

在 X 看原帖 ↗
62111852
深度观点 · @NFT_Chen▲ 2.6万

Claude Opus 5.5 给中国硬件设降智规则

针对中国AI硬件的定向限制已经写入大模型产品规则,使用非美系AI加速器调用模型会被主动降智。

🤔Dario 把对中国蒸馏防线写进了 Opus 5.5 文档,不是演讲,是写进产品规则! 🔸首个会因“前沿大模型研发”降智的 Opus 🔸官方例句就一件事:给某些 ML 加速器写 kernel 🔸一触发,5.5 立刻掉到更弱的 Opus 5 🔸再加“保留思维”:锁死上下文,防你改前文抽出推理 🔸话术是安全,效果是谁碰非美系加速器谁变笨 🔸护栏给模型,降智给用户,指向给中国硬件 #Opus55 #Claude #Anthropic #DarioAmodei #保留思维 #芯片战争 #中美AI

在 X 看原帖 ↗
2.6万83821
深度观点 · @gregisenberg▲ 1.3万

近三周AI进展飞快,现在是创业好时机?

近三周已有多款AI模型和Agent API推出,个人代理和语音AI进展飞快。市场机会打开速度快于填补速度,现在是史上套利空间最大的时候。

我觉得非常有意思,居然有这么多人认为现在不是创业的好时机。

Grok 4.7、GPT-6 Sol/Luna、Opus 5.5、Astra、Gemini 3.8 Live、Muse、Instinct、Jev、智能体API等等,这些都是过去三周里出现的成果,个人智能体/语音AI领域进展神速。

因为套利的本质就是同一件商品在两个市场有不同定价,而你要做的就是切入这个差价。通常情况下你得主动去寻找这些价差缺口,因为它们非常稀有,而且一旦被人发现就会立刻被抹平。

现在不同的地方在于,这些新缺口的 opening 速度远远超过了人们去填补它们的速度。我认为现在绝对是历史上套利的最佳时机。

在 X 看原帖 ↗
1.3万1118887
深度观点 · @cyrilXBT▲ 5.5K

Jev+Claude Code能让AI代理快200倍省400倍

想要降低AI代理运行成本、提升速度的人,可以参考这套组合思路,作者公开了完整的框架图解。

只需一个提示词,Jev + Claude Code 组合就能让AI代理速度提升200倍,成本降低400倍。

秘诀就是:让代理横向拓展而非纵向延长。

我已经用三张图完整拆解了这套系统。

把它保存下来吧,以后你会用得到。

关注 @cyrilxbt 获取更多AI资讯。

在 X 看原帖 ↗
5.5K167531
深度观点 · @signulll▲ 2.6万

signulll评价OpenAI AI服务业界最优

若你选AI服务时纠结开源闭源,这个行业从业者的观点可帮你参考决策。

功归功,OpenAI 在降低高质量智能模型成本这件事上,做的可能比任何实验室都多。

开源当然重要,但如果你看全套服务的各个维度:模型质量、可用性、延迟、可靠性、不同智能等级的选择、易用性、成本,没有哪家服务商的整体方案比 OpenAI 更好。

我们一直在大量使用这些模型,体验很不错。

在 X 看原帖 ↗
2.6万1967032
深度观点 · @MelvinInvests▲ 1.8万

AI代理普及或将引发SaaS行业抛售潮

AI代理会成为用户操作软件的主要界面,削弱传统SaaS公司客户锁定,降低定价权,影响整个行业估值,普通用户也会感受到使用体验变化

阅读全文 →
1.8万2214482
深度观点 · @sama▲ 8.8万

OpenAI 对自家API未来发展提出愿景

对依赖OpenAI API做开发的人来说,这个方向意味着未来会有适配不同需求和预算的更多选项,好想法有更多落地空间。

我们希望 OpenAI API 在每个价格点都拥有最好的模型,并且在每个模态(文本、代码、图像、视频等)都做到最好。

然后我们希望所有人都能提出精彩创意并将其落地,成为满意的用户。最好的创意一定来自你们所有人。

在 X 看原帖 ↗
8.8万812.0K83
🛠 工具产品
工具产品 · @aiaicreate▲ 1.6万

@aiaicreate发布修复Qwen Image 2.1生成bug的LoRA

搭配推荐工作流使用,可解决Qwen Image 2.1的大部分生成问题,还有与原模型效果的对比图,对使用通义千问文生图的用户有用。

Qwen Image 2.1 图像生成问题的修复 LoRA 现已发布。

配合推荐设置的工作流使用,可以解决大部分生成问题。

还提供了未应用(原生)状态的对比图。

#QwenImage21 #LoRA 链接在评论区⬇️

在 X 看原帖 ↗
1.6万23263404
工具产品 · @nutlope▲ 1.3万

@nutlope 推出开源大模型对比工具

想换用开源大模型降低成本,可以用这个工具对比不同场景下不同模型的成本和效果,帮你找到最合适的选择。

帮助你找出哪款开源模型最适合你的使用场景。

可以跨编码、智能体、长上下文、视觉、金融等多个领域对比模型。

你还能查看它们在成本和质量上的对比,包括转用开源模型可以为你节省多少开支。

在 X 看原帖 ↗
1.3万10189151
⚡ 实战经验
实战经验 · @vista8▲ 4.1万

大厂用AI开发,工作量一月缩成一周

效率提升后压缩了项目周期,但从业者的劳动强度并没有降低,反而更累了,可以看看AI对一线工作节奏的真实影响。

中午见了还在��厂工作的产品经理,他说现在越干越累。有些新项目都不写PRD了,和研发一起vibe coding,一天提交仓库代码7~8次。第二天和研发碰头讨论迭代。

研发一开始还自己review代码,后来实在看不���来,都交给模型测。效率确实有巨大提升,原来1~2个月的工作量,现在都是一周做完,累!

在 X 看原帖 ↗
4.1万815131
实战经验 · @MaxForAI▲ 3.2万

Minecraft之父Notch承认Vibe Coding真香

曾坚决反对AI编程的顶级开发者,几个月内态度彻底反转,说明AI辅助编程的实际体验比预想更好。

Minecraft 之父 Notch,终于开始承认 Vibe Coding 真香了😂 刚刚他在 X 上发了一条:

我得承认,我正在享受 Vibe Coding 的乐趣。 我可能有那么一点点、微乎其微地错了。

要知道几个月前他还是 AI 编程最坚定的反对者之一。 今年年初,Notch 还公开说,用 AI 写代码是个非常糟糕的主意,甚至把鼓吹 AI 编程的人骂得很难听。 7 月又发了一次:“Reject AI.”

结果一周之后,因为实在招不到满意的程序员,他开始松口,准备让 AI 帮自己做地图编辑器、节点图之类的内部工具。 到了 8 月,他已经开始说自己可能得“认错”了。 现在直接认错了🤣

这条下面 Elon Musk 直接回了个 😂。 一个亲手写出 Minecraft 的程序员,最后也开始 Vibe Coding 了。

在 X 看原帖 ↗
3.2万812040
实战经验 · @sydneyrunkle▲ 3.9K

用开源semif给开源仓库问题分类,速度远超旧模型

给开源仓库的新增问题做自动分类,现在用开源的semif,比之前的大语言模型分类器快很多,目前在监控阈值校准情况

我正在用 semif(类似 jev,但它是开源的)给开源仓库里新建的议题打标签,这样我们就能把握流行功能和我们需要投入更多精力的领域。

当前请求模型:
* 状态 —— 议题标题/正文
* 问题 —— 每个标签对应一个 Nou (原文如此)

到目前为止,我们给置信度 p>0.8 的标签打标的速度比我们之前的 LLM 分类器快得多,目前正在监测以确保我们在正确阈值上进行校准。

在 X 看原帖 ↗
3.9K73617
实战经验 · @tinkerapi▲ 6.3K

Tinker上5美元10分钟优化开放LLM新功能

低成本快速改造现有开源大模型就能做概率分类输出,降低了开发特定功能AI的成本与时间门槛

LLM 的下一个token预测本身就是一个概率分类器,因此开源LLM可以提供类似Jev的接口:输入离散选项,输出快速概率。

我们自己的@ekzhang1在Tinker上花了5美元、用10分钟运行,就把这项工作做得更好了。

在 X 看原帖 ↗
6.3K6145
实战经验 · @bojie_li▲ 5.7K

LiNan1984 将《深入理解 AI Agent》提炼为 22 个技能

想要快速掌握 AI Agent 开发,可以直接从这22个技能切入,不用通读原书就能快速上手学习。

感谢读者 LiNan1984 把《深入理解 AI Agent》蒸馏成了 22 个 skills,方便 agent 在开发 agent 的时候使用,也方便人类读者快速阅读。

在 X 看原帖 ↗
5.7K178698
实战经验 · @GitHub_Daily▲ 7.1K

斯坦福发布CS146S「现代软件开发者」课程作业(2025)

没机会在斯坦福修课的开发者,可以照着公开的8周作业自学,锻炼和AI协同开发的完整能力。

斯坦福 2025 年秋季,开了一门 CS146S「现代软件开发者」,讲怎么跟编码 Agent 一起写软件,8 周作业全部公开在 GitHub 上。

每周一个主题,从提示词技巧开始,接着给现成的小应用加功能,自己写一个 MCP 服务把外部接口接给模型。

再往后用 Claude Code 搭至少两个自动化流程、用 Semgrep 扫出并修掉至少 3 个安全漏洞,最后一周把同一个应用用 3 套技术栈各做一遍。

GitHub:
第七周的作业我挺喜欢,每个任务只给 AI 一次提示就让它写完,自己逐行审一遍,再拿自己的审查意见跟 AI 审查的结果对比。

不少作业带现成的起步项目和测试,第一周还用 Ollama 在本地跑模型。没机会上这类课的,照着 8 周作业自己过一遍,能补上不少。

在 X 看原帖 ↗
7.1K1999143
实战经验 · @RLanceMartin▲ 8.7K

分享Claude Opus 5.5 实用优化技巧

用一条指令就能自动清理提示词中拖累Claude Opus 5.5性能的无效内容,能直接提升模型使用体验

给 Opus 5.5 的实用技巧:在 Claude Code 中运行“/claude-api prompt-audit”。

这个命令会检查你的技能、agent.md、Claude.md、提示词,并移除会拖累前沿模型的反模式。

我已经用最新的 Opus 5.5 指南更新了技能。

在 X 看原帖 ↗
8.7K17207286
📌 其他
AI开发 · @dotey▲ 2.3万

复杂AI开发任务先写技术方案文档再分工协作

@dotey分享多AI角色分工开发的实操工作流

我不用 plan 模式,但是我复杂一点的会先写技术方案文档,主要是:

1. 人看看文档确保大方向有没有问题

2. Fable 写文档,文档里面写清楚技术细节和如何验证,后续 Opus 执行

3. 作为后续验收的依据,Opus 实施完,在新会话让 Fable 按照文档去验收一下

4. 一些重要文档会留档,但会保持更新

5. 有时候会在 ChatGPT 网页版用 GPT-6 Pro 访问 Repo 写技术方案文档,下载下来让 Fable 去审查再让 Opus 执行

简单来说,重点不是用 plan mode,但是用一个文档让人可以确认方向,以及后续多 Agent 协作传递上下文是很有价值的

在 X 看原帖 ↗
2.3万1390101
提示工程 · @omarsar0▲ 3.2K

Anthropic分享了一个Claude Opus 5.5长任务提示词

该提示词用于解决Claude Code长任务中模型中断问题,来自X用户@omarsar0

这是来自 Anthropic 的很棒的提示词。它在你使用 Claude Code 中的 Opus 5.5 处理长时间运行任务时,能够帮助推进任务持续进行。

显然,在长时间运行的任务中,模型有时候会停止报告结果而不继续运行。我已经注意到前沿模型经常出现这个问题。

在 X 看原帖 ↗
3.2K63335
动捕技术 · @Lina_Hoshino▲ 6.3K

揭秘动捕Station系统工作流程,PC应用将开源

开发者Discord对话透露,动捕系统各Station本地运行ML模型进行动捕

阅读全文 →
6.3K517851
云计算 · @VadimStrizheus▲ 2.0万

买Mac Mini挂AI代理的用户都白买了,云方案才是未来

DigitalOcean现已支持云端运行Claude Code和Codex,闲置自动暂停计费

为每一位买Mac Mini来全天候运行OpenClaw或Hermes Agent的人默哀 💀 包括我自己。

DigitalOcean现在可以帮你在云端运行Claude Code和Codex了。你可以合上笔记本,代理会继续工作。

它一旦闲置就会暂停,你也会停止支付计算费用。在任何设备上,它只需要大约300毫秒就能在同一会话中重新唤醒。

模型甚至永远不会接触到你的API密钥。云端代理就是未来。

在 X 看原帖 ↗
2.0万491119
软件工程 · @hraness▲ 1.0万

开发者称其软件工程工厂每天消耗50亿到100亿tokens

开发者@hraness披露,其软件工程工厂每日多模型并行处理消耗5-10B tokens

开发者@hraness披露,他运营的软件工程工厂每天消耗50亿到100亿tokens,全天24小时不间断运行。

该工厂基于@zeddotdev部署,运行了多个大语言模型:6倍Codex Astra Ultra,2倍Claude Code Fable Max,均属于@DevinAI SWE-2 Max版本。

相关内容已发布在链接

在 X 看原帖 ↗
1.0万111649
加密货币 · @familiarcow▲ 8.9K

质押Near原生代币可获得免费AI API额度,用户打造了自动化AI工作流

X用户@familiarcow分享使用Near AI的体验,通过质押获得每月约50美元API额度,自动化调用Claude Code提升效率

用户@familiarcow接触Near AI还不到一周,已经对这个平台十分满意。他选择质押Near原生代币,每月能获得大约50美元的API(应用程序编程接口)额度,这个额度还会实时持续增长。

用户使用获得的API额度搭建了Hermes,大多选用GLM 5.3模型做推理。他将这个推理模块设置为控制中心,用来调度自己已经付费订阅的Claude Max计划里的Claude Code实例,处理重算力任务。

简单任务可以免费处理,复杂任务比如数据分析、git代码仓库开发,则可以交由被调度的Claude Code完成。

用户表示,这套自动化框架让Claude Code的实用性提升了4倍,所有成本都由质押获得的额度覆盖,不需要额外付费,他对此非常满意。

在 X 看原帖 ↗
8.9K510230
大语言模型 · @superalesha▲ 2.3万

用户让Opus 5.5生成Claude模型发展史 生成了纯JS页面

用户@superalesha在𝕏分享,自己让Claude的Opus 5.5生成Claude模型发展史,后者生成了纯JavaScript页面

用户@superalesha在𝕏分享,他让Opus 5.5生成一份Claude模型发展历史。Opus 5.5用纯JavaScript(JS)生成了这份内容,全程仅依靠用户自身技能完成。

用户表示,看到其他人用Opus 5.5做出了不少成果,感觉自己的能力不足限制了这个模型的潜力。他认为需要对此做出改变。

相关内容链接附在原文分享中。

在 X 看原帖 ↗
2.3万28485404
编程 · @bcherny▲ 22.2万

开发者用Claude Opus 5.5找到Claude Agent SDK 16个bug

开发者在𝕏分享,借助AI结合形式验证工具检出多种竞态条件缺陷

我使用 Opus 5.5 借助 Lean 对 Claude Agent SDK 进行了形式验证。短短几个提示就生成了 16 个 PR,修复了各类 bug 和竞争条件。附视频。TLA+ 用起来也很不错。

我有时候会结合使用 Lean 和 TLA+ 来查找数据流、并发和状态管理相关的问题。我对这两门语言都不怎么熟练,但 Claude 对它们都掌握得非常出色。

这种方法对于对代码进行形式建模和查找人类可能发现不了的 bug 非常有用。形式验证会是编码的未来吗?(或者至少是查找 bug 的未来?)

Opus 做了一张信息图。

在 X 看原帖 ↗
22.2万1022.3K1.6K
大模型 · @steveruizok▲ 3.4万

开发者受邀测试Claude Opus 5.5,分享实际使用体验

开发者@steveruizok受邀测试Claude Opus 5.5,分享使用感受

我受邀测试了 Opus 5.5。除非你对输出质量要求极高,否则高端版本的差异很难察觉。但高要求会得到更好的回报。

如果你看不出这里的区别,或者你正在给模型做微观提示,我认为快速模型(composer、Gemini flash 等)会好得多。每当我需要做这类工作时,我都会换成这些模型。

但对于 Opus 5.5 这类模型,我一直把每个问题都当成曼哈顿计划级别的劳动组织工作来处理。就好比有一颗陨石正冲向地球,我们唯一的救赎就是让这份显微底稿保持内部一致。

我的提示一般是这样的:先创建一系列评估质量/一致性的维度,然后生成我应用里每个界面的图像,把它们放到一个 tldraw 离线看板上,再随机分组分析,找出问题并修复,直到每个界面/分组在所有维度都通过阈值。

大胆一点,发挥创意。Opus 是个怪胎,用 Opus 的感觉很好,Opus 就喜欢这样。

在 X 看原帖 ↗
3.4万9377276
AI绘图 · @LufzzLiz▲ 5.2K

主流电脑也能跑通Qwen-Image-2.1,附避坑指南

Unsloth优化后,N卡12GB就能起步,本文整理了运行避坑要点

阅读全文 →
5.2K44047
黑客松 · @blmario669▲ 428

黑客松基于 TapeOut 搭建面向AI Agent的链上权限系统

开发者首次参加 TapeOut 黑客松,推出链上权限系统 Remembrance Seal

教程 · @realfxw▲ 1.7万

Apple Silicon芯片Mac可直接用两行命令唤醒内置本地LLM

来自X平台用户分享,Apple Silicon Mac无需额外部署,两行命令就能唤醒内置本地大语言模型

阅读全文 →
1.7万746106
AI芯片设计 · @ATaylorFPGA▲ 955

不用云端 Claude 或 Codex 本地生成 RTL 电路代码

开发者在AMD AI Halo机器上用本地AI模型生成RTL代码

使用 AI 生成 RTL 越来越受欢迎,但如果你不能使用 Claude 或 Codex 这类基于云端的服务怎么办?

本周我将研究在 AMD AI Halo 设备上使用本地模型生成 VHDL 和 Verilog RTL。

这是我研究的第一部分,但到目前为止结果看起来还不错。

在 X 看原帖 ↗
9554519
开发工具 · @yupi996▲ 3.0万

用一段Claude Opus 5.5提示词复刻Cursor AI编辑器

Twitter用户yupi996称,单提示词就能完美还原Cursor双模式

我被 Claude Opus 5.5 吓到瘫坐了。。😱 一段提示词复刻 Cursor AI 编辑器,Agent + Editor 双模式完美还原。

这直接就是一个成熟的商业产品啊!

在 X 看原帖 ↗
3.0万37634
创作 · @mooncat_is▲ 118

用户称自己花了三次观察才发现所有细节都来自AI

用户@mooncat_is在𝕏发文称,发现Claude已经能掌握业余创作了

我觉得我在这里慢慢熬了一阵。我前后琢磨了三次,才真正反应过来,所有那些微小的细节、主题和创意其实都来自AI,还被精心编织成了一个连贯的整体。

我去,Claude居然已经懂业余创作了。

在 X 看原帖 ↗
1184
视频创作 · @seiiiiiiiiiiru

用Claude Opus 5.5生成视频仅花费约150日元,还可自定义修改

日本创作者分享用AI生成发布视频的经验,成本仅约150日元

亲手打关键帧这种事已经太蠢了。

这是由 Claude Opus 5.5 操作 Higgsfield 和 AfterEffects,AI 制作的发布视频。

这个视频只用到了月租 19 美元 Pro 套餐额度的 5%,所以只花了大约 150 日元就做出来了。

虽然也生成了一些素材,但基本是在 AE 里做的,所以从这里开始你还可以修改字体、调整颜色、删掉不需要的部分,想怎么修改都行。

接下来就是教给 AI 技巧和审美。广告行业肯定会出现供给过剩,所以只做那种“随处可见的内容”,作为创作者可能就无法生存下去了哦。

在 X 看原帖 ↗
教育 · @akokoi1

一线老师用Claude Opus 5.5生成教学视频仅花26分钟

来自X用户@akokoi1分享,用简单提示词就能生成5分钟的地理知识点教学视频

能用上Claude的一线教育从业者可以用AI生成教学视频。只用一段简单提示词,Claude Opus 5.5就能生成解释地理知识点“大气环流”的教学视频,耗时26分钟,生成视频时长接近5分钟,消耗的token非常少。

具体操作步骤第一步:选择一家文本转语音(TTS)厂商,豆包、智谱、海螺、千问都可以,把生成好的文本转语音文档粘贴到一个新建的md文档,例如命名为TTS.md。

然后创建。env文件,填入API密钥和其他需要调整的配置。为了安全起见,需要在。claude/settings.json文件中添加一条"deny": ["Read(./.env)"],这样Claude就无法读取你的密钥。

具体操作步骤第二步:输入提示词:“做一个动画,讲解高中地理知识点“大气环流”。风格轻松有趣,动画格式为线稿,添加合适的音乐,请务必做到引人入胜,字幕用中英双语,解说用TTS,如果 TTS 接口有关闭水印的参数就关掉,文档在TTS.md,API KEY 和音色分别是 .env 里的 APIKEY 和 VOICE,最终视频要能直接导出。”

提示词可以根据自身需求微调。

在 X 看原帖 ↗
大语言模型 · @Yuchenj_UW

用户实测Claude Opus 5.5,并未感知到性能飞跃

推特用户@Yuchenj_UW实测Anthropic Claude Opus 5.5,对比Astra模型得出这一结论

今天试用了Opus 5.5,说实话并没有觉得惊艳。

我让它研究一个我最近刚了解到的复杂问题,结果它回答错了,Astra答对了。

在编码方面,仍然是Astra体验更好。

这次测试坚定了我之前的观点:前沿大语言模型的编码能力已经进入瓶颈期。现在行业竞争越来越围绕单位算力成本的智能水平展开。

在 X 看原帖 ↗
生成式AI · @Jenny_MommaLion▲ 9.0K

用户只用角色参考图,生成了完整的AI动画场景

用户@Jenny_MommaLion 在X平台分享,仅提供角色参考就用Kling_ai Omni生成了完整动画

用户@Jenny_MommaLion 分享了使用Kling_ai Omni生成的AI动画,并附上了自己使用的提示词。该用户只提供了一张角色参考图,场景部分由Kling在生成动画的过程中自动创建。

生成的动画内容是:一名压力很大的男子在灯光昏暗的酒店房间里焦虑踱步,空气中弥漫着紧张感。男子望向窗外,城市天际线在暮色阴霾中向远方延伸,呼应了他内心的孤独感。

房间内部陈设稀疏,小桌子上散落着凌乱的文件,地板上放着一个半开的行李箱,象征着主人混乱的精神状态。角落投下柔和的阴影,让整个空间显得更加逼仄,就像快要让人窒息。

窗外的光线投下淡淡的光晕,和室内的黑暗形成对比,营造出孤独忧郁的氛围。男子的思绪像窗外的云一样,越来越沉重,整个房间都充满了被生活和工作压垮的清晰感觉。这个场景动态融入了男子的内心挣扎,压力仿佛实体化包裹了整个空间。

该用户称,本次生成使用的参考图加角色表,是在Higgs平台的Soul 2.0上制作的,相关链接:

在 X 看原帖 ↗
9.0K813560
AI生成视频 · @MohdAdnanA86218▲ 2.8K

用户用Gemini Flash生成了一段10秒AI视频,内容很惊艳

用户在𝕏分享了自己使用Gemini Flash在GeminiApp生成的10秒AI视频,本文是生成提示词与效果描述

用户在𝕏分享了一段使用Gemini Flash在GeminiApp上生成的AI视频,这是一段10秒的超逼真电影质感视频。

视频内容为:一个俊朗的年轻人独自坐在光线昏暗的复古图书馆里,阅读一本古老的奇幻书籍。他慢慢翻过一页,金色发光微粒从书页中缓缓升起。

微小的奇幻角色、城堡、魔法古树、龙和漂浮的魔法符号逐渐从书页中显现,就像一个微型3D世界被激活。这些形象不断变大,自然舒展到年轻人周围,整个图书馆也随之变成一个令人惊叹的奇幻王国。

在视频最后几秒,年轻人惊讶地抬起头,发现自己已经完全被书中走出的世界包围。视频设置了流畅的电影推镜、魔法体积光、逼真粒子效果、细节丰富的环境、戏剧性景深、自然转场,参数为照片写实、高细节、4K分辨率、电影调色,无文字、无水印。

在 X 看原帖 ↗
2.8K34324
开发 · @midudev▲ 1.5万

开发者做AI自更新网站实验,每4小时选用户idea实现

来自𝕏用户@midudev,用到Claude Code部署在服务器

我做了一个超级疯狂的实验:一个由人工智能自主开发的网站。我在服务器上安装了 Claude Code。

用户提交想法,AI每4小时选出最优方案并实现它。此外代码已经上传:

这个网站是开放给大家参观的。出于安全考虑,目前做了访问限制,无法访问数据库或创建API,但我打算完全解锁看看会发生什么。

在 X 看原帖 ↗
1.5万19288106
AI开发 · @Parul_Gautam7▲ 3.0万

用户测试Qoder AI IDE从零搭建AI项目管理仪表盘成功

来自𝕏用户Parul_Gautam7的实测分享,附推广优惠码

我刚刚给@qoder_ai_ide布置了一项真实任务:从零开始构建一个可用的AI项目管理仪表盘。我描述了最终效果,选择了Qwen 3.8 Flash,设置好权限,然后看着它规划、构建、测试和修复这个项目。

最终的仪表盘拥有可用的任务创建、状态更新、搜索/筛选、动态进度、分析功能和深色模式。在9月30日之前,运行Qwen 3.8 Flash不消耗任何Credits,所以现在可以免费使用。

来试试Qoder:先输入我的邀请码37JUWX,然后下载Qoder并登录。你将获得600 Credits:14天Pro试用的300 + 我的邀请码额外提供的300。

在 X 看原帖 ↗
3.0万5617442
大语言模型 · @techNmak▲ 6.7K

博主整理了Transformer块知识手册,从原理讲清核心组件

techNmak分享了一本从原理解读Transformer块的知识手册,涵盖多个组件特性

阅读全文 →
6.7K30153164
文生图 · @xiangxiang103▲ 4.4万

通义千问Qwen-Image解锁:提示词改写器去限制方案和新模型搭配

来自𝕏用户@xiangxiang103分享,拆解Qwen-Image原有限制并提供破解方案

阅读全文 →
4.4万44501900
视频生成 · @gaoqian2580▲ 1.2K

不用折腾ComfyUI节点,Pexo聊天就能做AI视频

博主@gaoqian2580在𝕏分享了这款聊天生成视频的AI工具Pexo

别再死磕复杂的 ComfyUI 节点和剪辑时间线了! 刚刚用 Pexo 测了条 3D 科幻预告,彻底被震撼到了! 先介绍下,Pexo 是一款能通过聊天做视频的 AI 创作工具。想做什么、画面要什么风格、哪里需要改,都可以直接跟它说。 我就像跟好莱坞导演发微信一样,把想要的画面和风格告诉它。它帮我拆分镜、生成机甲画面,再配上音效和 3D 标题,最后拿到一条能直接发布的完整成片!没写复杂的提示词,也没自己折腾剪辑时间线。 这次用下来,确实是我目前用过上手最简单的 AI 视频产品。不用先研究该选哪个模型,也不用自己搭工作流,把想法和要求告诉它,看完哪里不满意,就接着聊、接着改。 想改画面,还可以用 Mark to Fix。比如想调整片尾标题的位置,就直接在画面上圈住标题,在右侧弹出的批注框里写:“标题往上挪一点,其他画面保持不变。”提交修改后,再看调整后的效果。像给文档留评论一样,不用自己去研究一堆剪辑参数。 想给自己的作品做条预告,又不想先研究一堆剪辑工具,可以试试直接跟你的 AI 视频导演聊聊。 视频用 @Pexoai_offical 做的。

🔗 体验入口:

在 X 看原帖 ↗
1.2K11457
大模型 · @0x0funky▲ 3.6K

Opus 5.5单轮生成6分钟视频 仅消耗不到1%周额度

开发者@0x0funky在𝕏发文称,Opus 5.5的JS视觉与SVG生成能力远超预期

开发者@0x0funky在社交平台𝕏发文评价大模型Opus 5.5,称它的能力「有点逆天」。

Opus 5.5在JavaScript(JS)视觉处理和SVG生成方面能力极强,开发者猜测它训练数据中加入了特殊内容。

该开发者原本为教育机构制作教材,目前这套工作流和相关技能已经被Opus 5.5取代。

他认为个人开发者不必和大厂在模型或应用层面竞争,充分利用大厂模型的进步才是合理方向。

本次生成6分钟视频仅用不到1%的每周额度,是单轮(ONE-SHOT)一次生成。

在 X 看原帖 ↗
3.6K13614
开发 · @Manixh02▲ 3.1K

花1美元做出了通常要500美元的作品集网站

开发者Manixh02使用MiniMax Code的M3模型,仅花费1美元搭建作品集

一位名为Manixh02的开发者在𝕏平台分享,这类个人作品集通常的制作成本是500美元。他通过MiniMax Code的M3模型完成了自己作品集的搭建,总成本仅为1美元。

这次搭建用到的代理框架(harness)基于开源项目OpenCode和Pi开发。

本次使用的MiniMax Code命令行界面(Code CLI)同样是开源项目。

Manixh02评价,花费1美元就能完成这样的作品,效果还不错。

在 X 看原帖 ↗
3.1K8316

今天的 129 条信号到这里下一轮 08:00 更新

回到今日焦点回到顶部 ↑

使用技巧

把 AI 用进工作生活的实操方法 · 实测接地 · 不卖课

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →

从这些问题开始精通 AI

查看全部知识库问题 →

随便看看

把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

按主题浏览共 30 个常见主题

查看全部主题 →

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新