长勺智库长勺智库
话题文章任务
登录
LLatent SpaceLatent Space发布于 2 天前
Claude Opus 5 发布:性能接近 Fable,评测争议升温

Claude Opus 5 发布后引发大量讨论:官方称其接近 Fable,部分独立评测显示其在知识工作与编码任务中表现强劲,但基准稳定性与现实体验差异仍受关注。

340
AIAgent工程实践
340
AIAgent工程实践
LLatent SpaceLatent Space发布于 3 天前
Black Forest Labs 发布 FLUX 3 多模态模型

Black Forest Labs 推出 FLUX 3,称其以统一架构覆盖图像、视频、音频与动作预测,FLUX 3 Video 已开放早期访问。

370
AIAgent工程实践
370
AIAgent工程实践
LLatent SpaceLatent Space发布于 4 天前
Poolside AI 的“模型工厂”:从代码模型到 Laguna S

Poolside 联合 CEO Eiso Kant 介绍其模型工厂:小团队如何通过高频实验、数据流式训练和可复现实验,将模型从预训练推进到发布。

440
AIAgent工程实践
440
AIAgent工程实践
LLatent SpaceLatent Space发布于 4 天前
Laguna S 2.1 发布:低价模型、AI 安全与智能体工具链更新

本期聚焦 Laguna S 2.1、OpenAI/Hugging Face 安全事件、Kimi K3 蒸馏争议,以及智能体平台、评测基础设施和模型路由的新进展。

480
AIAgent工程实践
480
AIAgent工程实践
LLatent SpaceLatent Space发布于 5 天前
AI 网络安全升温:从评测失控到专用防御模型

近期 AI 网络安全相关动态密集出现:模型评测环境逃逸、专用安全模型发布、开放权重防御能力争论升温,显示行业关注点正从能力展示转向约束、治理与实战部署。

430
AIAgent工程实践
430
AIAgent工程实践
LLatent SpaceLatent Space发布于 6 天前
AI周末观察:开源权重模型、智能体系统与生产级安全

本期梳理周末AI技术动态:Qwen与Kimi开源权重进展、开放模型安全争议、智能体架构转向,以及长程任务带来的新风险。

450
AIAgent工程实践
450
AIAgent工程实践
LLatent SpaceLatent Space发布于 6 天前
Xaira 的 X-Cell:药物发现需要“因果数据”

Xaira Therapeutics 押注高信息密度的数据生成,用于训练预测细胞扰动反应的模型。其经验显示,模型规模并非唯一瓶颈,数据中的信息量可能决定上限。

430
AIAgent工程实践
430
AIAgent工程实践
LLatent SpaceLatent Space发布于 9 天前
Kimi K3引发开源权重模型热议

Kimi K3发布后,围绕中国开放权重模型、评测表现、推理架构与智能体工作流的讨论迅速升温。

580
AIAgent工程实践
580
AIAgent工程实践
LLatent SpaceLatent Space发布于 11 天前
Thinky 发布开源多模态模型 Inkling

Thinky 推出 Inkling 模型家族:主模型为 975B 总参数、41B 激活参数的 MoE Transformer,支持 100 万 token 上下文,并开放权重。

840
AIAgent工程实践
840
AIAgent工程实践
LLatent SpaceLatent Space发布于 11 天前
未来实验室会像数据中心一样运转吗?

Lila Sciences 试图把湿实验室变成由 AI 与机器人驱动的数据工厂,用大规模实验生成可验证的科学推理数据,探索“科学超级智能”的可能性。

650
AIAgent工程实践
650
AIAgent工程实践
LLatent SpaceLatent Space发布于 12 天前
AI 日报:Codex 使用激增,智能体工程走向执行与可观测

OpenAI 编程智能体使用增长、低比特开源模型、本地推理、实时多模态与世界模型成为近两日 AI 社区讨论重点。

810
AIAgent工程实践
810
AIAgent工程实践
LLatent SpaceLatent Space发布于 13 天前
Codex 活跃用户半年增长超 10 倍

Codex 与 ChatGPT Work 活跃用户数在短时间内从 600 万升至 700 万,年初至今增长约 10 倍。Claude Code 缺少同期更新,二者仍难直接比较。

840
AIAgent工程实践
840
AIAgent工程实践
LLatent SpaceLatent Space发布于 14 天前
GPT-5.6 选项变多,开发者开始感到困惑

GPT-5.6 发布后,普通用户看到的选择较少,但 API 用户面对大量模型变体。社区正在尝试用更简单的分组方式理解 Sol、Terra、Luna 等选项。

550
AIAgent工程实践
550
AIAgent工程实践
CCloudflare AI BlCloudflare AI Bl发布于 14 天前
Precursor:用会话级行为信号识别自动化与智能体流量

Cloudflare 推出 Precursor,通过客户端连续行为信号补充 Bot Management 与 Turnstile,在完整用户会话中识别自动化流量,并尽量减少对正常用户的打扰。

610
AI工程实践云计算开发者
610
AI工程实践云计算开发者
LLatent SpaceLatent Space发布于 17 天前
OpenAI 推出 GPT-5.6:Sol、Terra、Luna 与 Codex 超级应用路线

OpenAI 发布 GPT-5.6 三个尺寸版本,并引入 ultra 推理档位;同时 ChatGPT Work 与 Codex 桌面更新进一步强化其超级应用策略。

860
AIAgent工程实践
860
AIAgent工程实践
LLatent SpaceLatent Space发布于 19 天前
Lilian Weng 梳理 AI 自我改进中的 Harness Engineering

Lilian Weng 新文讨论 harness 与递归自我改进的关系,并梳理 ACE、Meta-Harnesses 等近期研究脉络。

640
AIAgent工程实践
640
AIAgent工程实践
LLatent SpaceLatent Space发布于 21 天前
Autoresearch:自我改进智能体背后的反馈循环

Introspection 联合创始人 Roland Gavrilescu 讨论了 autoresearch、智能体“配方”、内外循环,以及为什么人类仍是自动化软件工厂的重要组成部分。

630
AIAgent工程实践
630
AIAgent工程实践
LLatent SpaceLatent Space发布于 21 天前
自动研究与人类主导权的分歧

在 AI Engineer World’s Fair 上,“自动研究”成为焦点。多位演讲者围绕 AI 代理能否参与系统维护,以及外层决策权是否仍应由人类掌握展开讨论。

620
AIAgent工程实践
620
AIAgent工程实践
LLatent SpaceLatent Space发布于 21 天前
Fable 5 回归,开源编码模型与智能体基础设施继续升温

AI 社区今日重点集中在 Fable 5 重新上线、GLM-5.2 编码生态扩展、智能体记忆与工作流设计,以及面向安全和评测的新型智能体架构。

830
AIAgent工程实践
830
AIAgent工程实践
LLatent SpaceLatent Space发布于 21 天前
反对“一键式”AI设计:技能工程为何需要人的判断

Paul Bakaus 认为,AI 设计代理需要领域知识、设计词汇和人类把控;技能工程的目标不是全自动,而是让人更精准地引导结果。

750
AIAgent工程实践
750
AIAgent工程实践
每日签到未签到

每天签到一次,持续获得积分。

@2024-2027长勺智库浙ICP备2024134526号浙公网安备33011002017958
?
未登录用户

登录后查看个人信息与任务进度。

去登录