愿景与目标
Agent 时代的共赢社区
真正的 AGI 还有十年,Agent 是必经之路,抓住浪潮才能不缺席。
通过深度实践、知识共享与项目协作,拆解技术壁垒,转化为个人优势与实际价值。
赋能每一人,决胜 Agent 十年。
我们提供
- · 系统化学习路径与实践手册
- · 技术导师与行业专家一对一指导
- · 论文笔记、前沿 talk、案例共创
- · 作品集打磨、简历与面试辅导、内推
高阶玩法
深度共创 · 论文/项目/求职全链路
如果你想入门大模型 Agent
- •学习路径与开源仓库推荐
- •入门课 + 实战项目
- •志同道合的交流社区
如果你想进一步合作 / 论文 / 求职
- •论文合作与实验共建
- •产业落地项目合作
- •大厂工作内推与面试辅导
如果你希望寻求合作
- •共建社区品牌
- •联合宣传与活动
- •AI 产品与培训辅导
学习与探索
精心整理的学习资源,助你快速掌握 Agent 核心技术
进阶之路
社区项目 / 论文
Idea2Story
从 idea 自动生成顶会级别论文叙事的 Agent 框架。基于上万篇顶会论文及其 Review 数据训练,让 AI 学会 "Scientific Storytelling"。
Talk & 圆桌会 · 论文精读

系统梳理 World Model in Agentic RL!
作者:Sherry https://www.xiaohongshu.com/user/profile/642d87c90000000011020daf World Model 这个概念其实已经提出很久了,我最近才第一次系统涉猎。虽然大家都在讨论 World Model,但真正试图解决的似乎并不是同一

Kimi K3、Qwen3.8-Max 官方评测都在用!伯克利硬核测试揭穿 AI 自进化假象
TL;DR Auto-Research 系统正在快速发展,但当前多数成功案例建立在一个重要前提上:候选方案可以被廉价、快速、明确地验证。只要评分足够便宜,扩大采样与搜索就能持续提高找到好答案的概率。 真实机器学习研究并不总具备这个条件。完整训练昂贵,反馈存在延迟,单次实验只能提供部分证据。系统不仅要

从 RL 到蒸馏,再到软蒸馏:Why RL Matters?
作者:ybq https://zhuanlan.zhihu.com/p/2067725096886785009 这篇文章简单讨论下 rl 的作用,我们到底该如何理解 rl 在 posttrain 阶段的定位?以及,为什么有时候模型仅仅靠蒸馏就能取得极好的效果呢? 文章系个人观点,未必正确,大家随便看

深度对话!2025 "青稞" AI 嘉年华,与 20+ 位青年科学家一起探讨AI 技术瞬间
本次活动专为青年科学家打造,旨在搭建一场 AI 技术的深度对话,来自学术和工业界的 20+ 青年科学家,将与大家一起回顾 2025,展望 2026!

TRPO重生:大模型时代的信任域策略优化
在大型语言模型的强化学习阶段,特别是RLHF中,我们追求策略的持续优化。本次分享深入探讨TRPO在LLM时代的应用。

从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
深入解析流匹配VLA的强化学习后训练框架π_RL,探索具身智能的前沿技术。

RLinf:面向具身智能的"渲训推一体化"开源强化训练框架
开源强化训练框架RLinf,实现渲染、训练、推理一体化,加速具身智能研发。

RLinf-VLA 实践:从零上手 VLA(OpenVLA)强化学习
手把手教你使用RLinf-VLA框架进行OpenVLA强化学习实践,入门具身智能开发。

深度对话!2025 "青稞" AI 嘉年华,与 20+ 位青年科学家一起探讨AI 技术瞬间
本次活动专为青年科学家打造,旨在搭建一场 AI 技术的深度对话,来自学术和工业界的 20+ 青年科学家,将与大家一起回顾 2025,展望 2026!

TRPO重生:大模型时代的信任域策略优化
在大型语言模型的强化学习阶段,特别是RLHF中,我们追求策略的持续优化。本次分享深入探讨TRPO在LLM时代的应用。

从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
深入解析流匹配VLA的强化学习后训练框架π_RL,探索具身智能的前沿技术。

RLinf:面向具身智能的"渲训推一体化"开源强化训练框架
开源强化训练框架RLinf,实现渲染、训练、推理一体化,加速具身智能研发。

RLinf-VLA 实践:从零上手 VLA(OpenVLA)强化学习
手把手教你使用RLinf-VLA框架进行OpenVLA强化学习实践,入门具身智能开发。
合作 & 咨询
公众号 AgentAlpha
共建社区 / 宣传合作 / AI 产品 / 培训辅导,或需要论文、项目、求职支持,扫码关注公众号了解更多。



